分层 Lambda 架构
由批处理层、速度层和服务层组成,可根据部署需求按层复用或替换实现。
用 Lambda 架构构建实时机器学习应用Oryx 2 基于 Apache Spark 和 Apache Kafka,面向实时大规模机器学习应用,提供可分层复用的批处理层、速度层、服务层和数据传输机制,并包含可直接部署的机器学习应用实现。
Oryx 可按层或按功能复用,支持构建自定义机器学习应用,也提供面向常见算法的端到端实现。
由批处理层、速度层和服务层组成,可根据部署需求按层复用或替换实现。
使用 Apache Kafka 主题在外部数据源、批处理层、速度层和服务层之间传输数据、模型及模型更新。
批处理层结合历史数据生成新结果,速度层从数据流中产生增量模型更新。
服务层在内存中维护模型状态,并通过 HTTP REST API 提供同步查询操作,也可接收新数据。
机器学习层支持测试集与训练集选择、超参数尝试和模型评估,并使用 PMML 管理模型序列化。
提供基于 ALS 的协同过滤、基于 k-means 的聚类,以及基于随机决策森林的分类和回归实现。
通过官方文档了解终端用户、开发和管理使用方式,并查看 Javadoc、源码及发行版本。