推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

Spark自带的分布式机器学习库

更新时间:2026-06-19 20:36:18 大小:17K 上传用户:江岚查看TA发布的资源 标签:spark机器学习 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

一、Spark机器学习库发展历程

Spark生态中自带的机器学习库从诞生至今经历了两次重要的架构迭代,形成了目前并行存在但发展方向明确的两个库:RDD基础的MLlibDataFrame基础的ML。早期Spark 0.8版本就引入了MLlib作为原生分布式机器学习库,基于Spark核心的弹性分布式数据集(RDD)构建,支持基础的分类、回归、聚类等算法实现。随着Spark SQLDataFrame数据集抽象的普及,Spark 1.2版本开始推出基于DataFrame API的新一代机器学习库ML,也被称为Pipeline版本,在Spark 2.0之后成为官方推荐的主流开发库,原RDDMLlib进入维护阶段,不再添加新功能。

两种库的核心差异源自底层数据抽象:MLlib基于RDD,适合底层定制化开发;ML基于DataFrame/Dataset,能够复用Spark SQL的优化引擎,支持更加友好的流水线API,更适合生产环境的机器学习工程落地。目前Spark生态同时维护两个库,用户可以根据自身场景选择合适的实现方案。

二、MLlib核心功能模块

MLlib作为Spark最早的分布式机器学习库,提供了覆盖全机器学习流程的工具集,核心可以分为六大功能模块:

1. 基础统计工具

· 概括统计:支持计算分布式数据集的最小值、最大值、均值、方差、协方差、皮尔逊相关系数、斯皮尔曼相关系数等统计量,无需将全量数据聚合到单个节点

· 假设检验:支持卡方检验、双样本t检验等常用假设检验方法,支持针对特征分布、特征独立性的检验

· 频率统计:支持计算词频、逆文档频率(TF-IDF),用于文本特征工程,支持大规模语料的分布式计算

· 采样与随机数据生成:支持分层采样、简单随机采样,能够生成符合指定分布的随机数据集用于模型测试


部分文件列表

文件名 大小
Spark自带的分布式机器学习库.docx 17K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载