推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

NV-Shuffle:基于非易失内存的Shuffle机制

更新时间:2019-12-30 13:38:29 大小:3M 上传用户:IC老兵查看TA发布的资源 标签:Shuffle机制 下载积分:1分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

Shuffle是大数据处理过程中一个极为重要的阶段.不同类型的Task(或者Stage)之间通过Shuffle进行数据交换.在Shuffle过程中数据需要进行持久化,以达到避免重计算和容错的目的.因此Shuffle的性能是决定大数据处理性能的关键因素之一.由于传统Shuffle阶段的数据通过磁盘文件系统进行持久化,所以影响Shuffle性能的一个重要因素是I/O开销,尤其是对基于内存计算的大数据处理平台,例如Spark,Shuffle阶段的磁盘I/O可能拖延数据处理的时间.而非易失内存(NVM)具有读写速度快、非易失性以及高密度性等诸多优点,它们为改变大数据处理过程中对磁盘I/O的依赖、克服目前基于内存计算的大数据处理中的I/O性能瓶颈提供了新机会.提出一种基于NVM的Shuffle优化策略——NV-Shuffle.NV-Shuffle摒弃了传统Shuffle阶段采用文件系统的存储方式,而使用类似于Memory访问的方式进行Shuffle数据的存储与管理,避免了文件系统的开销,并充分发挥NVM的优势,从而减少Shuffle阶段的耗时.在Spark平台上实现了NV-Shuffle,实验结果显示,对于Shuffleheavy类型的负载,NV-Shuffle可节省大约10%~40%的执行时间.


部分文件列表

文件名 大小
1577684296NV-Shuffle:基于非易失内存的Shuffle机制.pdf 3M

部分页面预览

(完整内容请下载后查看)
:
DOI10.7544issn10001239 .2018 .20170742  
-
计 算 机 研 究 与 发 展  
?
(): ,  
552 229245 2018  
-
JournalofCom uterResearchandDevelo ment  
ꢀ ꢀ ꢀ ꢀ ꢀ  
p
p
ꢀ
:
基于非易失内存的  
NVShuffle  
机制  
Shuffle  
-
潘锋烽  
熊
劲
ꢀ
ꢀꢀꢀ  
( (  
计算机体系结构国家重点实验室 中国科学院计算技术研究所  
)
ꢀ
)
北京  
100190  
ꢀ
(
)
中国科学院大学 北京  
ꢀ
100049  
ꢀ
(
)
anfenfen ict.ac.cn  
g g@  
p
:
NVShuffle ShuffleBasedonNonVolatileMemor  
-
-
ꢀ
ꢀ ꢀ  
ꢀ
y
PanFenfen andXion Jin  
ꢀ ꢀ  
g
ꢀ
g
g
ꢀ
(
(
StateKe Laborator o Com uterArchitecture Instituteo Com utin Technolo  
ꢀ
,
),  
ChineseAcadem o Sciences  
ꢀ
y f  
ꢀ ꢀ  
ꢀ
ꢀ
y
ꢀ
y f  
ꢀ ꢀ  
p
f
ꢀ
p
g
ꢀ
gy  
)
Beiin 100190  
j g  
(
,
Universit o ChineseAcadem o Sciences Beiin 100049  
ꢀ
)
y f  
ꢀ ꢀ  
y f  
ꢀ ꢀ  
j g  
,
Abstract Inthe oularbi data rocessin latformslikeSark itiscommontocollectdataina  
gp  
ꢀ ꢀ ꢀpp ꢀ g ꢀp ꢀp ꢀ ꢀ ꢀ ꢀ ꢀ ꢀ  
ꢀ
ꢀ
ꢀ
ꢀ
man toman fashiondurin astaetraditionall knownastheShuffle hase.Dataexchaneha ens  
- ꢀ ꢀ ꢀ ꢀ ꢀp ꢀ  
g ꢀ gꢀ y gꢀ pp  
ꢀ
y
-
y
ꢀ
ꢀ
,
acrossdifferentt esoftasksorstaesviaShuffle hase.Anddurin this hase thedataneedtobe  
ꢀyp ꢀ ꢀ ꢀ ꢀ g ꢀ ꢀ ꢀp ꢀp ꢀ ꢀ  
ꢀ
ꢀ
g
ꢀ
ꢀ
ꢀ
,
transferredvianetworkand ersistedintotraditionaldiskbasedfilesstem.Hence theefficienc of  
ꢀ ꢀ ꢀp ꢀy  
ꢀ
ꢀ
ꢀ
ꢀ
-
ꢀ
ꢀ
y
ꢀ
Shuffle haseisoneoftheke factorsinthe erformanceofthebi data rocessin .Inorderto  
ꢀp ꢀ ꢀ ꢀ ꢀ ꢀ y ꢀ ꢀ ꢀp ꢀ ꢀ ꢀ g ꢀp ꢀ ꢀ  
g
ꢀ
ꢀ
,
reducin IO overheads we rooseanotimizedShufflestrate basedon NonVolatile Memor  
ꢀp p ꢀ ꢀp ꢀ ꢀ  
g ? ꢀ gy y  
ꢀ
ꢀ
-
ꢀ
ꢀ
ꢀ
(
NVM  
)—  
( ) ,  
NVShuffle.Next enerationnonvolatile memor NVM technoloies suchasPhase  
ꢀ
-
-
g
-
ꢀ
y
g
ꢀ ꢀ  
(
Chane Memor PCM  
g ꢀ  
),  
(
SinTransfer Torue Manetic Memories STTMs introduce new  
q ꢀ  
)
y
p
-
ꢀ
g
ꢀ
ꢀ
,
,
y
,
o ortunitiesforreducin IOoverhead duetotheirnonvolatilit hihreadwrite erformance low  
pp g? ꢀ gꢀ  
ꢀ ꢀ ꢀ ꢀ ꢀp  
ꢀ
-
?
ꢀ
,
,
ener etc.Inthebi data rocessin latformbasedonmemor com utin suchasSark Shuffle  
gy gp  
ꢀ g ꢀp ꢀ ꢀ ꢀ ꢀp  
ꢀ
ꢀ
y
ꢀ
p
g
ꢀ
ꢀ
ꢀ
,
dataaccessbasedondisksisanim ortantfactorofa lication erformance NVShuffleusesNVMas  
ꢀ ꢀ ꢀ ꢀ ꢀ p ꢀ ꢀpp ꢀp  
ꢀ
ꢀ
ꢀ
-
ꢀ
ꢀ
ꢀ
ersistmemor tostoreShuffledataandem losdirectdataaccesseslikememor b introducin NV  
ꢀ p yꢀ -  
y ꢀ y y  
ꢀ ꢀ  
p
ꢀ
ꢀ
ꢀ
ꢀ
ꢀ
ꢀ
ꢀ
ꢀ
g
ꢀ
ꢀ
Buffertooranizedatainsteadoftraditionalfilesstem.Weim lementedNVShuffleinSark.Our  
ꢀ ꢀ g ꢀ ꢀ ꢀ ꢀ ꢀ ꢀy ꢀ p ꢀ - ꢀ ꢀp  
,
erformanceresultsshow NVshufflereduces obexecutiontimeb 10% 40% forShuffleheav  
y
p
ꢀ
ꢀ
-
ꢀ
ꢀj ꢀ  
ꢀ
ꢀy  
~
ꢀ
-
ꢀ
workloads.  
; ; (  
Ke words bi data rocessin Shuffle NVM nonvolatile memor  
ꢀp  
);  
y
;
nonvolatilebuffer fault  
- ꢀ  
ꢀ
g
ꢀ
g
-
ꢀ
y
ꢀ
tolerance  
(
)
之间通过  
是大数据处理过程中一个极为重要的阶段 不同类型的  
.
或者  
Stae  
g
摘
要
Shuffle  
ꢀ
Task  
ꢀ
,
过程中数据需要进行持久化 以达到避免重计算和容错的目的 因此  
.
进行数据交换 在  
. Shuffle  
Shuffle  
的性能是决定大数据处理性能的关键因素之一 由于传统 阶段的数据通过磁盘文件系  
. Shuffle  
Shuffle  
,
统进行持久化 所以影响  
,
开销 尤其是对基于内存计算的大数据处  
性能的一个重要因素是  
Shuffle  
IO  
?
,
理平台 例如  
,
SarkShuffle  
p
( )  
具有读写  
NVM  
阶段的磁盘  
可能拖延数据处理的时间 而非易失内存  
IO .  
?
:
;
:
修回日期  
2017 12 21  
收稿日期  
- -  
2017 09 29  
-
-
ꢀ
ꢀ
:
基金项目 国家重点研发计划项目  
(
);  
国家自然科学基金项目  
(
)
2016 Y FB1000202  
61379042  
(
)
Thisworkwassu ortedb theNationalKe ResearchandDevelo mentProramofChina 2016 Y FB1000202 andtheNational  
ꢀ pp ꢀy ꢀ y ꢀ ꢀ  
ꢀ
ꢀ
ꢀ
ꢀ
ꢀ
p
ꢀ
g
ꢀ
ꢀ
ꢀ
ꢀ
(
)
NaturalScienceFoundationofChina 61379042 .  
ꢀ ꢀ  
ꢀ
ꢀ
:
通信作者 熊劲  
( )  
xion in ict.ac.cn  
gj @  
ꢀ
,
()  
2018 552  
ꢀ
计算机研究与发展  
230  
、 ,  
速度快 非易失性以及高密度性等诸多优点 它们为改变大数据处理过程中对磁盘  
、
的依赖 克服目  
IO  
?
前基于内存计算的大数据处理中的  
性能瓶颈提供了新机会 提出一种基于  
.
的
NVM Shuffle  
优化策  
IO  
?
———  
,
阶 段 采 用 文 件 系 统 的 存 储 方 式 而 使 用 类 似 于  
Shuffle  
略
摒 弃 了 传 统  
NVShuffle.NVShuffle  
- -  
, ,  
数据的存储与管理 避免了文件系统的开销 并充分发挥 的优  
NVM  
访问的方式进行  
Memor  
Shuffle  
y
,
势 从而减少  
, ,  
实验结果显示 对于  
NVShuffle Shuffle  
阶段的 耗 时 在  
. Sark  
p
平台 上实现了  
Shuffle  
-
-
,
类型的负载  
可节省大约  
的执行时间  
10% 40% .  
~
heav  
NVShuffle  
-
y
; ; ; ;  
非易失内存 非易失缓冲区 容错  
Shuffle  
大数据处理  
关键词  
ꢀ
中图法分类号  
TP316.81.2  
ꢀ
(
,
nonvolatile memor NVM  
y
)
,
大的比例 上述结果表明 即使使用最新的  
.
非 易 失 性 内 存  
文
NVM  
ꢀꢀ  
-
ꢀ
,
,
件系统 其开销也是非常大的 如何高效使用  
.
的出现为解决磁盘性能瓶颈问题提供了新的机会  
NVM  
、
指的是基于内存总线接口 字节寻  
本文中的  
来提升  
阶段的  
IO  
?
性能是当前内存计算使  
NVM  
Shuffle  
,
址的非易失内存 在内存计算的场景下 非易失性内  
.
用
所面临的一个重要问题与挑战  
NVM  
.
存有 着非常 广 泛 的应用 场景 与磁盘 和  
.
相
DRAM  
Table1 PercentaeofTimeSentinFileSstem  
ꢀ ꢀ ꢀ ꢀ ꢀ ꢀ ꢀ  
y
ꢀ
p
g
,
NVM  
:)  
1 NVM  
比
的主要优势有  
有着与  
相
DRAM  
[ ]  
17  
表
文件系统中各个部分的开销比例  
1
ꢀ
,
接近的读写延迟和吞吐率 有望用来消除磁盘  
IO  
?
Function  
PercentaeofTimeSent%  
gꢀ ꢀ ꢀp ?  
ꢀ
,
;)  
开销 提升系统的  
性能  
的存储密度比  
IO  
?
2 NVM  
相似 它能存放  
NANDFlashSSD  
ꢀ ꢀ  
FileSstem  
ꢀy  
60.5  
ꢀ
,
更大 与  
,
DRAM  
MetadataLock  
ꢀ
5.16  
12.46  
9.58  
ꢀ
; )  
相比于内存  
3
, 、  
具备非易失 可  
NVM  
更多的数据  
MetadataU date  
ꢀp  
ꢀ
,
持久化的优势 随着工业界大力发展非易失内存 其  
.
_ _  
Co from user  
py  
ꢀ
,
进展相当迅速  
年 公司推出了搭载  
2013 Micro Flash  
_ _  
Co usernocache  
py  
9.63  
ꢀ
[]  
1
,
与
的
年
DRAM  
H bridDIMM .2014  
y
ꢀ
AiA Tech  
gg ꢀ  
_
Paefault  
g
6.11  
ꢀ
[
]
24  
-
公司 推 出 了  
接 口 的  
与
DDR  
联合推出的  
NVDIMM  
.Intel  
Allocation  
25.63  
ꢀ
[]  
5
接口的  
产品预  
Micro  
DDR  
3DXPoint  
,
年面市  
3D XPoint  
,
闪存速度堪比内存 因  
计
,
2018  
在本 文 中 我 们 提 出 了 一 种 基 于  
的
NVM  
为了最大化发挥  
NVShuffle.  
-
此解决磁盘性能问题的一个较为直接的方式是替换  
———  
优化策略  
Shuffle  
,
存储介质 将传统的磁盘替换成  
,
这样使得内  
,
NVM  
的性能优势  
摒弃了以文件系统  
NVM  
进行  
NVShuffle  
-
,
的性能 与此  
存计算中的数据读写能够获得  
,
数据存 取的 方式 而是 采用持久化 内  
NVM  
Shuffle  
同时也保证了数据的持久化  
.
, ,  
存的方式 直接在用户态访问持久化内存 避免了传  
,
Shuffle  
众所周知  
的性能是决定大数据处理性  
, 、  
路径 例如文件系统 设  
统存储系统中的冗长的  
IO  
?
[
]
69  
-
能的关键因素之一  
由于传统  
.
阶段的数  
Shuffle  
备驱动等  
.
,
据一般是通过磁盘文件系统进行持久化 所以影响  
:
本文的主要贡献如下  
[ ,  
]
71011  
,
-
性 能 的 一 个 重 要 因 素 是  
开 销  
)
利用  
1
Shuffle  
IO  
?
构建  
的持久化内存访问接  
Java  
VM  
p
有助于解决内存计算在  
阶段由于持  
———  
,
接口 使大数据平台能够直接使  
口
NVM  
久化所带来的  
Shuffle  
开销 因此本文将  
NVShuffle  
-
引入到  
;
用与访问  
IO  
?
.
NVM  
NVM  
,
阶 段 中 但 是 由 于  
的 性 能 接 近  
)
针对  
2
提出了一种  
数据的组织  
Shuffle  
NVM  
NVM  
Shuffle  
,
,
有研究工作表明 对于  
现有的系统软  
NVM  
———  
,
方式  
;
够高效处理并发 故障 网络传输等方面的问题  
基于  
的私有持久化缓冲区 从而能  
DRAM  
Hash  
(
) ,  
文件系统 开销过高 不能充分发挥  
件
、
、
NVM  
NVM  
[
1215  
-
]
[ ]  
16  
的性能  
表
. 1  
展示了在压缩  
过程中文件系统  
)
针对 传 统  
3
阶 段 预 先 创 建 文 件 的 问  
Shuffle  
[ ]  
17  
,
题 提出一种符合  
———  
各个部分的开销比例  
空间自身的分配策略  
.
NVM  
,
从表 可以看出 大约  
1
,
;
的空间利用率  
的时间花费在了  
延迟分配 从而能够提升  
60.5%  
NVM  
数据的读取与恢复 通过使用  
Shuffle  
,
文件系统上 其中关于元数据的开销依然占据着较  
)
4
,
对于  

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载