推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在边缘计算中的联邦学习加速.docx

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在边缘计算中的联邦学习加速

摘要

联邦学习通过在多个边缘设备上本地训练模型、仅共享模型更新的方式,在保护数据隐私的同时实现了协同学习。然而,边缘设备的计算和存储资源有限,联邦学习的本地训练和模型更新通信带来了显著的功耗和延迟开销。本文针对边缘联邦学习的加速需求,设计了一种面向存算一体芯片的联邦学习加速方案,通过存内梯度更新将训练功耗降低90%,通过稀疏化梯度压缩将通信量降低99%,在10个边缘设备的联邦学习系统中,模型精度达到集中式训练的98%以上,为存算一体芯片在隐私保护分布式学习中的应用提供了高效方案。

一、边缘联邦学习的挑战

1.1 本地训练功耗

在边缘设备上训练神经网络模型(如MobileNet-V2),单轮训练功耗约为数毫瓦时,对于电池供电的设备,训练功耗是主要制约因素。

1.2 通信开销

联邦学习每轮需要上传模型梯度(或权重增量),对于MobileNet-V2(约350万参数),每轮通信量约为14MB。

二、存算一体联邦学习加速方案

2.1 存内梯度更新

在存算一体芯片中,梯度更新直接在RRAM阵列中完成。梯度值转换为编程脉冲,直接施加在RRAM器件上,实现权重的原位更新。梯度更新的功耗从传统方案的100nJ/参数降低至1nJ/参数,降低99%。

2.2 稀疏化梯度压缩

在存算阵列中直接进行梯度稀疏化,只保留绝对值最大的1%的梯度值,通信量从14MB降低至140KB。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片的存算一体芯片在边缘计算中的联邦学习加速.docx 37K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载