推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片的多芯粒分布式训练与梯度同步优化.docx

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片的多芯粒分布式训练与梯度同步优化

摘要

随着神经网络模型规模的持续增长,单芯片存算一体芯片的算力已无法满足大模型的训练需求,需要多个存算一体芯片组成分布式训练系统。然而,在分布式训练中,各芯片之间的梯度同步通信开销成为主要瓶颈——在传统All-Reduce方案中,每轮迭代的梯度同步时间可占总训练时间的40%以上。本文针对存算一体芯片的分布式训练场景,提出了一种基于存算一体特性的梯度压缩与异步同步方案,利用存算一体芯片的模拟计算阵列直接在存储域完成梯度聚合,将梯度同步通信量降低90%,训练加速比达到7.2倍(8节点)。

一、分布式训练中的梯度同步瓶颈

1.1 数据并行训练的基本流程

在数据并行分布式训练中,每个工作节点(Worker)持有完整的模型副本,处理不同的数据子集。每轮迭代中,各节点独立计算前向传播和反向传播,得到本地梯度,然后通过All-Reduce通信操作将所有节点的梯度进行平均,最后使用平均梯度更新模型参数。当模型参数量为P、节点数为N时,All-Reduce的通信量为  个参数。对于Llama-70B模型(700亿参数),单次All-Reduce的通信量约为140GB,在25GB/s的带宽下需要5.6秒,远超单次前向-反向计算时间(约1秒)。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片的多芯粒分布式训练与梯度同步优化.docx 38K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载