推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片的混合精度训练与推理协同优化.docx

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片的混合精度训练与推理协同优化

摘要

存算一体芯片的模拟计算阵列在推理阶段展现出卓越的能效优势,但在训练阶段面临精度不足的固有困难——模拟计算的低精度(通常4-8bit)难以满足训练过程中对梯度更新精度的严格要求。本文提出了一种面向存算一体芯片的混合精度训练与推理协同优化框架,在训练阶段采用数字域高精度计算与模拟域低精度计算相结合的策略,在推理阶段充分利用模拟计算的高能效优势。通过设计精度感知的量化感知训练算法和梯度补偿机制,实现了训练精度与推理能效的最优平衡。

一、存算一体芯片训练与推理的精度鸿沟

1.1 训练与推理的精度需求差异

神经网络训练与推理对计算精度存在本质差异的需求。推理阶段是对已训练好的模型权重进行前向传播计算,对精度的容忍度相对较高——大量研究表明,8bit甚至4bit量化推理在大多数任务中的精度损失可控制在1%以内。训练阶段则涉及前向传播、反向传播和权重更新三个环节,其中反向传播中的梯度计算对精度极为敏感——梯度的动态范围可达数个数量级,低精度计算导致梯度截断或量化噪声,使模型无法收敛或收敛到次优解。

1.2 模拟计算阵列的精度限制

存算一体芯片的模拟计算阵列在执行乘加运算时,其精度受限于器件特性。典型RRAM交叉阵列的模拟计算精度相当于4-6bit数字计算,低功耗设计下甚至降至2-4bit。这一精度水平在推理阶段可通过量化感知训练等手段补偿,但在训练阶段远远不够——实验表明,使用4bit模拟计算进行梯度更新时,ResNet-50在ImageNet上的Top-1精度从76.1%降至68.3%,损失接近8个百分点。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片的混合精度训练与推理协同优化.docx 39K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载