推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中存算一体芯片与数字加速器的性能对比与协同计算.docx

资料介绍

面向存算一体芯片的模拟计算阵列中存算一体芯片与数字加速器的性能对比与协同计算

——从能效比到延迟的存算一体与GPU/TPU性能评估

引言

存算一体芯片和数字加速器(GPUTPU)是AI推理的两种主要技术路线。存算一体芯片通过消除数据搬运的冯·诺依曼瓶颈,在能效比方面具有优势。数字加速器通过并行计算和高精度计算,在精度和灵活性方面具有优势。在AI推理场景中,存算一体芯片和数字加速器各有优劣,协同计算可以发挥各自的优势。本文系统分析面向存算一体芯片的模拟计算阵列中存算一体芯片与数字加速器的性能对比与协同计算方案。

性能对比

能效比

存算一体芯片与数字加速器的能效比对比:

1. 存算一体芯片:在INT8精度下,存算一体芯片的能效比约10 TOPS/W100 TOPS/W,取决于阵列尺寸和工艺节点。

2. GPU:在INT8精度下,GPU的能效比约1 TOPS/W10 TOPS/W,取决于架构和工艺节点。

3. TPU:在INT8精度下,TPU的能效比约5 TOPS/W20 TOPS/W,取决于架构和工艺节点。

计算延迟

存算一体芯片与数字加速器的计算延迟对比:

1. 存算一体芯片:在小型模型推理中,存算一体芯片的延迟约1μs10μs,数据搬运延迟低。

2. GPU:在小型模型推理中,GPU的延迟约10μs100μs,数据搬运延迟高。

3. TPU:在小型模型推理中,TPU的延迟约5μs50μs,数据搬运延迟中等。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中存算一体芯片与数字加速器的性能对比与协同计算.docx 38K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏310.00元   3天前

    用户:江岚

  • 21下载积分 打赏310.00元   3天前

    用户:潇潇江南

  • 21下载积分 打赏60.00元   3天前

    用户:他山之石可攻玉

  • 21下载积分 打赏310.00元   3天前

    用户:小猫做电路

  • 21下载积分 打赏210.00元   3天前

    用户:zhengdai

  • 21下载积分 打赏210.00元   3天前

    用户:w993263495

  • 21下载积分 打赏10.00元   3天前

    用户:烟雨

  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

推荐下载