推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向存算一体芯片的模拟计算阵列中多芯片级联与扩展架构设计.docx

资料介绍

面向存算一体芯片的模拟计算阵列中多芯片级联与扩展架构设计

——从单芯片到多芯片的存算一体系统扩展方案

引言

AI大模型推理场景中,单颗存算一体芯片的计算能力和存储容量往往无法满足需求。多芯片级联与扩展技术通过将多个存算一体芯片互联,构建更大规模的存算一体系统,实现计算能力和存储容量的线性扩展。多芯片扩展需要在芯片间高效传输数据,保持计算的一致性,并管理芯片间的负载均衡。本文系统分析面向存算一体芯片的模拟计算阵列中多芯片级联与扩展架构设计。

多芯片扩展的需求

计算能力扩展

AI大模型对计算能力的需求:

1. 模型规模LLaMA-2 70B模型需要约140GB的权重存储,超过单颗存算一体芯片的存储容量。

2. 计算量LLaMA-2 70B模型的前向传播需要约140GFLOPs的计算量,超过单颗芯片的计算能力。

3. 扩展需求:通过多芯片扩展,将模型分片存储在多个芯片上,并行执行计算,满足大模型的需求。

存储容量扩展

AI大模型对存储容量的需求:

1. 权重存储:模型权重需要存储在存算一体阵列中,存储容量需求随模型规模线性增长。

2. KV Cache存储:在推理过程中,KV Cache的存储容量随序列长度线性增长,需要多芯片共享。

3. 中间结果存储:在多层神经网络推理中,中间结果的存储容量需求较大,需要多芯片缓存。


部分文件列表

文件名 大小
面向存算一体芯片的模拟计算阵列中多芯片级联与扩展架构设计.docx 39K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载