推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

面向AI推理的存算一体芯片编译器设计与编程模型优化.docx

资料介绍

面向AI推理的存算一体芯片编译器设计与编程模型优化

——从计算图映射到存算一体架构的编译优化技术

引言

存算一体芯片通过消除数据搬运的冯·诺依曼瓶颈,在AI推理中实现了显著的能效提升。然而,存算一体芯片的编程模型与传统CPUGPU存在根本性差异:计算发生在存储阵列内部,数据布局决定了计算效率,而控制流和数据流需要精细的协同调度。编译器作为连接算法和硬件的桥梁,其设计质量直接影响存算一体芯片的易用性和性能。本文系统分析面向AI推理的存算一体芯片编译器设计,探讨编程模型优化和计算图映射技术。

存算一体芯片的编程挑战

硬件抽象层次

存算一体芯片的硬件架构具有以下特征,对编程模型提出了挑战:

1. 存储-计算耦合:计算单元嵌入在存储阵列中,数据布局决定了计算路径,需要将神经网络权重映射到物理存储单元。

2. 模拟/数字混合:模拟MAC计算与数字控制逻辑混合,需要处理模拟计算的精度约束和非理想性。

3. 异构计算单元:存算一体芯片通常包含多种计算单元(如模拟CiM宏单元、数字加速器、RISC-V核),需要统一的任务调度和数据流管理。

编程模型的抽象层次

存算一体芯片的编程模型需要提供合理的抽象层次:

1. 高层次抽象:面向算法工程师,提供类似PyTorchTensorFlowAPI,隐藏硬件细节。

2. 中间层抽象:面向系统工程师,提供计算图和数据流的优化接口。

3. 低层次抽象:面向硬件工程师,提供寄存器级控制接口,实现精确的硬件配置。


部分文件列表

文件名 大小
面向AI推理的存算一体芯片编译器设计与编程模型优化.docx 40K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载