推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

AWS Inferentia 解析.docx

资料介绍

AWS Inferentia 解析

基本定义

AWS Inferentia是亚马逊云科技(Amazon Web Services)推出的专为机器学习推理场景定制的自研芯片,旨在降低大规模部署机器学习模型的推理成本,同时提升推理性能与吞吐量,主要用于云端AI推理 workload,支撑计算机视觉、自然语言处理、推荐系统等各类AI应用的在线推理需求。

核心定位与设计目标

AWS Inferentia的核心设计围绕机器学习推理场景优化,和通用CPU、GPU相比,其核心目标有三点:

1. 降低推理成本:对比传统通用计算硬件,针对推理场景做架构剪裁,去掉训练场景不必要的计算单元,在保证推理性能的前提下降低单位吞吐量的硬件成本,进而降低用户部署AI应用的总体拥有成本。

2. 提升推理吞吐量与延迟表现:针对推理常见的batch size偏小、低延迟要求做硬件优化,能够在满足应用延迟要求的前提下,支撑更高的并发推理请求,提升单设备的服务能力。

3. 无缝适配AWS生态与主流框架:无需用户做大量自定义模型改造,就能和AWS现有的机器学习服务(如Amazon SageMaker)、主流深度学习框架(TensorFlow、PyTorch)兼容,降低用户的迁移与部署门槛。

产品迭代

目前AWS Inferentia已经推出两代产品:

1. Inferentia1:第一代产品,基于16nm工艺打造,单芯片支持最高INT8精度下128 TOPS的算力,支持FP16、BF16精度,单AWS EC2 Inf1实例可配置最多4块Inferentia1芯片,适合中大规模推理部署场景。

2. Inferentia2:第二代产品,基于台积电7nm工艺升级,单芯片算力提升到INT8精度下384 TOPS,相比第一代提升3倍,同时支持更高的内存带宽,单EC2 Inf2实例可配置最多12块Inferentia2芯片,还支持模型并行分片部署,能够适配更大参数规模的大语言模型推理,相比前代吞吐量提升4倍,推理延迟降低一半,单位推理成本比GPU低上50%以上。


部分文件列表

文件名 大小
AWS_Inferentia_解析.docx 15K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏60.00元   3天前

    用户:gsy幸运

  • 21下载积分 打赏70.00元   3天前

    用户:铁蛋锅

  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

推荐下载