推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

大模型推理实测之国产GPU三种推理技术路线TCO与每Token推理成本全面对比.docx

更新时间:2026-10-06 13:03:33 大小:38K 上传用户:烟雨查看TA发布的资源 标签:大模型推理国产GPUTCO每Token推理成本昇腾950PR 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

大模型推理实测之国产GPU三种推理技术路线TCO与每Token推理成本全面对比

测试背景

2026年,推理算力需求已占全部AI计算的三分之二以上。国产芯片形成三条技术路线:推理专用SRAM(曲速科技)、全栈自研NPU(华为昇腾)、通用GPU(寒武纪/海光/昆仑芯/摩尔线程)。本节从TCO和每Token推理成本两个核心维度进行量化对比。

DeepSeek V4-Flash在昇腾950PR上的每百万Token输出定价为0.28美元,是GPT-4o的1/107。昆仑芯P800处理百万Token的推理成本已降至几元级别,而H20方案成本在数十元级别。

单位成本下的性价比

昇腾950PR单位FP4算力成本为约4.5万元/PFLOPS(7万/1.56 PFLOPS),优于H20的约3.4万元/PFLOPS(约10万/0.296 PFLOPS),基于峰值算力/价格比约1.32倍。在推理吞吐/价格比上优势更显著:950PR的FP4推理性能约3倍于H20。

昆仑芯P800同等算力成本仅为国际大厂的60%。招商银行采用P800集群后推理成本降低95%。

曲速Polaris-H通过Token工厂模式,按Token使用量付费,降低推理算力使用门槛。

TCO综合对比


部分文件列表

文件名 大小
265-大模型推理实测之国产GPU三种推理技术路线TCO与每Token推理成本全面对比.docx 38K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载