推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

大模型缩放定律新范式—从Chinchilla到T²的训推联合优化.docx

更新时间:2026-09-12 10:42:55 大小:38K 上传用户:烟雨查看TA发布的资源 标签:大模型缩放定律Chinchilla训推联合优化 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

大模型缩放定律新范式——Chinchilla的训推联合优化

——2026年缩放定律理论进展与训推联合优化技术全景

一、引言

缩放定律(Scaling Law)是指导大模型训练的核心理论。Chinchilla定律告诉我们,在固定计算预算下,模型参数和训练数据量应按比例扩展。但2026年,随着测试时扩展(TTS)技术的兴起,传统缩放定律面临根本性挑战——它从未考虑推理阶段的计算成本。Train-to-Test)缩放定律的提出,首次将推理时计算纳入统一的优化框架,揭示了一个反直觉的结论:在固定总预算下,最优策略是大幅"过训练"模型,而非遵循Chinchilla的比例。本文系统梳理缩放定律的理论演进和最新进展。

二、经典缩放定律

2.1 Kaplan Scaling Law2020

OpenAIKaplan等人发现,模型性能与参数规模、数据量和计算量之间存在幂律关系。在计算预算固定时,增加参数比增加数据更有效。

2.2 Chinchilla Scaling Law2022

DeepMindChinchilla定律修正了Kaplan的结论:在计算预算固定时,模型参数和训练数据应同步扩展,即"20倍法则"——参数每增加1倍,训练数据也应增加1倍。Chinchilla定律成为后续所有大模型训练的标准指引。


部分文件列表

文件名 大小
大模型缩放定律新范式—从Chinchilla到T²的训推联合优化.docx 38K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21下载积分 打赏65.00元   3天前

    用户:xzxbybd

  • 21下载积分 打赏60.00元   3天前

    用户:jh0355

  • 21下载积分 打赏60.00元   3天前

    用户:w178191520

  • 21下载积分 打赏20.00元   3天前

    用户:jh03551

  • 21下载积分 打赏20.00元   3天前

    用户:sun2152

  • 21下载积分 打赏20.00元   3天前

    用户:kk1957135547

  • 21下载积分 打赏25.00元   3天前

    用户:w1966891335

  • 21下载积分 打赏20.00元   3天前

    用户:xuzhen1

  • 21下载积分 打赏15.00元   3天前

    用户:x15580286248

  • 21下载积分 打赏25.00元   3天前

    用户:pcb

  • 21下载积分 打赏20.00元   3天前

    用户:bhacker

  • 21下载积分 打赏15.00元   3天前

    用户:liqiang9090

  • 21下载积分 打赏25.00元   3天前

    用户:有理想666

  • 21下载积分 打赏15.00元   3天前

    用户:godbox

  • 21下载积分 打赏15.00元   3天前

    用户:aetek

  • 21下载积分 打赏5.00元   3天前

    用户:mulanhk

  • 21下载积分 打赏5.00元   3天前

    用户:JuneLin61

  • 21下载积分 打赏5.00元   3天前

    用户:ccc6188

  • 21下载积分 打赏5.00元   3天前

    用户:木集盒

推荐下载