- 1
- 2
- 3
- 4
- 5
大模型缩放定律新范式—从Chinchilla到T²的训推联合优化.docx
资料介绍
大模型缩放定律新范式——从Chinchilla到T²的训推联合优化
——2026年缩放定律理论进展与训推联合优化技术全景
一、引言
缩放定律(Scaling Law)是指导大模型训练的核心理论。Chinchilla定律告诉我们,在固定计算预算下,模型参数和训练数据量应按比例扩展。但2026年,随着测试时扩展(TTS)技术的兴起,传统缩放定律面临根本性挑战——它从未考虑推理阶段的计算成本。T²(Train-to-Test)缩放定律的提出,首次将推理时计算纳入统一的优化框架,揭示了一个反直觉的结论:在固定总预算下,最优策略是大幅"过训练"模型,而非遵循Chinchilla的比例。本文系统梳理缩放定律的理论演进和最新进展。
二、经典缩放定律
2.1 Kaplan Scaling Law(2020)
OpenAI的Kaplan等人发现,模型性能与参数规模、数据量和计算量之间存在幂律关系。在计算预算固定时,增加参数比增加数据更有效。
2.2 Chinchilla Scaling Law(2022)
DeepMind的Chinchilla定律修正了Kaplan的结论:在计算预算固定时,模型参数和训练数据应同步扩展,即"20倍法则"——参数每增加1倍,训练数据也应增加1倍。Chinchilla定律成为后续所有大模型训练的标准指引。
部分文件列表
| 文件名 | 大小 |
| 大模型缩放定律新范式—从Chinchilla到T²的训推联合优化.docx | 38K |
最新上传
-
emlimei 打赏1.00元 14小时前
-
21ic小能手 打赏5.00元 1天前
-
21ic小能手 打赏3.00元 1天前
资料:低频功率放大器的设计.
-
21ic小能手 打赏3.00元 1天前
-
21ic小能手 打赏3.00元 1天前
-
21ic小能手 打赏3.00元 1天前
-
21ic小能手 打赏3.00元 1天前
-
21ic小能手 打赏5.00元 3天前
资料:51单片机数字频率计
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
13573902396 打赏1.00元 3天前
-
21下载积分 打赏310.00元 3天前
用户:江岚
-
21下载积分 打赏310.00元 3天前
用户:潇潇江南
-
21下载积分 打赏60.00元 3天前
用户:他山之石可攻玉
-
21下载积分 打赏310.00元 3天前
用户:小猫做电路
-
21下载积分 打赏210.00元 3天前
用户:zhengdai
-
21下载积分 打赏210.00元 3天前
用户:w993263495
-
21下载积分 打赏10.00元 3天前
用户:烟雨
-
21下载积分 打赏60.00元 3天前
用户:gsy幸运
-
21下载积分 打赏70.00元 3天前
用户:铁蛋锅
-
21下载积分 打赏65.00元 3天前
用户:xzxbybd
-
21下载积分 打赏60.00元 3天前
用户:jh0355
-
21下载积分 打赏60.00元 3天前
用户:w178191520
-
21下载积分 打赏20.00元 3天前
用户:jh03551
-
21下载积分 打赏20.00元 3天前
用户:sun2152
-
21下载积分 打赏20.00元 3天前
用户:kk1957135547
-
21下载积分 打赏25.00元 3天前
用户:w1966891335
-
21下载积分 打赏20.00元 3天前
用户:xuzhen1
-
21下载积分 打赏15.00元 3天前
用户:x15580286248
-
21下载积分 打赏25.00元 3天前
用户:pcb
-
21下载积分 打赏20.00元 3天前
用户:bhacker
-
21下载积分 打赏15.00元 3天前
用户:liqiang9090
-
21下载积分 打赏25.00元 3天前
用户:有理想666
-
21下载积分 打赏15.00元 3天前
用户:godbox
-
21下载积分 打赏15.00元 3天前
用户:aetek
-
21下载积分 打赏5.00元 3天前
用户:mulanhk
-
21下载积分 打赏5.00元 3天前
用户:JuneLin61
-
21下载积分 打赏5.00元 3天前
用户:ccc6188
-
21下载积分 打赏5.00元 3天前
用户:木集盒




全部评论(0)