scaling-law
三个自变量
| 变量 | 含义 | 类比 |
|---|---|---|
| 参数量 N | 模型的容量 | 「脑容量」 |
| 数据量 D | 训练喂入的 token 数 | 「阅读量」 |
| 算力 C | 前两者的乘积再乘常数 | ≈ 训练成本 |
两篇奠基之作(这里有个「打脸」故事)
| 工作 | 核心结论 |
|---|---|
| Kaplan et al. 2020(OpenAI) | 首次系统给出幂律公式:loss 与 N、D、C 各自呈平滑幂律关系。主张优先堆大模型 → 直接催生 GPT-3 路线 |
| Chinchilla 2022(DeepMind) | 打脸修正:同样算力下应等比放大模型与数据(约每参数配 20 token)。「中等模型 + 海量数据」比「巨大模型 + 数据不足」更划算 —— 70B 的 Chinchilla 打赢了 280B 的 GPT-3 |
可复用的判断:当一个领域出现「只要加 X 就能变强」的经验规律时,先问「比例关系对不对」。 Chinchilla 的价值不在于推翻 scaling,而在于指出两个变量必须配比,单堆一个会浪费算力。
后续演化
- 推理时扩展(test-time compute):o1/o3 路线发现「让模型多想一会儿」(生成更多思考 token)也服从类似规律 —— scaling 从训练阶段延伸到推理阶段
- 涌现能力(emergent abilities)争议:小模型完全不会、大模型突然会的能力(如多步推理)是否真实,还是评测指标造成的假象,学界至今有争论
- 数据墙(data wall):互联网高质量文本接近用尽,纯堆 D 遇到物理上限,合成数据成为新战场
为什么产品人要懂
它把「做更强的模型」从玄学变成可预算的工程问题 —— 花多少钱、买多少卡、换多少能力提升,可以提前估算。
这也解释了行业叙事的转向:预训练 scaling 边际收益递减后,大家去找新的 scaling 维度(推理时算力、Agent 工作流、工具调用),而不是继续堆参数。
相关
- 多账号模型路由机制 — 模型能力之外的工程约束
- 技术性通缩与经济学通缩 —— 技术规律的边界与代价