scaling-law

**结论:模型能力随「参数 / 数据 / 算力」的投入而可预测地提升** —— 沿一条平滑的幂律曲线下降,几乎不会失灵。这是整个 AI 行业「大力出奇迹」信仰的数学基础。

三个自变量

变量含义类比
参数量 N模型的容量「脑容量」
数据量 D训练喂入的 token 数「阅读量」
算力 C前两者的乘积再乘常数≈ 训练成本

两篇奠基之作(这里有个「打脸」故事)

工作核心结论
Kaplan et al. 2020(OpenAI)首次系统给出幂律公式:loss 与 N、D、C 各自呈平滑幂律关系。主张优先堆大模型 → 直接催生 GPT-3 路线
Chinchilla 2022(DeepMind)打脸修正:同样算力下应等比放大模型与数据(约每参数配 20 token)。「中等模型 + 海量数据」比「巨大模型 + 数据不足」更划算 —— 70B 的 Chinchilla 打赢了 280B 的 GPT-3

可复用的判断:当一个领域出现「只要加 X 就能变强」的经验规律时,先问「比例关系对不对」。 Chinchilla 的价值不在于推翻 scaling,而在于指出两个变量必须配比,单堆一个会浪费算力。

后续演化

  • 推理时扩展(test-time compute):o1/o3 路线发现「让模型多想一会儿」(生成更多思考 token)也服从类似规律 —— scaling 从训练阶段延伸到推理阶段
  • 涌现能力(emergent abilities)争议:小模型完全不会、大模型突然会的能力(如多步推理)是否真实,还是评测指标造成的假象,学界至今有争论
  • 数据墙(data wall):互联网高质量文本接近用尽,纯堆 D 遇到物理上限,合成数据成为新战场

为什么产品人要懂

它把「做更强的模型」从玄学变成可预算的工程问题 —— 花多少钱、买多少卡、换多少能力提升,可以提前估算。

这也解释了行业叙事的转向:预训练 scaling 边际收益递减后,大家去找新的 scaling 维度(推理时算力、Agent 工作流、工具调用),而不是继续堆参数。

相关