← 卡片墙 / Scaling Law for AI Large Models · 大模型 Scaling Law 全景
AI Research · 2026 Edition

大模型的 Scaling Law
从经验法则到新范式

为什么把模型做大、数据做多、算力堆高,能力就跟着涨?这份资料追踪从 Kaplan 2020o1 / DeepSeek-R1 的整个 scaling 故事线——幂律瓶颈转向


为什么工程师和研究者必须知道 Scaling Law

三件事,是研究者和工程师都必须知道 Scaling Law 的理由。

这份资料沿着四条主线展开:理论基线(Kaplan → Chinchilla)、Frontier 模型的工程实证(GPT / LLaMA / DeepSeek / Claude / Gemini)、瓶颈与争议(Data Wall / Marginal Returns / Emergence / Training Plateau)、以及 Inference Scaling(Snell 2024 / o1 / o3 / DeepSeek-R1)。

PART 01 · THEORY

理论基础:损失随规模按幂律下降

经验规律,而非物理定律——但跨越 8 个数量级的算力仍可拟合为同一族曲线。Kaplan et al., 2020 首次系统刻画了三条 power law:在 transformer 语言模型上,把 loss 与参数量、训练 tokens、训练 FLOPs 三个轴分别拟合,跨越 7 个数量级模型规模、8 个数量级算力,误差可预测。

三条 power law 的形式

核心观察:三者的关系在 log-log 坐标中是直线,意味着没有"奇迹阈值"。同时 α_D > α_N——同样倍数,数据比参数更"陡"。

# Kaplan et al. (2020) — three independent power laws

L(N)  =  E_N + (N_c / N) ^ α_N         # 参数量
       └ measured:  α_N ≈ 0.076

L(D)  =  E_D + (D_c / D) ^ α_D         # 训练 tokens
       └ measured:  α_D ≈ 0.095

L(C)  =  E_C + (C_c / C) ^ α_C         # 训练 FLOPs
       └ measured:  α_C ≈ 0.050

# 关键不等式:  α_D  >  α_N  >  α_C
# 含义: 等倍投入下, 数据带来的 loss 下降最大, 算力综合最低.

α 越大,收益衰减越慢——数据 + 算力的回报比参数更高。

直觉上,斜率 −0.05 的直线(对 C) vs 斜率 −0.10 的直线(对 D):增加一阶 token 几乎能"独立"贡献。所以后 Kaplan 时代的 frontier 模型都走向"深 token 数据"路线。

幂律意味着没有奇迹阈值

"涌现"这个词在 power law 面前需要重新审定。幂律带来四点推论:

10²⁵ FLOPs 10²² FLOPs Loss
Loss vs Compute 在 log-log 上是一条直线 —— 幂律的连续性保证了"预测"而非"等待涌现"。

数学骨架是 log L = −α · log C + const。Kaplan 留下的两个 open problem:(1)三个变量分开变化,但实际只能耦合——它没有给出耦合策略;(2)假设"参数越多越好",却没有回答"给定 C 多少才够"。两年后 DeepMind 的 Chinchilla (2022) 回答了这两个问题,并刷新了 compute-optimal 的基线。

一句话小结

Scaling Law 不是信仰,而是 log-log 图上的直线:连续、可外推、永远递减、且数据回报高于参数。

PART 02 · COMPUTE-OPTIMAL

Chinchilla 2022:把"N 应该多大"换成"C 怎么分配"

Hoffmann et al., DeepMind, 2022 · arXiv:2203.15556。Kaplan 单独变化一个变量做拟合。Chinchilla 重新框定问题:在固定训练算力预算 C,同时优化 ND 的分配,使 loss 最小。

问题重构与三处关键修正

  1. 从单变量到联合优化从 Kaplan 的单变量拟合变为约束优化:min L(N, D) s.t. C(N, D) = budget
  2. 比例修正Kaplan 暗示 N 单向 scaling 即可;Chinchilla 给出 ND同步增长
  3. 常量 G提炼出总预算的标度常数 G,可以直接根据 C 给出最佳 N 与 D。

Kaplan 时期的旗舰模型 GPT-3 (175B / 300B tokens) 和 Gopher (280B / 2.3B tokens)——都严重欠训。

结论的杀伤力就在这里:Chinchilla (70B) 在与 Gopher (280B) 相同的算力预算上训练出更小但数据更多的模型——以 1/4 参数反超 Gopher,同时推理成本仅为后者的 1/4。

N 与 D 同步增长,比例约 1 : 1

给定训练算力 C,最优参数与数据均以 C^0.50 增长。

# Chinchilla-optimal scaling

N_opt  =  G · C^a         # 模型参数
D_opt  =  G⁻¹ · C^b       # 训练 tokens

# 拟合来自 Chinchilla 实验:
#  a ≈ 0.50         b ≈ 0.50

# 常量 G (token-per-param):
  G  ≈  3.2 × 10⁸  tokens · param^0.5

含义:算力预算翻 10×,参数量、数据量各翻 ~3.16×10^0.50)。Chinchilla 报告中实际训出的 D/N ≈ 20——把这个数写成经验法则,是 compute-optimal 训练的近似。

经验法则 · 20 tokens / param

compute-optimal 训练下,每个参数对应 20 个训练 tokens。这个数字决定训练预算的分配。

模型规模 NChinchilla-Optimal Tokens换算与说明实际示例
1B~20B中小型实验常用规模GPT-2 / Pythia-1B
7B~140B开源主流起步规模LLaMA-1 7B / Qwen2-7B
13B~260B单 GPU 集群友好上限LLaMA-1 13B
70B~1.4TChinchilla 原论文训出的量级LLaMA-1 65B (1.4T)
405B~8.1TLLaMA-3.1 训练数据接近该值LLaMA-3.1 405B (15.6T)
1T~20T理论满算最优训练公开样本 ≈ 一例

Over-training 反转:小模型 + 多数据 的胜利

推理成本高于训练成本 时,让数据"溢出" Chinchilla-Optimal 反而是最优策略。

实用工程上看一个扩展的标度问题:min TC(N, D) + λ · RI(N),其中 TC = 训练成本,RI = 总推理成本,λ = 每秒每推理 call 的预算权重。LLaMA 取的是大 λ:推理便宜是产品关键。

一句话小结

Chinchilla 给定 C 的最优基线是 N : D = 1 : 1、20 tokens/param;但产业部署常常 over-train——训练最优与部署最优是两个问题。

PART 03 · FRONTIER MODELS

Frontier 模型:六年间参数 × 算力 × 数据 的三轴

Scaling Law 真的奏效了吗?从 GPT-3 到 DeepSeek-R1,看 frontier 如何把幂律变成工程预算。数据来自各模型技术报告、公开发布与社区估算。* 标注为估算值。

模型年份参数量训练 tokens关键选择
GPT-32020175B 稠密~300Bin-context learning, dense Transformer
GPT-4 *2023~1.8T MoE (~280B active)~13T推理为王 · 多模态输入
LLaMA-1 65B202365B 稠密1.4Tover-train 路线, 开源范式
LLaMA-2 70B202370B 稠密2T+ RLHF, 长上下文 4K
LLaMA-3.1 405B2024405B 稠密15.6T几乎所有指标最优开源
DeepSeek-V32024671B MoE (37B active)14.8TFP8 + MLA + 极致 MoE
Claude 3 Opus *2024未披露未披露RLAIF / Constitutional AI, 200K ctx
Gemini 1.5 Pro2024未披露 MoE未披露1M-2M context · 多模态

研读建议:关注每行的"关键选择"列——参数 vs 数据的组合策略,比单纯的总量更能预测推理能力。

GPT-3 → GPT-4:一个数量级参数、两个数量级数据

MoE 是把"等效参数大"与"推理成本低"兼得的关键设计。

LLaMA 系列:开源范式 · 数据上限比参数上限重要

LLaMA 每代 tokens 增长 ≈ 5-7×,参数增长保守,实测效果对齐 Chinchilla 计算值。

版本最大参数量训练 tokens对比 Chinchilla
LLaMA-165B1.4T几乎 Chinchilla-optimal (~21 tok/param)
LLaMA-270B2Tover-train (28 tok/param) — RLHF 加持
LLaMA-370B15T重度 over-train (~214 tok/param) — 部署取向
LLaMA-3.1405B15.6T开源最大稠密, 接近 Chinchilla-optimal (38 tok/param)

关键决策:Meta 的 RLHF + 长上下文 + 安全微调作为"附加 scaling"。这组 scaling 不是 loss,而是能力本身——可以看作第二阶 scaling。产业含义:开源社区在相同推理预算下赶上闭源——证明 Chinchilla + 高质量数据 + post-training,可以复现 80-90% 的 frontier 能力。

DeepSeek:MoE 极致 + 纯 RL 推理

两条路线同公司同月推出——一是工程效率极致,二是验证 inference scaling。

同一公司同时验证:训练 scaling 已经撞到成本墙,于是同步试点推理 scaling——从"参数 + 数据"扩展为"参数 + 数据 + 推理算力"。

闭源双路径:Anthropic 与 Google

参数 / tokens 未披露,但可从上下文窗口、架构走向与产业线索推演。

对比启示:Anthropic 强调训练后流水线与 tool-use 工具,Google 把上下文窗口当显式 scaling。两种都以"参数 + 数据 + 第三维"再立柱——下文给出总图。

Scaling Law 的三阶段:参数 → 数据 → 推理

每代主轴 18-24 月切换一次——主轴不只是工程惯例,而是 power law 系数驱动的最优 trade。

记住三组数量级

六年间 frontier 模型发布速度大约匹配"每 6-9 月一代",这背后的标度增量稳定可复现:

三个数字彼此错位,数据比参数涨得快 → 高质量文本被快速榨干 → 必然滑向推理侧(frontier 视角)。从工程师视角看,每一次翻倍都意味着训练算力 4× 起步,配套的存储 / 网络 / 调度代码同步升级。Team 资源 vs gain 的 trade 全表需要重估。

一句话小结

Frontier 把幂律变成工程预算:参数与数据之后,长上下文、post-training、推理算力都在变成新的 scaling 轴。

PART 04 · LIMITS & DISPUTES

瓶颈与争议:Scaling Law 真的会一直成立吗?

Data Wall · Marginal Returns · Emergent Mirage · Training Plateau——四个角度看 scaling 在哪里开始失效。

Data Wall · 高质量文本将在 ~2026 耗尽

Villalobos, Ho, Sevilla et al., Epoch AI, 2024。待发表的 frontier 算力增长需要更多数据,而真实数据的供给没跟上。三个重要日期:

四条突围路径:

  1. 合成数据模型自生成再过滤;存在 model collapse 风险。
  2. 多模态嵌入视频 / 音频 / 代码 / 表格扩大可标度池。
  3. Self-play RLAlphaZero / AlphaProof 路径。
  4. Agent trajectory模型与环境交互生成的 experience 作为新数据。
推演 · 来自 Villalobos et al. (2024)

"如果 scaling law 倒推需要 100× 当前数据,而人类文本供给曲线只能多贡献 5×,剩下的 20× 必须从机器生成中获取。"

10²⁵ FLOPs 之后,曲线变平

幂律还在成立,但 α 在变小,训练的 $ / benchmark point 不断上升。同样的 10× 算力,曲线末尾换来的 loss 增量仅为头部的 ~1/3

chinchilla 10²⁵ FLOPs Loss
Loss 曲线变平:同样的 10× 算力,曲线末尾换来的 loss 增量仅为头部的 ~1/3。

所以 frontier-lab 在 2024 后同时押"参数 / 数据"与"推理"。纯训练 scaling 的 ROI 报表出现拐点——这是一个"supply 曲线 vs demand 曲线"的失败:投入上升,gain 递减。

"涌现能力"是海市蜃楼吗?

Schaeffer, Miranda, Koyejo · NeurIPS 2023 Outstanding Paper · arXiv:2304.15083

主张:很多被报告为 "emergent" 的能力(锐变)——是离散指标的人为结果,而不是底层能力真的锐变。例子:MMLU 4-选项多选、BIG-Bench hard 任务,

锐变消失,曲线连续。两个经典复现实验:

Schaeffer et al. 2023, paraphrase

"我们不是否认能力突然变强——我们是否认度量出的那个变化是真实存在。"

三个方法论教训

即使涌现锐变是度量伪影,scaling 仍然有意义。区分两件事是工程师的素养。

  1. 单一离散指标不可预测能力MMLU 单分,BIG-Bench hard 任务 → 单值评估都会将锐变误读为涌现。
  2. 评估必须有连续曲率使用 token-level log-prob、BLEU、chrF、accuracy@k 等连续或下加权的度量,可以看见与 scaling 一致的平滑曲线。
  3. "涌现"主张要附带 metric-sensitivity任何"这个能力是 emergent"的论文,都要在同一任务上同时报告连续版与离散版。缺失则不可采信。

反向使用场景:如果你在一个评估上看到了锐变,第一反应是检查指标,而不是认为出现了 AGI

训练算力在 2024-25 进入 plateau

公开 frontier 训练算力的上限增速明显放缓——尽管理论上每秒 FLOPs 价格仍在下降。

年份代表模型公开训练 FLOPs备注
2020GPT-3 175B~3.6 × 10²³增长主要集中在参数
2022PaLM 540B~2.5 × 10²⁴稠密大模型上限
2023GPT-4 *~2-3 × 10²⁵MoE + 大数据的潜在组合
2024LLaMA-3.1 405B~3.8 × 10²⁵数据集公开 15.6T tokens
2025DeepSeek-V3~2.7 × 10²⁵ (FP8 效率极高)成本上限推动提纪,公开训练算力增长放缓

含义:公开 frontier 训练算力从 10²³ 走到 10²⁵ 的"指数加速"已经走完。下一阶能力必须向 inference + RL + reasoning 转移——这个论点被 o1 / R1 的成绩反向验证。

一句话小结

Scaling 撞墙来自四个方向:Data Wall、Marginal Returns、Emergent Mirage、Training Plateau——四者共同把下一阶能力推向推理侧。

PART 05 · INFERENCE SCALING

Inference Scaling:推理才是新的主战场

一个小模型思考更多,是否能胜过一个大模型?

Snell, Kumar, et al. 2024 · paraphrased

"Test-time compute can be more effective than scaling parameters."

Snell 2024 · 推理算力的 inference scaling law

Snell, Kumar, et al., Google DeepMind, 2024 · arXiv:2408.03314

核心论点:在固定总 FLOPs(训练 + 推理)下:

在 MATH、Codeforces 等任务上,前者可以胜出 4× 参数规模的大模型。论文列出 4 种推理机制:

  1. Self-revise由 verifiers 反复修改同一输出。
  2. Verifier-based search多个候选 + PRM 排名择优,近似 MCTS。
  3. Tree-of-Thought结构化展开推理树,选择最优路径。
  4. Process reward model对推理 step-by-step 打分,路径选择更细。
Snell et al., 2024, paraphrase

"小模型 + 正确推理算力分布,能力不一定低于大模型。这不是挑战 scaling law,而是把它扩展到第三个轴。"

o1 / o3 · RL 训出的"如何思考"

OpenAI o1 (2024-09) · o3 (2024-12)。在数学与代码上显著提升,清套以推理时搜索为极。

DeepSeek-R1 · 纯 RL 复现 o1

DeepSeek-AI · arXiv:2501.12948 · 2025-01。

  1. OpenAI o1 推测路线长思维链数据 SFT(蒸馏 o1 自身输出或人工构造)→ RLHF 训练对话质量 → Verifier / PRM 做 test-time 选择 → 依赖长 CoT 数据,起始点不能差。
  2. DeepSeek-R1-Zero 路线base model 不变 → GRPO (Group Relative Policy Opt.) 作为 RL 信号 → 零 SFT 蒸馏,仅靠规则奖励 (accuracy / format) → 推理能力 emergent,思维长度随训练逐步增长

意义:RL 可以从零训出"如何思考",不需要昂贵的长 CoT 冷启动。这是 inference scaling law 的实证确认——也是开创数据集 R1-distill 的价值来源。

训练算力 vs 推理算力 · 该怎么投

扩展后的 scaling law:C_eff = f(N, D, T_inference)。不同场景不同选。

# 扩展 scaling law — 增加第三轴

effective_capability  ∝  N^αN · D^αD · T_inference^αT

# 三轴的典型 ᾱ (不同任务不同):
#   MATH  :  αT >> αN > αD         (test-time 主导)
#   Code  :  αT >> αD ≈ αN        (CoT / sampling 主导)
#   Chat  :  αN ≈ αD > αT         (训练主导)
#   Agent :  αT > αD > αN         (交互轮数 主导)
一句话小结

Inference scaling 是 scaling 的第三轴:α_T 在 MATH/Code/Agent 任务上超过 α_N 与 α_D——训练侧的天花板已经被推理侧的算法突破接住。

TAKEAWAYS

五条不会过期的 scaling 课

一份知识资料的最终形态,是几条能在工程与研究里反复用上的判断。

  1. Scaling Law 是连续可预测它告诉你在训练前能期待什么。不是信仰,是 log-log 图上的直线。
  2. Chinchilla 给定基线,实践常常 over-train产品场景下,推理成本权重往往 > 训练成本。LLaMA / DeepSeek 都是反例。
  3. Data Wall 是真实瓶颈2026 前后高质量文本耗尽。意味着合成数据、多模态、self-play 不可避。
  4. "涌现能力"多为度量伪影Schaeffer 2023 提示:对于一项报告 emergent 的能力,皆需在同一任务上报告连续指标。
  5. Test-time compute 是 2024+ 的主战场Snell、o1、DeepSeek-R1 共同证明:推理算力是 scaling 的第三轴。

Scale smart, not just bigger.

这份资料沿着四条主线展开:理论基线(Kaplan → Chinchilla)、Frontier 模型的工程实证(GPT / LLaMA / DeepSeek / Claude / Gemini)、瓶颈与争议(Data Wall / Marginal Returns / Emergence / Training Plateau)、以及 Inference Scaling(Snell 2024 / o1 / o3 / DeepSeek-R1)。五条 takeaway 既是这一代的总结,也是下一阶段工程决策的入口。

· · ·
主要参考资料
· Kaplan, McCandlish, Henighan et al., Scaling Laws for Neural Language Models, 2020 · arXiv:2001.08361
· Hoffmann et al., Chinchilla, DeepMind 2022 · arXiv:2203.15556
· Villalobos, Ho, Sevilla et al., Will We Run Out of Data?, Epoch AI 2024
· Schaeffer, Miranda, Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023 · arXiv:2304.15083
· Snell, Kumar et al., Scaling LLM Test-Time Compute, Google DeepMind 2024 · arXiv:2408.03314
· DeepSeek-AI, DeepSeek-R1, 2025 · arXiv:2501.12948