大模型的 Scaling Law
从经验法则到新范式
为什么把模型做大、数据做多、算力堆高,能力就跟着涨?这份资料追踪从 Kaplan 2020 到 o1 / DeepSeek-R1 的整个 scaling 故事线——幂律、瓶颈、转向。
为什么工程师和研究者必须知道 Scaling Law
三件事,是研究者和工程师都必须知道 Scaling Law 的理由。
- 预测能力 · 在训练之前,就能根据 N · D · C 外推 loss 走向。一个稳定的 L ∝ N^-α 形式,意味着"做多大就得到多大"不再是营销话术,而是可计算。
- 分配算力 · 给定总预算 C,Chinchilla 给出了最优 N 与 D 的拆分方式。同样 1000 万美元,参数翻倍 vs 数据翻倍的结果可以差出一个数量级。
- 识别故事真假 · "涌现能力"、"智能即将爆发"——哪些是 power law 的必然推论,哪些是 metric 伪影?Scaling Law 是判别标准,不是营销 banner。
这份资料沿着四条主线展开:理论基线(Kaplan → Chinchilla)、Frontier 模型的工程实证(GPT / LLaMA / DeepSeek / Claude / Gemini)、瓶颈与争议(Data Wall / Marginal Returns / Emergence / Training Plateau)、以及 Inference Scaling(Snell 2024 / o1 / o3 / DeepSeek-R1)。
理论基础:损失随规模按幂律下降
经验规律,而非物理定律——但跨越 8 个数量级的算力仍可拟合为同一族曲线。Kaplan et al., 2020 首次系统刻画了三条 power law:在 transformer 语言模型上,把 loss 与参数量、训练 tokens、训练 FLOPs 三个轴分别拟合,跨越 7 个数量级模型规模、8 个数量级算力,误差可预测。
三条 power law 的形式
- N · 参数 · 模型参数量 (Transformer 宽度 / 深度 / 头数)。L(N) ∝ N^(-α_N),α_N ≈ 0.076
- D · 数据 · 训练 tokens 总量,高质量文本优先,合成数据逐步引入。L(D) ∝ D^(-α_D),α_D ≈ 0.095
- C · 算力 · 训练 FLOPs。N 与 D 的耦合函数:C ≈ 6ND。L(C) ∝ C^(-α_C),α_C ≈ 0.050
核心观察:三者的关系在 log-log 坐标中是直线,意味着没有"奇迹阈值"。同时 α_D > α_N——同样倍数,数据比参数更"陡"。
# Kaplan et al. (2020) — three independent power laws
L(N) = E_N + (N_c / N) ^ α_N # 参数量
└ measured: α_N ≈ 0.076
L(D) = E_D + (D_c / D) ^ α_D # 训练 tokens
└ measured: α_D ≈ 0.095
L(C) = E_C + (C_c / C) ^ α_C # 训练 FLOPs
└ measured: α_C ≈ 0.050
# 关键不等式: α_D > α_N > α_C
# 含义: 等倍投入下, 数据带来的 loss 下降最大, 算力综合最低.
α 越大,收益衰减越慢——数据 + 算力的回报比参数更高。
直觉上,斜率 −0.05 的直线(对 C) vs 斜率 −0.10 的直线(对 D):增加一阶 token 几乎能"独立"贡献。所以后 Kaplan 时代的 frontier 模型都走向"深 token 数据"路线。
幂律意味着没有奇迹阈值
"涌现"这个词在 power law 面前需要重新审定。幂律带来四点推论:
- 连续下降:loss 在 log-log 尺度上是光滑曲线,无跳跃。
- 可外推:用小模型预测大模型的表现(误差 2-3% 以内)。
- 永远递减:每增加一阶算力,loss 必降一点——但永远不停。
- 指数 vs 指数:指数增长才能换来线性增长——成本极高。
数学骨架是 log L = −α · log C + const。Kaplan 留下的两个 open problem:(1)三个变量分开变化,但实际只能耦合——它没有给出耦合策略;(2)假设"参数越多越好",却没有回答"给定 C 多少才够"。两年后 DeepMind 的 Chinchilla (2022) 回答了这两个问题,并刷新了 compute-optimal 的基线。
Scaling Law 不是信仰,而是 log-log 图上的直线:连续、可外推、永远递减、且数据回报高于参数。
Chinchilla 2022:把"N 应该多大"换成"C 怎么分配"
Hoffmann et al., DeepMind, 2022 · arXiv:2203.15556。Kaplan 单独变化一个变量做拟合。Chinchilla 重新框定问题:在固定训练算力预算 C 下,同时优化 N 与 D 的分配,使 loss 最小。
问题重构与三处关键修正
- 从单变量到联合优化从 Kaplan 的单变量拟合变为约束优化:min L(N, D) s.t. C(N, D) = budget
- 比例修正Kaplan 暗示 N 单向 scaling 即可;Chinchilla 给出 N、D 应同步增长。
- 常量 G提炼出总预算的标度常数 G,可以直接根据 C 给出最佳 N 与 D。
Kaplan 时期的旗舰模型 GPT-3 (175B / 300B tokens) 和 Gopher (280B / 2.3B tokens)——都严重欠训。
结论的杀伤力就在这里:Chinchilla (70B) 在与 Gopher (280B) 相同的算力预算上训练出更小但数据更多的模型——以 1/4 参数反超 Gopher,同时推理成本仅为后者的 1/4。
N 与 D 同步增长,比例约 1 : 1
给定训练算力 C,最优参数与数据均以 C^0.50 增长。
# Chinchilla-optimal scaling
N_opt = G · C^a # 模型参数
D_opt = G⁻¹ · C^b # 训练 tokens
# 拟合来自 Chinchilla 实验:
# a ≈ 0.50 b ≈ 0.50
# 常量 G (token-per-param):
G ≈ 3.2 × 10⁸ tokens · param^0.5
含义:算力预算翻 10×,参数量、数据量各翻 ~3.16×(10^0.50)。Chinchilla 报告中实际训出的 D/N ≈ 20——把这个数写成经验法则,是 compute-optimal 训练的近似。
compute-optimal 训练下,每个参数对应 20 个训练 tokens。这个数字决定训练预算的分配。
| 模型规模 N | Chinchilla-Optimal Tokens | 换算与说明 | 实际示例 |
|---|---|---|---|
| 1B | ~20B | 中小型实验常用规模 | GPT-2 / Pythia-1B |
| 7B | ~140B | 开源主流起步规模 | LLaMA-1 7B / Qwen2-7B |
| 13B | ~260B | 单 GPU 集群友好上限 | LLaMA-1 13B |
| 70B | ~1.4T | Chinchilla 原论文训出的量级 | LLaMA-1 65B (1.4T) |
| 405B | ~8.1T | LLaMA-3.1 训练数据接近该值 | LLaMA-3.1 405B (15.6T) |
| 1T | ~20T | 理论满算最优 | 训练公开样本 ≈ 一例 |
Over-training 反转:小模型 + 多数据 的胜利
当推理成本高于训练成本 时,让数据"溢出" Chinchilla-Optimal 反而是最优策略。
- 理论 · Chinchilla目标:给定 C,最小化 loss。结论:N : D 应 1 : 1 增长。推理假设:训练完即部署,单次推理开销不计入优化目标。最佳例:Chinchilla 70B 用 1.4T tokens 训出,超过 Gopher (280B)。
- 实践 · LLaMA-1目标:在固定推理预算下最大化能力。结论:数据"溢出" Chinchilla——65B 用了 1.4T tokens(训练上是 over-train)。效果:推理延迟与 7B 同量级,质量接近 175B 模型。推论:生产场景下,"训练最优"和"部署最优"是两个问题。
实用工程上看一个扩展的标度问题:min TC(N, D) + λ · RI(N),其中 TC = 训练成本,RI = 总推理成本,λ = 每秒每推理 call 的预算权重。LLaMA 取的是大 λ:推理便宜是产品关键。
Chinchilla 给定 C 的最优基线是 N : D = 1 : 1、20 tokens/param;但产业部署常常 over-train——训练最优与部署最优是两个问题。
Frontier 模型:六年间参数 × 算力 × 数据 的三轴
Scaling Law 真的奏效了吗?从 GPT-3 到 DeepSeek-R1,看 frontier 如何把幂律变成工程预算。数据来自各模型技术报告、公开发布与社区估算。* 标注为估算值。
| 模型 | 年份 | 参数量 | 训练 tokens | 关键选择 |
|---|---|---|---|---|
| GPT-3 | 2020 | 175B 稠密 | ~300B | in-context learning, dense Transformer |
| GPT-4 * | 2023 | ~1.8T MoE (~280B active) | ~13T | 推理为王 · 多模态输入 |
| LLaMA-1 65B | 2023 | 65B 稠密 | 1.4T | over-train 路线, 开源范式 |
| LLaMA-2 70B | 2023 | 70B 稠密 | 2T | + RLHF, 长上下文 4K |
| LLaMA-3.1 405B | 2024 | 405B 稠密 | 15.6T | 几乎所有指标最优开源 |
| DeepSeek-V3 | 2024 | 671B MoE (37B active) | 14.8T | FP8 + MLA + 极致 MoE |
| Claude 3 Opus * | 2024 | 未披露 | 未披露 | RLAIF / Constitutional AI, 200K ctx |
| Gemini 1.5 Pro | 2024 | 未披露 MoE | 未披露 | 1M-2M context · 多模态 |
研读建议:关注每行的"关键选择"列——参数 vs 数据的组合策略,比单纯的总量更能预测推理能力。
GPT-3 → GPT-4:一个数量级参数、两个数量级数据
MoE 是把"等效参数大"与"推理成本低"兼得的关键设计。
- 参数量 · 175B 稠密 → ~1.8T MoE · ~280B active。专家并行 + load-balanced routing,单次推理仅激活 ~1/6 的参数。
- 训练 tokens · ~300B tokens → ~13T tokens。数据增长 ~40×,超过参数增长 (10×)——印证 αD > αN。
- 推理算力 · 200 TFLOPs / token(稠密 175B)→ ~80 TFLOPs / token(active 280B MoE)。能力升级一阶,推理单次成本反而下降——scaling 的两个轴不再同步。
LLaMA 系列:开源范式 · 数据上限比参数上限重要
LLaMA 每代 tokens 增长 ≈ 5-7×,参数增长保守,实测效果对齐 Chinchilla 计算值。
| 版本 | 最大参数量 | 训练 tokens | 对比 Chinchilla |
|---|---|---|---|
| LLaMA-1 | 65B | 1.4T | 几乎 Chinchilla-optimal (~21 tok/param) |
| LLaMA-2 | 70B | 2T | over-train (28 tok/param) — RLHF 加持 |
| LLaMA-3 | 70B | 15T | 重度 over-train (~214 tok/param) — 部署取向 |
| LLaMA-3.1 | 405B | 15.6T | 开源最大稠密, 接近 Chinchilla-optimal (38 tok/param) |
关键决策:Meta 的 RLHF + 长上下文 + 安全微调作为"附加 scaling"。这组 scaling 不是 loss,而是能力本身——可以看作第二阶 scaling。产业含义:开源社区在相同推理预算下赶上闭源——证明 Chinchilla + 高质量数据 + post-training,可以复现 80-90% 的 frontier 能力。
DeepSeek:MoE 极致 + 纯 RL 推理
两条路线同公司同月推出——一是工程效率极致,二是验证 inference scaling。
- DeepSeek-V3 · 2024-12参 / 活:671B 总参 / 37B 激活。训练 tokens:14.8T · 接近 Chinchilla-optimal。工程突破:FP8 全链路训练 + MLA (Multi-head Latent Attention)。结论:在 GPT-4 量级能力上,训练成本压到 ~6M USD,推理成本逼近稠密 37B。
- DeepSeek-R1 / R1-Zero · 2025-01方法:GRPO (Group Relative Policy Optimization) · 纯 RL。R1-Zero:无需任何 SFT,直接从 base + RL 训出 o1 级推理。意义:推理能力是 emergent,不依赖 SFT 蒸馏——这是 inference scaling 的实验证明。影响力:复现了 OpenAI o1 路线,论文 arXiv:2501.12948。
同一公司同时验证:训练 scaling 已经撞到成本墙,于是同步试点推理 scaling——从"参数 + 数据"扩展为"参数 + 数据 + 推理算力"。
闭源双路径:Anthropic 与 Google
参数 / tokens 未披露,但可从上下文窗口、架构走向与产业线索推演。
- Claude 3 (Opus / Sonnet / Haiku)参数 / 数据:未披露。从公开定价反推参数跨越 1-2 个数量级。Post-training 主线:Constitutional AI / RLAIF——用规则自动判优,减少人类标注瓶颈。上下文:Opus 起 200K tokens;行业第一梯队。产品形态:Tools / Computer Use,重在 agent 而非纯参数规模。
- Gemini 1.5 (Pro / Flash)架构:未确认 MoE,Google 自研 TPU 训练栈。关键 scaling:1M tokens 上下文 (1.5 Pro),公共 demo 推到 2M。含义:长上下文本身就是一种能力维度——把"context"作为 scaling axis 之一。多模态:原生 video / audio / image——多模态 embedding 在同一个 scaling 上。
对比启示:Anthropic 强调训练后流水线与 tool-use 工具,Google 把上下文窗口当显式 scaling。两种都以"参数 + 数据 + 第三维"再立柱——下文给出总图。
Scaling Law 的三阶段:参数 → 数据 → 推理
每代主轴 18-24 月切换一次——主轴不只是工程惯例,而是 power law 系数驱动的最优 trade。
- Era 1 · 参数主导 (2018 — 2020)GPT-2 → GPT-3,唯一公开认可的标度轴是 N。数据是"够用就行"的水平。代表:GPT-2 1.5B / GPT-3 175B / T5-11B。
- Era 2 · 数据主导 (2020 — 2023)Chinchilla 之后,训练 tokens 与参数同步增长。LLaMA 把"训练便宜、推理便宜"变成一个产品概念。代表:Chinchilla 70B / 1.4T / LLaMA 1 → 3.1 / GPT-4 (rumored)。
- Era 3 · Test-Time 主导 (2023 — 现在)训练数据墙出现,RL + reasoning 让推理算力成为第三轴。DeepSeek-R1 与 o1 是这条主线的代表作。代表:o1 / o3 / DeepSeek-R1 / test-time search。
记住三组数量级
六年间 frontier 模型发布速度大约匹配"每 6-9 月一代",这背后的标度增量稳定可复现:
- 10× · PARAMETERS / 24 月
- 10× · TRAINING TOKENS / 18 月
- 10× · EFFECTIVE FLOPs / 12 月
- 3-4× · INFERENCE 算力 (o1 后) / 6 月
三个数字彼此错位,数据比参数涨得快 → 高质量文本被快速榨干 → 必然滑向推理侧(frontier 视角)。从工程师视角看,每一次翻倍都意味着训练算力 4× 起步,配套的存储 / 网络 / 调度代码同步升级。Team 资源 vs gain 的 trade 全表需要重估。
Frontier 把幂律变成工程预算:参数与数据之后,长上下文、post-training、推理算力都在变成新的 scaling 轴。
瓶颈与争议:Scaling Law 真的会一直成立吗?
Data Wall · Marginal Returns · Emergent Mirage · Training Plateau——四个角度看 scaling 在哪里开始失效。
Data Wall · 高质量文本将在 ~2026 耗尽
Villalobos, Ho, Sevilla et al., Epoch AI, 2024。待发表的 frontier 算力增长需要更多数据,而真实数据的供给没跟上。三个重要日期:
- ~2026 · 高质量人类筛选文本耗尽(参供:书籍、优质维基、精选网页)
- ~2028-2032 · 多模态高质量数据也面临类似供给制损
- ~2030-2050 · 所有人类生成公开文本耗尽中位区间
四条突围路径:
- 合成数据模型自生成再过滤;存在 model collapse 风险。
- 多模态嵌入视频 / 音频 / 代码 / 表格扩大可标度池。
- Self-play RLAlphaZero / AlphaProof 路径。
- Agent trajectory模型与环境交互生成的 experience 作为新数据。
"如果 scaling law 倒推需要 100× 当前数据,而人类文本供给曲线只能多贡献 5×,剩下的 20× 必须从机器生成中获取。"
10²⁵ FLOPs 之后,曲线变平
幂律还在成立,但 α 在变小,训练的 $ / benchmark point 不断上升。同样的 10× 算力,曲线末尾换来的 loss 增量仅为头部的 ~1/3。
所以 frontier-lab 在 2024 后同时押"参数 / 数据"与"推理"。纯训练 scaling 的 ROI 报表出现拐点——这是一个"supply 曲线 vs demand 曲线"的失败:投入上升,gain 递减。
"涌现能力"是海市蜃楼吗?
Schaeffer, Miranda, Koyejo · NeurIPS 2023 Outstanding Paper · arXiv:2304.15083。
主张:很多被报告为 "emergent" 的能力(锐变)——是离散指标的人为结果,而不是底层能力真的锐变。例子:MMLU 4-选项多选、BIG-Bench hard 任务,
- 变换为 token edit distance
- 变换为 log-likelihood
- 变换为 exact-string → BLEU
锐变消失,曲线连续。两个经典复现实验:
- 算术任务:exact-match 阈值下似乎从 0 跳变到 99%;改成 log(p) 后可见平滑。
- 多语言翻译:chrF / BLEU 平滑曲线;exact-match 出现伪跃迁。
- 问题推理:CoT-provide prompt 后,原本"涌现"的曲线被部分平滑。
- 结论:指标选择 + 阈值效应可以制造锐变,而非底层动力学发生跳跃。
"我们不是否认能力突然变强——我们是否认度量出的那个变化是真实存在。"
三个方法论教训
即使涌现锐变是度量伪影,scaling 仍然有意义。区分两件事是工程师的素养。
- 单一离散指标不可预测能力MMLU 单分,BIG-Bench hard 任务 → 单值评估都会将锐变误读为涌现。
- 评估必须有连续曲率使用 token-level log-prob、BLEU、chrF、accuracy@k 等连续或下加权的度量,可以看见与 scaling 一致的平滑曲线。
- "涌现"主张要附带 metric-sensitivity任何"这个能力是 emergent"的论文,都要在同一任务上同时报告连续版与离散版。缺失则不可采信。
反向使用场景:如果你在一个评估上看到了锐变,第一反应是检查指标,而不是认为出现了 AGI。
训练算力在 2024-25 进入 plateau
公开 frontier 训练算力的上限增速明显放缓——尽管理论上每秒 FLOPs 价格仍在下降。
| 年份 | 代表模型 | 公开训练 FLOPs | 备注 |
|---|---|---|---|
| 2020 | GPT-3 175B | ~3.6 × 10²³ | 增长主要集中在参数 |
| 2022 | PaLM 540B | ~2.5 × 10²⁴ | 稠密大模型上限 |
| 2023 | GPT-4 * | ~2-3 × 10²⁵ | MoE + 大数据的潜在组合 |
| 2024 | LLaMA-3.1 405B | ~3.8 × 10²⁵ | 数据集公开 15.6T tokens |
| 2025 | DeepSeek-V3 | ~2.7 × 10²⁵ (FP8 效率极高) | 成本上限推动提纪,公开训练算力增长放缓 |
含义:公开 frontier 训练算力从 10²³ 走到 10²⁵ 的"指数加速"已经走完。下一阶能力必须向 inference + RL + reasoning 转移——这个论点被 o1 / R1 的成绩反向验证。
Scaling 撞墙来自四个方向:Data Wall、Marginal Returns、Emergent Mirage、Training Plateau——四者共同把下一阶能力推向推理侧。
Inference Scaling:推理才是新的主战场
一个小模型思考更多,是否能胜过一个大模型?
"Test-time compute can be more effective than scaling parameters."
Snell 2024 · 推理算力的 inference scaling law
Snell, Kumar, et al., Google DeepMind, 2024 · arXiv:2408.03314。
核心论点:在固定总 FLOPs(训练 + 推理)下:
- 小模型 + 多次推理 vs 大模型 + 1 次推理
在 MATH、Codeforces 等任务上,前者可以胜出 4× 参数规模的大模型。论文列出 4 种推理机制:
- Self-revise由 verifiers 反复修改同一输出。
- Verifier-based search多个候选 + PRM 排名择优,近似 MCTS。
- Tree-of-Thought结构化展开推理树,选择最优路径。
- Process reward model对推理 step-by-step 打分,路径选择更细。
"小模型 + 正确推理算力分布,能力不一定低于大模型。这不是挑战 scaling law,而是把它扩展到第三个轴。"
o1 / o3 · RL 训出的"如何思考"
OpenAI o1 (2024-09) · o3 (2024-12)。在数学与代码上显著提升,清套以推理时搜索为极。
- Policy LLM · 策略网络RL 训练出的策略,GRPO / PPO,Long CoT 输出。以"思考格式"训练过程本身——反思、验证、回溯都是模型在内部自然涌现。
- Reward Model · 过程奖励Process Reward Model,step-by-step 评分,reward hacking 控制。给每个推理步骤评分,避免仅 final-answer 评估带来的混乱。
- Search Budget · 搜索预算best-of-N / self-consistency / tree / beam search。推理时调用 FLOPs 越多,路径探索越深,准确率上升明显。根据任务选择搜索深度。
DeepSeek-R1 · 纯 RL 复现 o1
DeepSeek-AI · arXiv:2501.12948 · 2025-01。
- OpenAI o1 推测路线长思维链数据 SFT(蒸馏 o1 自身输出或人工构造)→ RLHF 训练对话质量 → Verifier / PRM 做 test-time 选择 → 依赖长 CoT 数据,起始点不能差。
- DeepSeek-R1-Zero 路线base model 不变 → GRPO (Group Relative Policy Opt.) 作为 RL 信号 → 零 SFT 蒸馏,仅靠规则奖励 (accuracy / format) → 推理能力 emergent,思维长度随训练逐步增长。
意义:RL 可以从零训出"如何思考",不需要昂贵的长 CoT 冷启动。这是 inference scaling law 的实证确认——也是开创数据集 R1-distill 的价值来源。
训练算力 vs 推理算力 · 该怎么投
扩展后的 scaling law:C_eff = f(N, D, T_inference)。不同场景不同选。
# 扩展 scaling law — 增加第三轴
effective_capability ∝ N^αN · D^αD · T_inference^αT
# 三轴的典型 ᾱ (不同任务不同):
# MATH : αT >> αN > αD (test-time 主导)
# Code : αT >> αD ≈ αN (CoT / sampling 主导)
# Chat : αN ≈ αD > αT (训练主导)
# Agent : αT > αD > αN (交互轮数 主导)
- 投资训练算力适用于:高 QPS · 在线对话 · 简单检索 · 成本均值分布均匀 · 产品的"predictable" output。
- 投资推理算力适用于:低 QPS · 高价值任务(数学 / code / planning)· 可以接受 delay / cost-spread。
Inference scaling 是 scaling 的第三轴:α_T 在 MATH/Code/Agent 任务上超过 α_N 与 α_D——训练侧的天花板已经被推理侧的算法突破接住。
五条不会过期的 scaling 课
一份知识资料的最终形态,是几条能在工程与研究里反复用上的判断。
- Scaling Law 是连续且可预测的它告诉你在训练前能期待什么。不是信仰,是 log-log 图上的直线。
- Chinchilla 给定基线,实践常常 over-train产品场景下,推理成本权重往往 > 训练成本。LLaMA / DeepSeek 都是反例。
- Data Wall 是真实瓶颈2026 前后高质量文本耗尽。意味着合成数据、多模态、self-play 不可避。
- "涌现能力"多为度量伪影Schaeffer 2023 提示:对于一项报告 emergent 的能力,皆需在同一任务上报告连续指标。
- Test-time compute 是 2024+ 的主战场Snell、o1、DeepSeek-R1 共同证明:推理算力是 scaling 的第三轴。
Scale smart, not just bigger.
这份资料沿着四条主线展开:理论基线(Kaplan → Chinchilla)、Frontier 模型的工程实证(GPT / LLaMA / DeepSeek / Claude / Gemini)、瓶颈与争议(Data Wall / Marginal Returns / Emergence / Training Plateau)、以及 Inference Scaling(Snell 2024 / o1 / o3 / DeepSeek-R1)。五条 takeaway 既是这一代的总结,也是下一阶段工程决策的入口。
· Kaplan, McCandlish, Henighan et al., Scaling Laws for Neural Language Models, 2020 · arXiv:2001.08361
· Hoffmann et al., Chinchilla, DeepMind 2022 · arXiv:2203.15556
· Villalobos, Ho, Sevilla et al., Will We Run Out of Data?, Epoch AI 2024
· Schaeffer, Miranda, Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023 · arXiv:2304.15083
· Snell, Kumar et al., Scaling LLM Test-Time Compute, Google DeepMind 2024 · arXiv:2408.03314
· DeepSeek-AI, DeepSeek-R1, 2025 · arXiv:2501.12948