工作台课程

CS336 · 从零构建语言模型

Lecture 11 · 缩放定律 II:细节

Lecture 11 · 缩放定律 II:细节

CS336: Language Modeling from Scratch · Stanford · Spring 2025
📅 May 6 · 💻 不可执行讲义(PDF) · 讲者 Tatsunori Hashimoto


承上启下

上一讲(Lecture 10 · 推理:训练完模型之后,推理成本会长期存在——generation 是 memory-bound,KV cache 和动态 batching 是核心问题。这也解释了 Lecture 9 · 缩放定律 I:基础 末尾的结论:考虑推理成本后,train-optimal 不等于 product-optimal。

本讲(缩放细节):回到训练前的决策问题。Lecture 9 给了理想化框架——$L(N,D)$ 曲面、$C \approx 6ND$ 约束、Chinchilla 三方法;本讲看这套框架在真实模型里到底怎么用:重点案例是 CerebrasGPT、MiniCPM、DeepSeek、LLaMA 3、Hunyuan、MiniMax;并深入 muP——它为什么声称能让小模型超参数迁移到大模型?实践上靠谱不靠谱?

摘要

缩放定律落地时,难点不只是拟合 $L(N,D)$,还包括 batch size、learning rate、LR schedule(WSD vs cosine)、muP 参数化、数据/模型比例的选择,以及「小实验测得的规律」与「最终大模型」之间每一处可能断裂的环节;各家 recipe 在流程上趋同、在常数上分歧。


1. 实践中的缩放问题

Lecture 9 · 缩放定律 I:基础 建立的基础形式是:

$$L(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}, \qquad C \approx 6ND$$

($N$ 参数量、$D$ 训练 token 数、$E$ 不可约损失、$\alpha,\beta$ 缩放指数。)但拿着这两个公式去训一个真实模型,马上会撞上一排公式没有回答的问题:

  • 小模型上调好的 learning rate,换到大模型还成立吗?(朴素参数化下不成立——最优 LR 随宽度漂移。)
  • batch size 应该怎么随目标 loss 和规模变化?
  • LR schedule 用 cosine 还是 WSD?这个选择甚至影响「拟合缩放定律本身要花多少钱」。
  • 到底要训练多少个小模型、覆盖多大的规模范围,拟合出的定律才可信?
  • Chinchilla 的 20:1 比例在新架构、新数据、新 tokenizer 上还成立吗?
  • MoE 模型(见 Lecture 4 · 混合专家模型 MoE)该按总参数还是激活参数套用定律?

本讲的方式是读几个公开细节较多的模型的 scaling recipe,看各家怎么回答这些问题。

提示

Lecture 9 是「定律」,本讲是「配方」。定律描述理想气体,配方处理真实气体:每一个工程环节(schedule、参数化、数据质量)都可能让拟合出来的常数失效。读懂几份真实 recipe 的价值在于知道哪些环节必须自己重新测量、哪些可以放心复用。


2. CerebrasGPT:muP + Chinchilla recipe

CerebrasGPT 训练了 111M 到 13B 的一组模型,每个都按 Chinchilla 比例(约 20 tokens/param)配数据,目标是验证「muP + Chinchilla recipe」能否得到干净可预测的缩放曲线。

核心发现:

  • 同一组模型分别用标准参数化(SP)和 muP(maximal update parametrization)训练对比:muP 版本 loss 更低、缩放曲线更贴合幂律
  • muP 下,小模型(40M 量级的 proxy model)上扫出的 learning rate 等超参数可以直接迁移到大模型,省掉大模型上的超参搜索;
  • 由此整条「小实验 → 外推」流水线的可信度提高——超参数不再是外推时的隐藏变量。

2.1 为什么需要 muP?

朴素参数化下,模型变宽时会发生一连串连锁漂移:

  • 各层 activation 的尺度随宽度变化(求和的项数变多);
  • 一步优化带来的参数更新对 activation 的扰动尺度也随宽度变化;
  • 于是最优 learning rate 随宽度漂移——小模型的最优 LR 拿到大模型上往往过大,轻则次优、重则发散;
  • 结论:小模型上的调参结果不能直接迁移,而大模型上调参又恰恰是最贵的。

muP 的目标可以概括为一句话:

$$\text{让不同宽度的模型在训练动态上可比}$$

具体拆成三个愿望(desiderata):

  1. 初始化时各层 activation 尺度稳定(不随宽度爆炸或消失);
  2. 训练更新后 activation 的变化量尺度也稳定(特征确实在学习,但幅度可控);
  3. 于是最优 learning rate 在宽度缩放下近似不变,可从小模型直接迁移。

muP 的具体构造与失效条件见第 6 节。

提示

muP 像给不同宽度的模型做「单位换算」:直接比较各自坐标系下的 LR 没有意义(如同比较米和英尺的数字),muP 把初始化和 LR 都按宽度重新标定后,不同宽度的模型落进同一个坐标系,「最优 LR」才成为一个跨规模有意义的量。


3. MiniCPM:小模型高性能与 WSD

MiniCPM 是清华/面壁团队的小模型系列(1.2B、2.4B 非 embedding 参数量级),核心主张:

  • 1B–2.5B 量级也能做出接近更大模型的性能,前提是把 scaling 实验做足;
  • 用 muP 风格的参数化(tensor program 技巧)稳定跨规模调参;
  • 用 WSD learning rate schedule 大幅降低 Chinchilla 式分析的成本。

3.1 MiniCPM 的缩放策略

大致流程:

  1. 用 muP 风格参数化设定初始化与 LR,使超参可跨规模迁移;
  2. 固定模型形状(aspect ratio),只整体缩放模型大小——利用 Lecture 9 的结论「形状在宽范围内不敏感」,把搜索空间压到一维;
  3. 在 0.01B–0.5B 的小 proxy 模型上搜索 batch size、LR、数据/模型比例;
  4. 外推到最终 1.2B/2.4B 模型的完整训练。

讲义中提到的参数化设置例子:

模型/论文 典型设置
MiniCPM scale_emb=12, scale_depth=1.4, init_std=0.1, lr=0.01
CerebrasGPT scale_emb=10, lr=6e-3, init_base=0.08

这些旋钮的含义:scale_emb 是 embedding 输出的乘子(muP 下 embedding 层与隐藏层的 LR/尺度规则不同,用乘子补偿);scale_depth 控制残差分支的缩放(MiniCPM 用 $1.4/\sqrt{n_{\text{layers}}}$ 抑制深度方向的信号累积);init_std 是基准初始化标准差;lr 是 proxy 宽度下的基准学习率,muP 保证它随宽度按规则缩放后依然近似最优。

3.2 Optimal Batch Size

MiniCPM 用多个小模型、多个数据量、多个 batch size 画出训练曲面,观察到:

  • 最优 batch size 主要由目标 loss 决定:loss 越低,最优 batch 越大——这延续了 Kaplan/McCandlish 的临界批量分析(见 Lecture 9 · 缩放定律 I:基础 第 5.2 节);
  • 拟合出的经验关系约为 $B^*(L) \approx 1.21\times10^{9}/L^{6.24}$ token——指数很大,意味着训练后期(loss 低时)可以且应该用大得多的 batch;
  • 这类关系给了「batch size 随训练进程增大」策略一个定量依据。

3.3 WSD Learning Rate Schedule

WSD = Warmup-Stable-Decay:先 warmup,然后长期保持恒定 LR(stable 段),最后快速退火(decay 段,约占总步数的 10%)。

graph LR
    W["Warmup"] --> S["Stable plateau"]
    S --> D["Decay"]

与 cosine schedule 的关键区别不在最终 loss(两者相近,WSD 常略好),而在实验经济学

  • cosine 的形状与总训练长度绑定——想测「同一模型、不同 token 预算」的 $n$ 个点,就要从头跑 $n$ 次完整训练(Lecture 9 讲过:schedule 不匹配训练长度会系统性高估 loss,这正是 Kaplan 的教训);
  • WSD 的 stable 段与训练长度无关——跑一次长的 stable 训练,在任意中间 checkpoint 分叉出一小段 decay(约 10% 成本),就得到「该 token 预算下认真退火后的 loss」;
  • 于是拟合 $L(N,D)$ 曲面的成本从「$m$ 个模型大小 × $n$ 个数据量 = $mn$ 次完整训练」降到「$m$ 次长训练 + $mn$ 次便宜的 decay 分支」。

训练动态上,stable 段的 loss 会显得偏高,进入 decay 段后 loss 断崖式下降——所以比较 WSD 实验的 loss 必须比较 decay 后的值,不能拿 stable 段中途的值和 cosine 比。

提示

WSD 把「一次训练」变成「一份可复用资产」:stable 段是所有数据预算共享的主干,decay 分支是便宜的读数动作。scaling law 研究的瓶颈从来不是拟合数学,而是采样一个 $(N, D)$ 点要花一次训练——WSD 直接把采样成本砍掉一个量级,这是纯粹的工程杠杆。

3.4 MiniCPM 的高数据比:192 tokens/param

MiniCPM 用 WSD 分支法重做 compute-optimal 分析,得到的最优数据/模型比约为 192 tokens/param 量级——比 Chinchilla 的 20:1 高了近一个数量级。

这说明:

  • 20 tokens/param 不是固定规律:数据质量、tokenizer、架构、测量方法(WSD 分支 vs cosine 全训)都会改变拟合出的最优比例;
  • 对小模型而言,「多吃数据」的账本本来就更划算——小模型推理便宜,目标就是把单位参数的能力压到极限(与 Lecture 9 · 缩放定律 I:基础 第 7 节的 product-optimal 逻辑一致);
  • 也要保持怀疑:192:1 与 20:1 的巨大差距尚无公认解释,可能部分来自测量方法差异,这正是「缩放常数不可盲目跨设置搬运」的例证。

4. DeepSeek:不靠 muP 的直接搜索

DeepSeek LLM(7B/67B)公开了较完整的 scaling 分析,路线与 MiniCPM/CerebrasGPT 形成有趣对照:

  • 不使用 muP,而是把超参数本身当作缩放对象:直接在小规模上测「最优 batch / 最优 LR 随计算预算怎么变」,拟合幂律后外推;
  • 也使用 WSD 风格(multi-step)的 learning rate schedule;
  • 用 IsoFLOP 风格分析模型/数据分配。

4.1 超参数的缩放定律

方法:在一系列小预算上做网格实验,对每个预算 $C$ 找出接近最优 loss 的超参区间,再对「预算 → 最优超参」拟合幂律:

$$\eta_{\text{opt}}(C) \approx 0.3118\, C^{-0.1250}, \qquad B_{\text{opt}}(C) \approx 0.2920\, C^{0.3271}$$

($\eta$ 为学习率,$B$ 为 batch size(token 数),$C$ 为训练 FLOPs。)含义:预算越大,最优 LR 缓慢下降、最优 batch 稳步增大。

讲义特别提醒:这些拟合图并不总是很干净——「接近最优」的超参区间本身较宽(loss 对超参在最优点附近不敏感),点的散布明显,指数带着可观的不确定性。scaling 实践中充满噪声和人工判断,论文里一条漂亮的直线背后往往是大量筛选。

4.2 Data-Model Tradeoff

DeepSeek 用类似 Chinchilla Method 2 的 IsoFLOP 分析,但做了一个方法改进:不用 $C = 6N D$ 的参数计法,而是定义每 token 非 embedding FLOPs $M$(把 attention 的序列长度相关计算也算进去),用 $C = MD$ 做预算约束——在小模型上这比 $6ND$ 更准,因为 embedding 占比和 attention 开销在小规模不可忽略。拟合结果:

$$M_{\text{opt}} \propto C^{0.5243}, \qquad D_{\text{opt}} \propto C^{0.4757}$$

与 Chinchilla 的「各占约 0.5」基本一致。用该拟合预测最终 7B/67B 模型的 loss,实际结果与预测吻合较好——这是「小实验外推大模型」在公开文献里较干净的成功案例。

另一个重要发现:数据质量会改变最优分配。用更高质量的数据集重做分析时,最优点向「更大模型」偏移(模型指数升高、数据指数降低)。直觉:高质量数据单位 token 的信息量更大,同样的数据量能喂饱更大的模型(数据质量的处理见 Lecture 13 · 数据 I)。

提示

DeepSeek 和 muP 路线殊途同归:muP 靠理论构造让超参跨规模不变(换坐标系),DeepSeek 靠经验测量直接拟合超参怎么漂移(画出漂移曲线再外推)。前者优雅但怕假设被现代组件破坏,后者笨重但对「定律为什么成立」不作任何承诺。两条路线都成立,选哪条取决于你更信理论还是更信自己的实验预算。


5. 近期模型的 scaling recipe

模型 公开 scaling 线索
CerebrasGPT muP + Chinchilla 公式
MiniCPM muP + WSD + 高 token/param
DeepSeek 直接估 batch/LR + WSD + IsoFLOP
LLaMA 3 IsoFLOP 风格,数据/参数比显著高于早期 Chinchilla
Hunyuan-1 MoE scaling,关注 active parameters
MiniMax-01 架构 scaling + Chinchilla Method 1

几个案例值得多说两句:

  • LLaMA 3:用 IsoFLOP 实验(最高约 $10^{22}$ FLOPs)拟合出 compute-optimal 的 token 预算 $D^*(C) \approx 0.299\, C^{0.537}$,外推到 $3.8\times10^{25}$ FLOPs 预算时给出约 402B 参数 / 16.55T token 的最优点,最终选择 405B/15.6T——旗舰模型贴着 compute-optimal 训练,而 8B/70B 则严重过训练(15T token)以优化推理性价比。此外 LLaMA 3 用两步法预测下游能力:先用缩放定律预测 benchmark 上的 NLL(连续、可外推),再用小模型与 LLaMA 2 系列的数据拟合「NLL → 准确率」的映射,绕开下游指标不平滑的问题(对应 Lecture 12 · 评估 的效度讨论)。
  • Hunyuan-Large:MoE 模型的缩放要回答「$N$ 用总参数还是激活参数」。Hunyuan 的做法是按激活参数(active parameters)建立定律,并把长上下文 attention 的开销加进预算公式(约 $C \approx 9.6\,N_{\text{act}}D + 2.3\times10^{8}D$),得出最优约 58B 激活参数 / 5.6T token 的结论(实际配置 52B 激活 / 389B 总参数)。MoE 背景见 Lecture 4 · 混合专家模型 MoE
  • MiniMax-01:把 scaling law 用于架构选型——在多个规模上分别训练候选架构(softmax attention vs 线性 lightning attention vs 混合),比较整条缩放曲线而非单点,再决定最终的 hybrid 架构。这是「架构比较要看缩放趋势、防止小规模赢家在大规模被反超」的实践版。

结论很现实:

  • 大家都在用 scaling laws——这套方法论已是行业标配而非学术玩具;
  • 但配方并不统一:muP 与直接搜索并存、cosine 与 WSD 并存、20:1 到 1900:1 的数据比并存;
  • 公开细节仍然有限,论文往往只给结论不给失败案例;
  • 数据质量与模型架构会实质性改变最优比例,别人的常数不能直接抄。

6. muP 到底是什么?

6.1 目标(desiderata)

muP 想让宽度 $n$ 变化时,训练动态满足三个条件:

  1. 初始化时各层 activation 的典型元素尺度为 $\Theta(1)$——不随宽度爆炸或消失;
  2. 每步更新后activation 的变化量也是 $\Theta(1)$——特征在「最大程度地学习」(maximal update 之名由此而来),但不失控;
  3. 输出 logits 尺度稳定。三者合起来使最优 learning rate 近似与宽度无关,可从小模型迁移。

6.2 Baby muP:从一层线性网络看尺度

考虑深线性网络的一层:

$$h_{\ell} = W_{\ell}\, h_{\ell-1}, \qquad W_{\ell} \in \mathbb{R}^{n \times n}$$

初始化尺度:$h_{\ell}$ 的每个坐标是 $n$ 个独立项之和,若 $W$ 元素方差为 $\sigma^2$、$h_{\ell-1}$ 坐标为 $\Theta(1)$,则和的标准差为 $\Theta(\sigma\sqrt{n})$。要让 $\lVert h_{\ell}\rVert$ 逐层稳定,需 $\sigma = \Theta(1/\sqrt{n})$——这就是经典的 $1/\sqrt{\text{fan-in}}$ 初始化,muP 与标准做法在这一步一致。

更新尺度:一次优化步 $W_{\ell} \leftarrow W_{\ell} + \Delta W_{\ell}$ 后,激活变化为

$$\Delta h_{\ell} = W_{\ell}\,\Delta h_{\ell-1} + \Delta W_{\ell}\, h_{\ell-1} + \Delta W_{\ell}\,\Delta h_{\ell-1}$$

关键在 $\Delta W_{\ell} h_{\ell-1}$ 这一项。Adam 类优化器把每个元素的更新归一化到 $\Theta(\eta)$;而训练中 $\Delta W$ 与数据相关,它与 $h$ 的乘积是 $n$ 个同号相关项的求和——按 $n$ 线性累加而非 $\sqrt{n}$(这是与随机初始化时最大的区别:更新是「对齐的」,初始化是「随机的」)。于是 $\Delta h$ 坐标尺度为 $\Theta(\eta n)$,要保持 $\Theta(1)$ 就必须让隐藏层的 Adam LR 按 $\eta = \Theta(1/n)$ 缩放。这就是「最优 LR 随宽度漂移」的机制,也是 muP 修正它的位置。

汇总成 muP(Adam 版)的逐层规则($n$ 为宽度;等价写法很多,这是常见一种):

初始化方差 Adam LR
输入 / embedding $\Theta(1)$ $\Theta(1)$
隐藏层($n \times n$) $\Theta(1/n)$ $\Theta(1/n)$
输出 / readout $\Theta(1/n^2)$(或零初始化) $\Theta(1/n)$

另有一个配套修改:attention 内积缩放用 $1/d$ 取代 $1/\sqrt{d}$(训练后 query 与 key 对齐,内积按 $d$ 而非 $\sqrt{d}$ 增长)。

说明

上面的规则可以统一成一句话(Yang, Simon & Bernstein 的 spectral condition):每个权重矩阵的谱范数及其更新的谱范数都应满足 $\lVert W\rVert_2 \approx \lVert \Delta W\rVert_2 \approx \Theta\bigl(\sqrt{\text{fan-out}/\text{fan-in}}\bigr)$。逐层的初始化/LR 表格只是这个条件在不同形状矩阵上的展开。这个视角也解释了为什么 muP 本质是控制信号与更新的「阶」,而不只是改初始化标准差。

提示

muP 的全部内容就是让「宽度」从训练动态中约掉:初始化靠 $\sqrt{n}$ 的随机抵消、更新靠 $1/n$ 的 LR 压制 $n$ 倍的相关累加。两者都摆平后,一个 128 宽的模型和一个 8192 宽的模型在「每步学多少」意义上是同一台机器,超参数自然可以搬运。

6.3 哪些东西会破坏 muP?

muP 的推导基于较干净的假设(特定优化器行为、特定网络组件),现代 LLM 的很多组件不在其覆盖范围内。讲义结合大规模实证研究(Lingle 2024, “A Large-Scale Exploration of μ-Transfer”)给出的经验图景:

组件 影响
SwiGLU / Squared ReLU 实践中相对 robust,迁移基本成立
batch size 改变 理论未完全覆盖,经验上中等稳健
特殊初始化 可能改变「初始化尺度假设」,影响迁移
RMSNorm learnable gain 可训练增益给了网络自行改变尺度的旁路,可能破坏 muP 假设
sign-based optimizer(如 Lion) 更新尺度规律与 Adam 不同,muP 的 LR 规则不再对口
强 / decoupled weight decay 明显可能失败:AdamW 的衰减不随 LR 规则缩放,引入与宽度无关的额外尺度

逐条的因果逻辑:muP 的每条规则都在维持「某个尺度随宽度不变」,因此任何给网络引入额外自由尺度、或改变更新尺度规律的组件都是嫌疑对象——可训练的 norm 增益让网络绕开初始化规则自行放缩;sign-based 优化器的每步更新幅度与 Adam 的归一化假设不同;decoupled weight decay 直接往更新里加了一项不按 muP 缩放的收缩力。

结论:

  • muP 有用但不是无敌:它显著降低调参成本、让缩放曲线更干净,但每引入一个新组件都应重新验证迁移性;
  • 它不能替代真实的 scaling 实验——muP 管超参迁移,不管 $L(N,D)$ 曲面本身长什么样。

7. Scaling in the Wild 的困难

把前面所有案例合起来看,真实世界的 scaling 难在六个层面,每一层都可能让「拟合得很好的定律」失效:

  1. 架构超参数:宽度、深度、head 数、FFN ratio、MoE expert 数——形状虽然大范围不敏感,但架构族一换(dense → MoE、softmax → linear attention),定律的常数与指数都要重测。
  2. 优化超参数:LR、batch、weight decay、warmup 长度、decay 形状——它们既影响单次实验的 loss,又影响拟合出的定律本身(Kaplan 的 schedule 教训)。
  3. 数据配方:质量、重复、混合比例、tokenizer——数据质量会移动最优 $N/D$ 分配(DeepSeek 的发现),而数据配方本身在训练大模型时往往还在迭代。
  4. 训练调度:WSD/cosine、checkpoint 复用、退火时机——它们决定「测一个点」的成本,从而决定你能拟合多准。
  5. 指标选择:pretraining loss、下游任务、推理成本、产品目标——优化目标不同,最优点完全不同(train-optimal vs product-optimal)。
  6. 外推风险:小模型到大模型不是无条件相似——涌现行为、训练不稳定性(loss spike)、以及任何在大规模才出现的系统问题,都在拟合数据的支撑集之外。

注意

谁跟你说「按 Chinchilla 20:1 训就完事了」,基本是在省略最要命的工程部分:schedule 要对齐、超参要能迁移(muP 或直接拟合漂移)、数据质量要重测分配、目标函数要想清楚是训练最优还是产品最优。缩放定律给的是框架,常数永远要自己测。

提示

缩放实践本质上是一门「在噪声中做统计外推」的实验科学:每个数据点花真金白银,拟合永远欠采样,而你要在支撑集外下注数千万美元。所有工程技巧(muP、WSD、IsoFLOP)的共同目的只有一个——用同样的预算买到更多、更干净的数据点,让外推的置信区间小到敢签字的程度。


总结

mindmap
  root((缩放定律 II))
    Case Studies
      CerebrasGPT
      MiniCPM
      DeepSeek
      LLaMA 3
      Hunyuan
      MiniMax
    Hyperparameters
      LR
      batch
      WSD
      weight decay
    muP
      scale invariant tuning
      activation scale
      update scale
      robustness limits
    Chinchilla
      N-D tradeoff
      IsoFLOP
      joint fit
      data ratio not fixed
    Practice
      noisy fits
      expensive experiments
      product objective

关键要点

  1. 缩放定律实践比公式复杂
    - batch、LR、schedule、数据配方都会改变拟合结果;「常数要自己测」是本讲反复出现的主题。

  2. muP 试图让超参数跨宽度迁移
    - 核心是控制初始化与更新的尺度阶(隐藏层 init $\Theta(1/n)$、Adam LR $\Theta(1/n)$);对 SwiGLU 等组件 robust,但 trainable gain、sign-based 优化器、decoupled weight decay 可能破坏它。

  3. WSD 是 scaling 实验的关键工程杠杆
    - stable 段 + 可分叉 decay 把拟合 $L(N,D)$ 的成本从 $O(mn)$ 次完整训练降到 $O(m)$ 次长训练加便宜分支。

  4. 20 tokens/param 不是固定真理
    - MiniCPM(~192:1)、LLaMA 3(8B 用 ~1900:1)等实践显示:数据质量、测量方法、推理成本都会移动最优比例。

  5. muP 与直接搜索是两条并行路线
    - CerebrasGPT/MiniCPM 用理论构造保迁移,DeepSeek 直接拟合超参漂移的幂律——两条路都被验证可行。

  6. 公开 scaling recipe 仍稀缺
    - 能认真读懂公开细节、辨别哪些常数可复用,本身就是做大模型工程的竞争力。

下一讲预告(Lecture 12 · 评估

知道怎么训练多大模型之后,还要问:模型到底好不好?下一讲进入评估:perplexity、MMLU/GPQA/HLE、Chatbot Arena、agent benchmark、安全评测、数据污染与评估效度——也回应本讲的遗留问题:缩放定律优化的 loss,与我们真正关心的能力之间隔着什么。


复习自测

题目

cosine 的形状绑定总训练长度,每个 $(N, D)$ 点都要从头训练一次才是「认真退火后」的 loss。WSD 的 stable 段与长度无关:每个模型大小只跑一次到最大预算的 stable 训练,在 $n$ 个中间 checkpoint 各分叉一段约 10% 成本的 decay 即可读出各预算的 loss。总成本从 $mn$ 次完整训练降到 $m$ 次长训练 + $mn$ 次约 0.1 倍成本的 decay 分支,约节省一个量级。

题目

两者对付的求和性质不同。初始化时 $W$ 与 $h$ 独立随机,$(Wh)_i$ 是 $n$ 项不相关求和,尺度按 $\sqrt{n}$ 增长,$\sigma = \Theta(1/\sqrt{n})$ 即可抵消。训练更新 $\Delta W$ 与数据(从而与 $h$)相关,$(\Delta W h)_i$ 的 $n$ 项同向累加、按 $n$ 线性增长;Adam 把每元素更新归一化到 $\Theta(\eta)$,故需 $\eta = \Theta(1/n)$ 才能让每步的激活变化保持 $\Theta(1)$。

题目

DeepSeek 把最优超参本身当缩放对象:在一系列小预算上实测最优 LR 与 batch,拟合 $\eta_{\text{opt}} \propto C^{-0.125}$、$B_{\text{opt}} \propto C^{0.327}$ 后外推到大预算。风险对比:muP 依赖理论假设,新组件(trainable gain、Lion、decoupled weight decay)可能悄悄破坏迁移;直接拟合不依赖假设但测量噪声大(最优区间宽、点散布明显),且每换一次配方都要重测。

题目

不必然矛盾。其一,测量方法不同:MiniCPM 用 WSD 分支读数,Chinchilla 用 cosine 全训,schedule 对 loss-vs-数据曲线形状有系统影响;其二,数据与 tokenizer 不同:数据质量会移动最优分配(DeepSeek 的发现),常数本就不可跨设置搬运;其三,即便 compute-optimal 真的在 20:1 附近,小模型出于推理成本考虑主动过训练也是理性选择——但 MiniCPM 声称 192:1 本身就是 compute-optimal,这个分歧至今没有公认解释,恰好说明缩放常数的脆弱性。

题目

muP 的机制是让「每步更新对激活的影响」随宽度不变,其推导只覆盖梯度驱动的更新项。decoupled weight decay 在更新里额外加了一项 $-\lambda w$ 的收缩力,它不经过 Adam 归一化、也不按 muP 的逐层 LR 规则缩放,于是不同宽度下「梯度项 : 衰减项」的比例发生漂移,等效正则强度随宽度变化,最优超参不再跨宽度对齐。


参考资料