CS336 · 从零构建语言模型
Lecture 11 · 缩放定律 II:细节
源文件:lecture-11.md
Lecture 11 · 缩放定律 II:细节
CS336: Language Modeling from Scratch · Stanford · Spring 2025
📅 May 6 · 💻 不可执行讲义(PDF) · 讲者 Tatsunori Hashimoto
承上启下
上一讲(Lecture 10 · 推理):训练完模型之后,推理成本会长期存在——generation 是 memory-bound,KV cache 和动态 batching 是核心问题。这也解释了 Lecture 9 · 缩放定律 I:基础 末尾的结论:考虑推理成本后,train-optimal 不等于 product-optimal。
本讲(缩放细节):回到训练前的决策问题。Lecture 9 给了理想化框架——$L(N,D)$ 曲面、$C \approx 6ND$ 约束、Chinchilla 三方法;本讲看这套框架在真实模型里到底怎么用:重点案例是 CerebrasGPT、MiniCPM、DeepSeek、LLaMA 3、Hunyuan、MiniMax;并深入 muP——它为什么声称能让小模型超参数迁移到大模型?实践上靠谱不靠谱?
摘要
缩放定律落地时,难点不只是拟合 $L(N,D)$,还包括 batch size、learning rate、LR schedule(WSD vs cosine)、muP 参数化、数据/模型比例的选择,以及「小实验测得的规律」与「最终大模型」之间每一处可能断裂的环节;各家 recipe 在流程上趋同、在常数上分歧。
1. 实践中的缩放问题
Lecture 9 · 缩放定律 I:基础 建立的基础形式是:
$$L(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}, \qquad C \approx 6ND$$
($N$ 参数量、$D$ 训练 token 数、$E$ 不可约损失、$\alpha,\beta$ 缩放指数。)但拿着这两个公式去训一个真实模型,马上会撞上一排公式没有回答的问题:
- 小模型上调好的 learning rate,换到大模型还成立吗?(朴素参数化下不成立——最优 LR 随宽度漂移。)
- batch size 应该怎么随目标 loss 和规模变化?
- LR schedule 用 cosine 还是 WSD?这个选择甚至影响「拟合缩放定律本身要花多少钱」。
- 到底要训练多少个小模型、覆盖多大的规模范围,拟合出的定律才可信?
- Chinchilla 的 20:1 比例在新架构、新数据、新 tokenizer 上还成立吗?
- MoE 模型(见 Lecture 4 · 混合专家模型 MoE)该按总参数还是激活参数套用定律?
本讲的方式是读几个公开细节较多的模型的 scaling recipe,看各家怎么回答这些问题。
提示
Lecture 9 是「定律」,本讲是「配方」。定律描述理想气体,配方处理真实气体:每一个工程环节(schedule、参数化、数据质量)都可能让拟合出来的常数失效。读懂几份真实 recipe 的价值在于知道哪些环节必须自己重新测量、哪些可以放心复用。
2. CerebrasGPT:muP + Chinchilla recipe
CerebrasGPT 训练了 111M 到 13B 的一组模型,每个都按 Chinchilla 比例(约 20 tokens/param)配数据,目标是验证「muP + Chinchilla recipe」能否得到干净可预测的缩放曲线。
核心发现:
- 同一组模型分别用标准参数化(SP)和 muP(maximal update parametrization)训练对比:muP 版本 loss 更低、缩放曲线更贴合幂律;
- muP 下,小模型(40M 量级的 proxy model)上扫出的 learning rate 等超参数可以直接迁移到大模型,省掉大模型上的超参搜索;
- 由此整条「小实验 → 外推」流水线的可信度提高——超参数不再是外推时的隐藏变量。
2.1 为什么需要 muP?
朴素参数化下,模型变宽时会发生一连串连锁漂移:
- 各层 activation 的尺度随宽度变化(求和的项数变多);
- 一步优化带来的参数更新对 activation 的扰动尺度也随宽度变化;
- 于是最优 learning rate 随宽度漂移——小模型的最优 LR 拿到大模型上往往过大,轻则次优、重则发散;
- 结论:小模型上的调参结果不能直接迁移,而大模型上调参又恰恰是最贵的。
muP 的目标可以概括为一句话:
$$\text{让不同宽度的模型在训练动态上可比}$$
具体拆成三个愿望(desiderata):
- 初始化时各层 activation 尺度稳定(不随宽度爆炸或消失);
- 训练更新后 activation 的变化量尺度也稳定(特征确实在学习,但幅度可控);
- 于是最优 learning rate 在宽度缩放下近似不变,可从小模型直接迁移。
muP 的具体构造与失效条件见第 6 节。
提示
muP 像给不同宽度的模型做「单位换算」:直接比较各自坐标系下的 LR 没有意义(如同比较米和英尺的数字),muP 把初始化和 LR 都按宽度重新标定后,不同宽度的模型落进同一个坐标系,「最优 LR」才成为一个跨规模有意义的量。
3. MiniCPM:小模型高性能与 WSD
MiniCPM 是清华/面壁团队的小模型系列(1.2B、2.4B 非 embedding 参数量级),核心主张:
- 1B–2.5B 量级也能做出接近更大模型的性能,前提是把 scaling 实验做足;
- 用 muP 风格的参数化(tensor program 技巧)稳定跨规模调参;
- 用 WSD learning rate schedule 大幅降低 Chinchilla 式分析的成本。
3.1 MiniCPM 的缩放策略
大致流程:
- 用 muP 风格参数化设定初始化与 LR,使超参可跨规模迁移;
- 固定模型形状(aspect ratio),只整体缩放模型大小——利用 Lecture 9 的结论「形状在宽范围内不敏感」,把搜索空间压到一维;
- 在 0.01B–0.5B 的小 proxy 模型上搜索 batch size、LR、数据/模型比例;
- 外推到最终 1.2B/2.4B 模型的完整训练。
讲义中提到的参数化设置例子:
| 模型/论文 | 典型设置 |
|---|---|
| MiniCPM | scale_emb=12, scale_depth=1.4, init_std=0.1, lr=0.01 |
| CerebrasGPT | scale_emb=10, lr=6e-3, init_base=0.08 |
这些旋钮的含义:scale_emb 是 embedding 输出的乘子(muP 下 embedding 层与隐藏层的 LR/尺度规则不同,用乘子补偿);scale_depth 控制残差分支的缩放(MiniCPM 用 $1.4/\sqrt{n_{\text{layers}}}$ 抑制深度方向的信号累积);init_std 是基准初始化标准差;lr 是 proxy 宽度下的基准学习率,muP 保证它随宽度按规则缩放后依然近似最优。
3.2 Optimal Batch Size
MiniCPM 用多个小模型、多个数据量、多个 batch size 画出训练曲面,观察到:
- 最优 batch size 主要由目标 loss 决定:loss 越低,最优 batch 越大——这延续了 Kaplan/McCandlish 的临界批量分析(见 Lecture 9 · 缩放定律 I:基础 第 5.2 节);
- 拟合出的经验关系约为 $B^*(L) \approx 1.21\times10^{9}/L^{6.24}$ token——指数很大,意味着训练后期(loss 低时)可以且应该用大得多的 batch;
- 这类关系给了「batch size 随训练进程增大」策略一个定量依据。
3.3 WSD Learning Rate Schedule
WSD = Warmup-Stable-Decay:先 warmup,然后长期保持恒定 LR(stable 段),最后快速退火(decay 段,约占总步数的 10%)。
graph LR
W["Warmup"] --> S["Stable plateau"]
S --> D["Decay"]
与 cosine schedule 的关键区别不在最终 loss(两者相近,WSD 常略好),而在实验经济学:
- cosine 的形状与总训练长度绑定——想测「同一模型、不同 token 预算」的 $n$ 个点,就要从头跑 $n$ 次完整训练(Lecture 9 讲过:schedule 不匹配训练长度会系统性高估 loss,这正是 Kaplan 的教训);
- WSD 的 stable 段与训练长度无关——跑一次长的 stable 训练,在任意中间 checkpoint 分叉出一小段 decay(约 10% 成本),就得到「该 token 预算下认真退火后的 loss」;
- 于是拟合 $L(N,D)$ 曲面的成本从「$m$ 个模型大小 × $n$ 个数据量 = $mn$ 次完整训练」降到「$m$ 次长训练 + $mn$ 次便宜的 decay 分支」。
训练动态上,stable 段的 loss 会显得偏高,进入 decay 段后 loss 断崖式下降——所以比较 WSD 实验的 loss 必须比较 decay 后的值,不能拿 stable 段中途的值和 cosine 比。
提示
WSD 把「一次训练」变成「一份可复用资产」:stable 段是所有数据预算共享的主干,decay 分支是便宜的读数动作。scaling law 研究的瓶颈从来不是拟合数学,而是采样一个 $(N, D)$ 点要花一次训练——WSD 直接把采样成本砍掉一个量级,这是纯粹的工程杠杆。
3.4 MiniCPM 的高数据比:192 tokens/param
MiniCPM 用 WSD 分支法重做 compute-optimal 分析,得到的最优数据/模型比约为 192 tokens/param 量级——比 Chinchilla 的 20:1 高了近一个数量级。
这说明:
- 20 tokens/param 不是固定规律:数据质量、tokenizer、架构、测量方法(WSD 分支 vs cosine 全训)都会改变拟合出的最优比例;
- 对小模型而言,「多吃数据」的账本本来就更划算——小模型推理便宜,目标就是把单位参数的能力压到极限(与 Lecture 9 · 缩放定律 I:基础 第 7 节的 product-optimal 逻辑一致);
- 也要保持怀疑:192:1 与 20:1 的巨大差距尚无公认解释,可能部分来自测量方法差异,这正是「缩放常数不可盲目跨设置搬运」的例证。
4. DeepSeek:不靠 muP 的直接搜索
DeepSeek LLM(7B/67B)公开了较完整的 scaling 分析,路线与 MiniCPM/CerebrasGPT 形成有趣对照:
- 不使用 muP,而是把超参数本身当作缩放对象:直接在小规模上测「最优 batch / 最优 LR 随计算预算怎么变」,拟合幂律后外推;
- 也使用 WSD 风格(multi-step)的 learning rate schedule;
- 用 IsoFLOP 风格分析模型/数据分配。
4.1 超参数的缩放定律
方法:在一系列小预算上做网格实验,对每个预算 $C$ 找出接近最优 loss 的超参区间,再对「预算 → 最优超参」拟合幂律:
$$\eta_{\text{opt}}(C) \approx 0.3118\, C^{-0.1250}, \qquad B_{\text{opt}}(C) \approx 0.2920\, C^{0.3271}$$
($\eta$ 为学习率,$B$ 为 batch size(token 数),$C$ 为训练 FLOPs。)含义:预算越大,最优 LR 缓慢下降、最优 batch 稳步增大。
讲义特别提醒:这些拟合图并不总是很干净——「接近最优」的超参区间本身较宽(loss 对超参在最优点附近不敏感),点的散布明显,指数带着可观的不确定性。scaling 实践中充满噪声和人工判断,论文里一条漂亮的直线背后往往是大量筛选。
4.2 Data-Model Tradeoff
DeepSeek 用类似 Chinchilla Method 2 的 IsoFLOP 分析,但做了一个方法改进:不用 $C = 6N D$ 的参数计法,而是定义每 token 非 embedding FLOPs $M$(把 attention 的序列长度相关计算也算进去),用 $C = MD$ 做预算约束——在小模型上这比 $6ND$ 更准,因为 embedding 占比和 attention 开销在小规模不可忽略。拟合结果:
$$M_{\text{opt}} \propto C^{0.5243}, \qquad D_{\text{opt}} \propto C^{0.4757}$$
与 Chinchilla 的「各占约 0.5」基本一致。用该拟合预测最终 7B/67B 模型的 loss,实际结果与预测吻合较好——这是「小实验外推大模型」在公开文献里较干净的成功案例。
另一个重要发现:数据质量会改变最优分配。用更高质量的数据集重做分析时,最优点向「更大模型」偏移(模型指数升高、数据指数降低)。直觉:高质量数据单位 token 的信息量更大,同样的数据量能喂饱更大的模型(数据质量的处理见 Lecture 13 · 数据 I)。
提示
DeepSeek 和 muP 路线殊途同归:muP 靠理论构造让超参跨规模不变(换坐标系),DeepSeek 靠经验测量直接拟合超参怎么漂移(画出漂移曲线再外推)。前者优雅但怕假设被现代组件破坏,后者笨重但对「定律为什么成立」不作任何承诺。两条路线都成立,选哪条取决于你更信理论还是更信自己的实验预算。
5. 近期模型的 scaling recipe
| 模型 | 公开 scaling 线索 |
|---|---|
| CerebrasGPT | muP + Chinchilla 公式 |
| MiniCPM | muP + WSD + 高 token/param |
| DeepSeek | 直接估 batch/LR + WSD + IsoFLOP |
| LLaMA 3 | IsoFLOP 风格,数据/参数比显著高于早期 Chinchilla |
| Hunyuan-1 | MoE scaling,关注 active parameters |
| MiniMax-01 | 架构 scaling + Chinchilla Method 1 |
几个案例值得多说两句:
- LLaMA 3:用 IsoFLOP 实验(最高约 $10^{22}$ FLOPs)拟合出 compute-optimal 的 token 预算 $D^*(C) \approx 0.299\, C^{0.537}$,外推到 $3.8\times10^{25}$ FLOPs 预算时给出约 402B 参数 / 16.55T token 的最优点,最终选择 405B/15.6T——旗舰模型贴着 compute-optimal 训练,而 8B/70B 则严重过训练(15T token)以优化推理性价比。此外 LLaMA 3 用两步法预测下游能力:先用缩放定律预测 benchmark 上的 NLL(连续、可外推),再用小模型与 LLaMA 2 系列的数据拟合「NLL → 准确率」的映射,绕开下游指标不平滑的问题(对应 Lecture 12 · 评估 的效度讨论)。
- Hunyuan-Large:MoE 模型的缩放要回答「$N$ 用总参数还是激活参数」。Hunyuan 的做法是按激活参数(active parameters)建立定律,并把长上下文 attention 的开销加进预算公式(约 $C \approx 9.6\,N_{\text{act}}D + 2.3\times10^{8}D$),得出最优约 58B 激活参数 / 5.6T token 的结论(实际配置 52B 激活 / 389B 总参数)。MoE 背景见 Lecture 4 · 混合专家模型 MoE。
- MiniMax-01:把 scaling law 用于架构选型——在多个规模上分别训练候选架构(softmax attention vs 线性 lightning attention vs 混合),比较整条缩放曲线而非单点,再决定最终的 hybrid 架构。这是「架构比较要看缩放趋势、防止小规模赢家在大规模被反超」的实践版。
结论很现实:
- 大家都在用 scaling laws——这套方法论已是行业标配而非学术玩具;
- 但配方并不统一:muP 与直接搜索并存、cosine 与 WSD 并存、20:1 到 1900:1 的数据比并存;
- 公开细节仍然有限,论文往往只给结论不给失败案例;
- 数据质量与模型架构会实质性改变最优比例,别人的常数不能直接抄。
6. muP 到底是什么?
6.1 目标(desiderata)
muP 想让宽度 $n$ 变化时,训练动态满足三个条件:
- 初始化时各层 activation 的典型元素尺度为 $\Theta(1)$——不随宽度爆炸或消失;
- 每步更新后activation 的变化量也是 $\Theta(1)$——特征在「最大程度地学习」(maximal update 之名由此而来),但不失控;
- 输出 logits 尺度稳定。三者合起来使最优 learning rate 近似与宽度无关,可从小模型迁移。
6.2 Baby muP:从一层线性网络看尺度
考虑深线性网络的一层:
$$h_{\ell} = W_{\ell}\, h_{\ell-1}, \qquad W_{\ell} \in \mathbb{R}^{n \times n}$$
初始化尺度:$h_{\ell}$ 的每个坐标是 $n$ 个独立项之和,若 $W$ 元素方差为 $\sigma^2$、$h_{\ell-1}$ 坐标为 $\Theta(1)$,则和的标准差为 $\Theta(\sigma\sqrt{n})$。要让 $\lVert h_{\ell}\rVert$ 逐层稳定,需 $\sigma = \Theta(1/\sqrt{n})$——这就是经典的 $1/\sqrt{\text{fan-in}}$ 初始化,muP 与标准做法在这一步一致。
更新尺度:一次优化步 $W_{\ell} \leftarrow W_{\ell} + \Delta W_{\ell}$ 后,激活变化为
$$\Delta h_{\ell} = W_{\ell}\,\Delta h_{\ell-1} + \Delta W_{\ell}\, h_{\ell-1} + \Delta W_{\ell}\,\Delta h_{\ell-1}$$
关键在 $\Delta W_{\ell} h_{\ell-1}$ 这一项。Adam 类优化器把每个元素的更新归一化到 $\Theta(\eta)$;而训练中 $\Delta W$ 与数据相关,它与 $h$ 的乘积是 $n$ 个同号相关项的求和——按 $n$ 线性累加而非 $\sqrt{n}$(这是与随机初始化时最大的区别:更新是「对齐的」,初始化是「随机的」)。于是 $\Delta h$ 坐标尺度为 $\Theta(\eta n)$,要保持 $\Theta(1)$ 就必须让隐藏层的 Adam LR 按 $\eta = \Theta(1/n)$ 缩放。这就是「最优 LR 随宽度漂移」的机制,也是 muP 修正它的位置。
汇总成 muP(Adam 版)的逐层规则($n$ 为宽度;等价写法很多,这是常见一种):
| 层 | 初始化方差 | Adam LR |
|---|---|---|
| 输入 / embedding | $\Theta(1)$ | $\Theta(1)$ |
| 隐藏层($n \times n$) | $\Theta(1/n)$ | $\Theta(1/n)$ |
| 输出 / readout | $\Theta(1/n^2)$(或零初始化) | $\Theta(1/n)$ |
另有一个配套修改:attention 内积缩放用 $1/d$ 取代 $1/\sqrt{d}$(训练后 query 与 key 对齐,内积按 $d$ 而非 $\sqrt{d}$ 增长)。
说明
上面的规则可以统一成一句话(Yang, Simon & Bernstein 的 spectral condition):每个权重矩阵的谱范数及其更新的谱范数都应满足 $\lVert W\rVert_2 \approx \lVert \Delta W\rVert_2 \approx \Theta\bigl(\sqrt{\text{fan-out}/\text{fan-in}}\bigr)$。逐层的初始化/LR 表格只是这个条件在不同形状矩阵上的展开。这个视角也解释了为什么 muP 本质是控制信号与更新的「阶」,而不只是改初始化标准差。
提示
muP 的全部内容就是让「宽度」从训练动态中约掉:初始化靠 $\sqrt{n}$ 的随机抵消、更新靠 $1/n$ 的 LR 压制 $n$ 倍的相关累加。两者都摆平后,一个 128 宽的模型和一个 8192 宽的模型在「每步学多少」意义上是同一台机器,超参数自然可以搬运。
6.3 哪些东西会破坏 muP?
muP 的推导基于较干净的假设(特定优化器行为、特定网络组件),现代 LLM 的很多组件不在其覆盖范围内。讲义结合大规模实证研究(Lingle 2024, “A Large-Scale Exploration of μ-Transfer”)给出的经验图景:
| 组件 | 影响 |
|---|---|
| SwiGLU / Squared ReLU | 实践中相对 robust,迁移基本成立 |
| batch size 改变 | 理论未完全覆盖,经验上中等稳健 |
| 特殊初始化 | 可能改变「初始化尺度假设」,影响迁移 |
| RMSNorm learnable gain | 可训练增益给了网络自行改变尺度的旁路,可能破坏 muP 假设 |
| sign-based optimizer(如 Lion) | 更新尺度规律与 Adam 不同,muP 的 LR 规则不再对口 |
| 强 / decoupled weight decay | 明显可能失败:AdamW 的衰减不随 LR 规则缩放,引入与宽度无关的额外尺度 |
逐条的因果逻辑:muP 的每条规则都在维持「某个尺度随宽度不变」,因此任何给网络引入额外自由尺度、或改变更新尺度规律的组件都是嫌疑对象——可训练的 norm 增益让网络绕开初始化规则自行放缩;sign-based 优化器的每步更新幅度与 Adam 的归一化假设不同;decoupled weight decay 直接往更新里加了一项不按 muP 缩放的收缩力。
结论:
- muP 有用但不是无敌:它显著降低调参成本、让缩放曲线更干净,但每引入一个新组件都应重新验证迁移性;
- 它不能替代真实的 scaling 实验——muP 管超参迁移,不管 $L(N,D)$ 曲面本身长什么样。
7. Scaling in the Wild 的困难
把前面所有案例合起来看,真实世界的 scaling 难在六个层面,每一层都可能让「拟合得很好的定律」失效:
- 架构超参数:宽度、深度、head 数、FFN ratio、MoE expert 数——形状虽然大范围不敏感,但架构族一换(dense → MoE、softmax → linear attention),定律的常数与指数都要重测。
- 优化超参数:LR、batch、weight decay、warmup 长度、decay 形状——它们既影响单次实验的 loss,又影响拟合出的定律本身(Kaplan 的 schedule 教训)。
- 数据配方:质量、重复、混合比例、tokenizer——数据质量会移动最优 $N/D$ 分配(DeepSeek 的发现),而数据配方本身在训练大模型时往往还在迭代。
- 训练调度:WSD/cosine、checkpoint 复用、退火时机——它们决定「测一个点」的成本,从而决定你能拟合多准。
- 指标选择:pretraining loss、下游任务、推理成本、产品目标——优化目标不同,最优点完全不同(train-optimal vs product-optimal)。
- 外推风险:小模型到大模型不是无条件相似——涌现行为、训练不稳定性(loss spike)、以及任何在大规模才出现的系统问题,都在拟合数据的支撑集之外。
注意
谁跟你说「按 Chinchilla 20:1 训就完事了」,基本是在省略最要命的工程部分:schedule 要对齐、超参要能迁移(muP 或直接拟合漂移)、数据质量要重测分配、目标函数要想清楚是训练最优还是产品最优。缩放定律给的是框架,常数永远要自己测。
提示
缩放实践本质上是一门「在噪声中做统计外推」的实验科学:每个数据点花真金白银,拟合永远欠采样,而你要在支撑集外下注数千万美元。所有工程技巧(muP、WSD、IsoFLOP)的共同目的只有一个——用同样的预算买到更多、更干净的数据点,让外推的置信区间小到敢签字的程度。
总结
mindmap
root((缩放定律 II))
Case Studies
CerebrasGPT
MiniCPM
DeepSeek
LLaMA 3
Hunyuan
MiniMax
Hyperparameters
LR
batch
WSD
weight decay
muP
scale invariant tuning
activation scale
update scale
robustness limits
Chinchilla
N-D tradeoff
IsoFLOP
joint fit
data ratio not fixed
Practice
noisy fits
expensive experiments
product objective
关键要点:
-
缩放定律实践比公式复杂
- batch、LR、schedule、数据配方都会改变拟合结果;「常数要自己测」是本讲反复出现的主题。 -
muP 试图让超参数跨宽度迁移
- 核心是控制初始化与更新的尺度阶(隐藏层 init $\Theta(1/n)$、Adam LR $\Theta(1/n)$);对 SwiGLU 等组件 robust,但 trainable gain、sign-based 优化器、decoupled weight decay 可能破坏它。 -
WSD 是 scaling 实验的关键工程杠杆
- stable 段 + 可分叉 decay 把拟合 $L(N,D)$ 的成本从 $O(mn)$ 次完整训练降到 $O(m)$ 次长训练加便宜分支。 -
20 tokens/param 不是固定真理
- MiniCPM(~192:1)、LLaMA 3(8B 用 ~1900:1)等实践显示:数据质量、测量方法、推理成本都会移动最优比例。 -
muP 与直接搜索是两条并行路线
- CerebrasGPT/MiniCPM 用理论构造保迁移,DeepSeek 直接拟合超参漂移的幂律——两条路都被验证可行。 -
公开 scaling recipe 仍稀缺
- 能认真读懂公开细节、辨别哪些常数可复用,本身就是做大模型工程的竞争力。
下一讲预告(Lecture 12 · 评估):
知道怎么训练多大模型之后,还要问:模型到底好不好?下一讲进入评估:perplexity、MMLU/GPQA/HLE、Chatbot Arena、agent benchmark、安全评测、数据污染与评估效度——也回应本讲的遗留问题:缩放定律优化的 loss,与我们真正关心的能力之间隔着什么。
复习自测
题目
cosine 的形状绑定总训练长度,每个 $(N, D)$ 点都要从头训练一次才是「认真退火后」的 loss。WSD 的 stable 段与长度无关:每个模型大小只跑一次到最大预算的 stable 训练,在 $n$ 个中间 checkpoint 各分叉一段约 10% 成本的 decay 即可读出各预算的 loss。总成本从 $mn$ 次完整训练降到 $m$ 次长训练 + $mn$ 次约 0.1 倍成本的 decay 分支,约节省一个量级。
题目
两者对付的求和性质不同。初始化时 $W$ 与 $h$ 独立随机,$(Wh)_i$ 是 $n$ 项不相关求和,尺度按 $\sqrt{n}$ 增长,$\sigma = \Theta(1/\sqrt{n})$ 即可抵消。训练更新 $\Delta W$ 与数据(从而与 $h$)相关,$(\Delta W h)_i$ 的 $n$ 项同向累加、按 $n$ 线性增长;Adam 把每元素更新归一化到 $\Theta(\eta)$,故需 $\eta = \Theta(1/n)$ 才能让每步的激活变化保持 $\Theta(1)$。
题目
DeepSeek 把最优超参本身当缩放对象:在一系列小预算上实测最优 LR 与 batch,拟合 $\eta_{\text{opt}} \propto C^{-0.125}$、$B_{\text{opt}} \propto C^{0.327}$ 后外推到大预算。风险对比:muP 依赖理论假设,新组件(trainable gain、Lion、decoupled weight decay)可能悄悄破坏迁移;直接拟合不依赖假设但测量噪声大(最优区间宽、点散布明显),且每换一次配方都要重测。
题目
不必然矛盾。其一,测量方法不同:MiniCPM 用 WSD 分支读数,Chinchilla 用 cosine 全训,schedule 对 loss-vs-数据曲线形状有系统影响;其二,数据与 tokenizer 不同:数据质量会移动最优分配(DeepSeek 的发现),常数本就不可跨设置搬运;其三,即便 compute-optimal 真的在 20:1 附近,小模型出于推理成本考虑主动过训练也是理性选择——但 MiniCPM 声称 192:1 本身就是 compute-optimal,这个分歧至今没有公认解释,恰好说明缩放常数的脆弱性。
题目
muP 的机制是让「每步更新对激活的影响」随宽度不变,其推导只覆盖梯度驱动的更新项。decoupled weight decay 在更新里额外加了一项 $-\lambda w$ 的收缩力,它不经过 Adam 归一化、也不按 muP 的逐层 LR 规则缩放,于是不同宽度下「梯度项 : 衰减项」的比例发生漂移,等效正则强度随宽度变化,最优超参不再跨宽度对齐。
参考资料
- 💻 2025 Lecture 11 - Scaling details.pdf(官方讲义)
- 📄 Cerebras-GPT
- 📄 MiniCPM
- 📄 DeepSeek LLM
- 📄 Tensor Programs V: muP
- 📄 Training Compute-Optimal Large Language Models
- 📄 The Llama 3 Herd of Models
- 📄 A Large-Scale Exploration of μ-Transfer
- 📄 A Spectral Condition for Feature Learning
- 📄 Hunyuan-Large
- 📄 MiniMax-01