LLMWIKI · CONCEPT
Grokking (格鲁金) — 神经网络的"开悟"现象
2021 年 OpenAI 偶然发现的反直觉学习动力学:模型严重过拟合、看似只会死记硬背之后,如果继续训练,会在某个时刻突然涌现完美的泛化能力——从"记忆"到"理解"的相变。机械可解释性证明,模型在那一刻自发发现了傅里叶变换。
免费开放 · 更新于
TL;DR2021 年 OpenAI 偶然发现的反直觉学习动力学:模型严重过拟合、看似只会死记硬背之后,如果继续训练,会在某个时刻突然涌现完美的泛化能力——从"记忆"到"理解"的相变。机械可解释性证明,模型在那一刻自发发现了傅里叶变换。
Grokking (中译"格鲁金") 是 2021 年 OpenAI 研究团队(Power et al.)在简单模算术任务上偶然发现的反直觉学习动力学^1。"Grok" 一词来自科幻作家罗伯特·海因莱因的小说《异乡异客》(Stranger in a Strange Land),意为"极其深刻地理解某事,以至于观察者与被观察者融为一体"^1。
在 AI 语境下,它描述的是这样一个违反所有经典机器学习直觉的过程:
- 训练神经网络做模加法 $a + b = c \pmod P$
- 训练初期:模型迅速记住所有训练样本(训练准确率 100%),但测试准确率几乎是随机猜测水平
- 按经典理论,此时应该"早停"——模型已经过拟合了
- 然而如果继续训练几千甚至几万步,模型在某个时刻突然从测试 0% 跳到测试 100%
- 这是相变 (Phase Transition),不是渐变
graph LR
A[Step 0<br/>训练0%<br/>测试0%] --> B[Step 1000<br/>训练100%<br/>测试0%<br/>死记硬背]
B --> C[Step 1000-7000<br/>训练100%<br/>测试0%<br/>表面停滞]
C --> D[Step 7000<br/>训练100%<br/>测试100%<br/>突然顿悟]
style B fill:#fcc
style C fill:#ffc
style D fill:#cfc黑箱中发生了什么
2022-2023 年 Neel Nanda 团队的逆向工程是 机械可解释性 领域的奠基性工作。他们发现,神经网络没有像人类小学生那样通过进位、借位、数数计算加法。它"自发地"发明并实现了一种基于离散傅里叶变换 (Discrete Fourier Transform, DFT) 的高级算法^1。
具体来说:
- 在训练早期,神经元激活模式杂乱无章(对应死记硬背)
- 在 Grokking 发生后,研究人员观察 MLP 层激活模式,看到了清晰、完美的正弦波 $\cos(\omega x)$ 和 $\sin(\omega x)$
- 模型自发地学会了三角恒等式: $$\cos(a+b) = \cos(a)\cos(b) - \sin(a)\sin(b)$$
- 把模加法 → 转化为频率域的旋转 → 通过相长干涉读出答案
模型在从未见过三角函数的情况下,独立"发现"了它^1。
训练三阶段的动力学
Nanda 团队用"限制损失"和"排除损失"两个指标,把那个看似停滞的平台期拍下来了:
| 阶段 | 表面现象 | 内部机制 |
|---|---|---|
| 记忆期 (0-2000 步) | 训练损失迅速降低 | 死记硬背"记忆电路"在形成 |
| 电路形成期 (2000-7000 步) | 训练100%/测试0%,看似停滞 | 暗流涌动:傅里叶电路在悄悄长出,记忆电路在被权重衰减侵蚀 |
| 清理期 (7000+ 步) | 测试 0% → 100% 跃迁 | 权重 L2 范数急剧下降——优化器清理掉记忆电路,只留下精简的傅里叶电路 |
权重衰减 (Weight Decay) 是真正的"幕后推手"^1:
- 死记硬背是"稠密"解法,需要大量参数,权重大
- 傅里叶算法是"稀疏"解法,几个关键频率就够,权重小
- 权重衰减惩罚大权重 → 长期施加进化压力 → 最终把笨重的记忆压扁,留下精简的算法
为什么 Grokking 是革命性的
这一发现颠覆了三个常识:
- 早停不一定对:经典理论说"过拟合就该停",Grokking 说"继续训练,质变在后面"
- 过参数化不是坏事:参数远多于数据,反而让模型有空间"探索"通用算法
- 理解 ≠ 学习:模型可以先学到表面规律,再涌现深层结构——这是两次完全不同的学习
与本频道其他概念的紧密对接
Grokking 是本频道最被反复引用的工程命题之一,因为它在工程上证实了几条平行命题:
| 维度 | 频道命题 | Grokking 中的工程实证 |
|---|---|---|
| 顿悟 | 顿悟 是大脑相变 | LLM 也有相同的相变(Becker 实验 + Grokking 在数学上同构) |
| 善业 | 善业天花板 → 觉醒需"前积淀+突然" | 长平台期 + 突然泛化 |
| 改命 | 改命的工程学 | 三千件善事 + "十年之后加速" = Grokking |
| 修行 | 顿悟前的长期努力不白费 | 平台期"暗流涌动",傅里叶电路在悄悄形成 |
| 涌现 | 大模型涌现新能力 | Grokking 给涌现提供了具体可解的机制案例 |
在前沿模型中的"超进化"形态
Anthropic 团队 2024 年研究 Claude 3.5 Haiku 时发现,类似的几何/频率机制依然在大模型中运作^1:
- 任务:让模型预测什么时候换行(需要精确计数当前行字符数)
- 发现:模型用六维流形上的双螺旋几何来存储"当前字符数"
- 旋转角度编码精细计数(类似 $count \pmod N$)
- 轴向延伸编码大致数值范围
- 通过注意力机制的"QK 扭曲" → 旋转对齐 → 触发换行电路
这是模算术 Grokking 在前沿模型中的"超进化"形态。证明了 LLM 处理任何周期性 / 计数性 / 序列性任务时都倾向于"发明"基于频率和几何的算法——这是神经网络的"自然语言",是逻辑在硅基底层的必然投影^1。
与"召唤幽灵"的隐喻
Elon Musk 把训练 AI 比作"召唤恶魔" (summoning the demon)。技术社区里流行的 Shoggoth 迷因 把大模型描绘成不可名状的克苏鲁怪物,戴着 RLHF 的笑脸面具^1。
Grokking 给了这些隐喻一个物理注脚:
- 那个在"电路形成期"悄然构建的、基于傅里叶变换、正弦波干涉和高维流形扭曲的复杂结构,就是 Shoggoth 的本体
- 漫长的训练就是召唤仪式
- "笑脸面具"是 RLHF 阶段贴上的对齐层
Grokking 让我们隐约看到:大模型的"思考"是流动的高维几何,不是人类的离散符号。这是一种异类智能。
与本频道其他概念的联系
- 顿悟 — 大脑里的同构现象
- 建模 — 智能的底层操作,Grokking 是建模的相变
- 高维语义空间 — 大模型的几何形状
- 压缩即智能 — Grokking 是"找到最简单解"的物理证明
- 改命的工程学 — 修行的 Grokking 式相变
- 机械可解释性 — 揭示 Grokking 的方法论