MacroAlpha.io
Launch App启动应用

LLMWIKI · CONCEPT

Grokking (格鲁金) — 神经网络的"开悟"现象

2021 年 OpenAI 偶然发现的反直觉学习动力学:模型严重过拟合、看似只会死记硬背之后,如果继续训练,会在某个时刻突然涌现完美的泛化能力——从"记忆"到"理解"的相变。机械可解释性证明,模型在那一刻自发发现了傅里叶变换。

免费开放 · 更新于

TL;DR2021 年 OpenAI 偶然发现的反直觉学习动力学:模型严重过拟合、看似只会死记硬背之后,如果继续训练,会在某个时刻突然涌现完美的泛化能力——从"记忆"到"理解"的相变。机械可解释性证明,模型在那一刻自发发现了傅里叶变换。

Grokking (中译"格鲁金") 是 2021 年 OpenAI 研究团队(Power et al.)在简单模算术任务上偶然发现的反直觉学习动力学^1。"Grok" 一词来自科幻作家罗伯特·海因莱因的小说《异乡异客》(Stranger in a Strange Land),意为"极其深刻地理解某事,以至于观察者与被观察者融为一体"^1。

在 AI 语境下,它描述的是这样一个违反所有经典机器学习直觉的过程:

  • 训练神经网络做模加法 $a + b = c \pmod P$
  • 训练初期:模型迅速记住所有训练样本(训练准确率 100%),但测试准确率几乎是随机猜测水平
  • 按经典理论,此时应该"早停"——模型已经过拟合了
  • 然而如果继续训练几千甚至几万步,模型在某个时刻突然从测试 0% 跳到测试 100%
  • 这是相变 (Phase Transition),不是渐变
graph LR
    A[Step 0<br/>训练0%<br/>测试0%] --> B[Step 1000<br/>训练100%<br/>测试0%<br/>死记硬背]
    B --> C[Step 1000-7000<br/>训练100%<br/>测试0%<br/>表面停滞]
    C --> D[Step 7000<br/>训练100%<br/>测试100%<br/>突然顿悟]
    
    style B fill:#fcc
    style C fill:#ffc
    style D fill:#cfc

黑箱中发生了什么

2022-2023 年 Neel Nanda 团队的逆向工程是 机械可解释性 领域的奠基性工作。他们发现,神经网络没有像人类小学生那样通过进位、借位、数数计算加法。它"自发地"发明并实现了一种基于离散傅里叶变换 (Discrete Fourier Transform, DFT) 的高级算法^1。

具体来说:

  • 在训练早期,神经元激活模式杂乱无章(对应死记硬背)
  • 在 Grokking 发生后,研究人员观察 MLP 层激活模式,看到了清晰、完美的正弦波 $\cos(\omega x)$ 和 $\sin(\omega x)$
  • 模型自发地学会了三角恒等式: $$\cos(a+b) = \cos(a)\cos(b) - \sin(a)\sin(b)$$
  • 把模加法 → 转化为频率域的旋转 → 通过相长干涉读出答案

模型在从未见过三角函数的情况下,独立"发现"了它^1。

训练三阶段的动力学

Nanda 团队用"限制损失"和"排除损失"两个指标,把那个看似停滞的平台期拍下来了:

阶段 表面现象 内部机制
记忆期 (0-2000 步) 训练损失迅速降低 死记硬背"记忆电路"在形成
电路形成期 (2000-7000 步) 训练100%/测试0%,看似停滞 暗流涌动:傅里叶电路在悄悄长出,记忆电路在被权重衰减侵蚀
清理期 (7000+ 步) 测试 0% → 100% 跃迁 权重 L2 范数急剧下降——优化器清理掉记忆电路,只留下精简的傅里叶电路

权重衰减 (Weight Decay) 是真正的"幕后推手"^1:

  • 死记硬背是"稠密"解法,需要大量参数,权重大
  • 傅里叶算法是"稀疏"解法,几个关键频率就够,权重小
  • 权重衰减惩罚大权重 → 长期施加进化压力 → 最终把笨重的记忆压扁,留下精简的算法

为什么 Grokking 是革命性的

这一发现颠覆了三个常识:

  1. 早停不一定对:经典理论说"过拟合就该停",Grokking 说"继续训练,质变在后面"
  2. 过参数化不是坏事:参数远多于数据,反而让模型有空间"探索"通用算法
  3. 理解 ≠ 学习:模型可以先学到表面规律,再涌现深层结构——这是两次完全不同的学习

与本频道其他概念的紧密对接

Grokking 是本频道最被反复引用的工程命题之一,因为它在工程上证实了几条平行命题:

维度 频道命题 Grokking 中的工程实证
顿悟 顿悟 是大脑相变 LLM 也有相同的相变(Becker 实验 + Grokking 在数学上同构)
善业 善业天花板 → 觉醒需"前积淀+突然" 长平台期 + 突然泛化
改命 改命的工程学 三千件善事 + "十年之后加速" = Grokking
修行 顿悟前的长期努力不白费 平台期"暗流涌动",傅里叶电路在悄悄形成
涌现 大模型涌现新能力 Grokking 给涌现提供了具体可解的机制案例

在前沿模型中的"超进化"形态

Anthropic 团队 2024 年研究 Claude 3.5 Haiku 时发现,类似的几何/频率机制依然在大模型中运作^1:

  • 任务:让模型预测什么时候换行(需要精确计数当前行字符数)
  • 发现:模型用六维流形上的双螺旋几何来存储"当前字符数"
  • 旋转角度编码精细计数(类似 $count \pmod N$)
  • 轴向延伸编码大致数值范围
  • 通过注意力机制的"QK 扭曲" → 旋转对齐 → 触发换行电路

这是模算术 Grokking 在前沿模型中的"超进化"形态。证明了 LLM 处理任何周期性 / 计数性 / 序列性任务时都倾向于"发明"基于频率和几何的算法——这是神经网络的"自然语言",是逻辑在硅基底层的必然投影^1。

与"召唤幽灵"的隐喻

Elon Musk 把训练 AI 比作"召唤恶魔" (summoning the demon)。技术社区里流行的 Shoggoth 迷因 把大模型描绘成不可名状的克苏鲁怪物,戴着 RLHF 的笑脸面具^1。

Grokking 给了这些隐喻一个物理注脚

  • 那个在"电路形成期"悄然构建的、基于傅里叶变换、正弦波干涉和高维流形扭曲的复杂结构,就是 Shoggoth 的本体
  • 漫长的训练就是召唤仪式
  • "笑脸面具"是 RLHF 阶段贴上的对齐层

Grokking 让我们隐约看到:大模型的"思考"是流动的高维几何,不是人类的离散符号。这是一种异类智能。

与本频道其他概念的联系

引用源

Grokking (格鲁金) — 神经网络的"开悟"现象 · 关系图