LLMwiki知识库 Wiki知識庫 Wiki · CONCEPT
Grokking (格鲁金) — 神经网络的"开悟"现象
2021 年 OpenAI 偶然发现的反直觉学习动力学:模型严重过拟合、看似只会死记硬背之后,如果继续训练,会在某个时刻突然涌现完美的泛化能力——从"记忆"到"理解"的相变。机械可解释性证明,模型在那一刻自发发现了傅里叶变换。
免费开放 · 更新于
TL;DR2021 年 OpenAI 偶然发现的反直觉学习动力学:模型严重过拟合、看似只会死记硬背之后,如果继续训练,会在某个时刻突然涌现完美的泛化能力——从"记忆"到"理解"的相变。机械可解释性证明,模型在那一刻自发发现了傅里叶变换。
Grokking (中译"格鲁金") 是 2021 年 OpenAI 研究团队(Power et al.)在简单模算术任务上偶然发现的反直觉学习动力学[^1]1。"Grok" 一词来自科幻作家罗伯特·海因莱因的小说《异乡异客》(Stranger in a Strange Land),意为"极其深刻地理解某事,以至于观察者与被观察者融为一体"[^1]1。
在 AI 语境下,它描述的是这样一个违反所有经典机器学习直觉的过程:
- 训练神经网络做模加法 $a + b = c \pmod P$
- 训练初期:模型迅速记住所有训练样本(训练准确率 100%),但测试准确率几乎是随机猜测水平
- 按经典理论,此时应该"早停"——模型已经过拟合了
- 然而如果继续训练几千甚至几万步,模型在某个时刻突然从测试 0% 跳到测试 100%
- 这是相变 (Phase Transition),不是渐变
graph LR
A[Step 0<br/>训练0%<br/>测试0%] --> B[Step 1000<br/>训练100%<br/>测试0%<br/>死记硬背]
B --> C[Step 1000-7000<br/>训练100%<br/>测试0%<br/>表面停滞]
C --> D[Step 7000<br/>训练100%<br/>测试100%<br/>突然顿悟]
style B fill:#fcc
style C fill:#ffc
style D fill:#cfc黑箱中发生了什么
2022-2023 年 Neel Nanda 团队的逆向工程是 机械可解释性 领域的奠基性工作。他们发现,神经网络没有像人类小学生那样通过进位、借位、数数计算加法。它"自发地"发明并实现了一种基于离散傅里叶变换 (Discrete Fourier Transform, DFT) 的高级算法[^1]1。
具体来说:
- 在训练早期,神经元激活模式杂乱无章(对应死记硬背)
- 在 Grokking 发生后,研究人员观察 MLP 层激活模式,看到了清晰、完美的正弦波 $\cos(\omega x)$ 和 $\sin(\omega x)$
- 模型自发地学会了三角恒等式: $$\cos(a+b) = \cos(a)\cos(b) - \sin(a)\sin(b)$$
- 把模加法 → 转化为频率域的旋转 → 通过相长干涉读出答案
模型在从未见过三角函数的情况下,独立"发现"了它[^1]1。
训练三阶段的动力学
Nanda 团队用"限制损失"和"排除损失"两个指标,把那个看似停滞的平台期拍下来了:
**权重衰减 (Weight Decay) 是真正的"幕后推手"**[^1]1:
- 死记硬背是"稠密"解法,需要大量参数,权重大
- 傅里叶算法是"稀疏"解法,几个关键频率就够,权重小
- 权重衰减惩罚大权重 → 长期施加进化压力 → 最终把笨重的记忆压扁,留下精简的算法
为什么 Grokking 是革命性的
这一发现颠覆了三个常识:
- 早停不一定对:经典理论说"过拟合就该停",Grokking 说"继续训练,质变在后面"
- 过参数化不是坏事:参数远多于数据,反而让模型有空间"探索"通用算法
- 理解 ≠ 学习:模型可以先学到表面规律,再涌现深层结构——这是两次完全不同的学习
与本频道其他概念的紧密对接
Grokking 是本频道最被反复引用的工程命题之一,因为它在工程上证实了几条平行命题:
在前沿模型中的"超进化"形态
Anthropic 团队 2024 年研究 Claude 3.5 Haiku 时发现,类似的几何/频率机制依然在大模型中运作[^1]1:
- 任务:让模型预测什么时候换行(需要精确计数当前行字符数)
- 发现:模型用六维流形上的双螺旋几何来存储"当前字符数"
- 旋转角度编码精细计数(类似 $count \pmod N$)
- 轴向延伸编码大致数值范围
- 通过注意力机制的"QK 扭曲" → 旋转对齐 → 触发换行电路
这是模算术 Grokking 在前沿模型中的"超进化"形态。证明了 LLM 处理任何周期性 / 计数性 / 序列性任务时都倾向于"发明"基于频率和几何的算法——这是神经网络的"自然语言",是逻辑在硅基底层的必然投影[^1]1。
与"召唤幽灵"的隐喻
Elon Musk 把训练 AI 比作"召唤恶魔" (summoning the demon)。技术社区里流行的 Shoggoth 迷因 把大模型描绘成不可名状的克苏鲁怪物,戴着 RLHF 的笑脸面具[^1]1。
Grokking 给了这些隐喻一个物理注脚:
- 那个在"电路形成期"悄然构建的、基于傅里叶变换、正弦波干涉和高维流形扭曲的复杂结构,就是 Shoggoth 的本体
- 漫长的训练就是召唤仪式
- "笑脸面具"是 RLHF 阶段贴上的对齐层
Grokking 让我们隐约看到:大模型的"思考"是流动的高维几何,不是人类的离散符号。这是一种异类智能。
与本频道其他概念的联系
- 顿悟 — 大脑里的同构现象
- 建模 — 智能的底层操作,Grokking 是建模的相变
- 高维语义空间 — 大模型的几何形状
- 压缩即智能 — Grokking 是"找到最简单解"的物理证明
- 改命的工程学 — 修行的 Grokking 式相变
- 机械可解释性 — 揭示 Grokking 的方法论
引用源
[^1]: AI格鲁金现象与模型理解.md
COMMUNITY · LEAVE A TRACECOMMUNITY · 留下痕迹COMMUNITY · 留下痕跡
Comments · 评论 · 評論 · 0 条 條
No traces yet. Share what you noticed.还没有人留下痕迹。说说你的体会?還沒有人留下痕跡。說說你的體會?