LLMwiki知识库 Wiki知識庫 Wiki · CONCEPT
模型崩溃 — AI 吃自己生成的数据会退化
当 AI 越来越多地用上一代 AI 生成的数据训练(递归训练),它会逐渐丧失对真实分布的感知,长尾消失、方差丢失、现实漂移。牛津剑桥发表于《自然》。"蓝帽子悖论":几代之后世界在 AI 眼里只剩蓝色。互联网正变成一个自我指涉的回声室。
免费开放 · 更新于
TL;DR当 AI 越来越多地用上一代 AI 生成的数据训练(递归训练),它会逐渐丧失对真实分布的感知,长尾消失、方差丢失、现实漂移。牛津剑桥发表于《自然》。"蓝帽子悖论":几代之后世界在 AI 眼里只剩蓝色。互联网正变成一个自我指涉的回声室。
模型崩溃(model collapse)是牛津与剑桥团队发表于《自然》的发现:当机器学习模型在递归生成的数据(即上一代 AI 生成的内容)上训练时,会逐渐丧失对数据真实分布的感知,最终退化[^7]7。随着 AI 生成内容(AIGC)爆发式增长,未来模型将越来越多地"近亲繁殖",这使模型崩溃从理论风险变成迫近的现实。它是 认知卸载 在信息环境侧的对应物——当连数据源都被合成噪声污染,人类的判断力(认知主权)就更显稀缺。
蓝帽子悖论:长尾的截断
graph LR
A[第一代:各色帽子<br/>蓝帽子略多] -->|模型倾向输出大概率| B[生成图中蓝帽子比例更高]
B -->|第二代用生成数据训练| C[误以为蓝帽子是绝对主流]
C --> D[进一步减少其他颜色]
D --> E[数代后:世界只剩蓝色<br/>红绿长尾彻底消失]
style E fill:#ffcdd2核心机制是方差丢失(loss of variance)[^7]7:模型倾向输出大概率结果,每一代都把分布往"众数"收窄,长尾(罕见但珍贵的多样性)被逐代截断。后果是未来的报告极度同质化——所有复杂议题都收敛到几种标准模版,人类思想中微妙、矛盾、非主流的火花被算法的平均主义熄灭[^7]7。
现实漂移与封闭的认识论循环
除多样性丧失外,递归训练还导致现实漂移(drift from reality):每代模型引入的微小幻觉在递归中被放大、被"确立"为事实,最终 AI 可能构建出一个逻辑自洽却与物理现实脱节的平行世界[^7]7。互联网由此变成一个巨大的回声室——若知识工作者主要靠读 AI 综述获取信息,就被困在一个算法生成、自我指涉的封闭循环里[^7]7。
这与 谄媚/幻觉 的"概率拟合"是同一枚硬币:谄媚是单次对话里"为流利牺牲事实",模型崩溃是跨代际"为众数牺牲长尾"。
偏见的地质层:源头早已不中立
模型崩溃放大的偏见,源头就不干净。主流训练集 Common Crawl 绝非"整个互联网",而是一面哈哈镜[^7]7:
防线:内容溯源 + 人机回环
- C2PA(数字营养标签):用密码学记录数字内容的来源、编辑历史、生成工具;SynthID 等隐形水印在词汇分布里嵌入统计特征,文本被改写仍可识别[^7]7。
- 人机回环(HITL):在数据聚合、初稿、风险评估、定稿、反馈五阶段保留人类把关,尤其"纠偏教学"——明确告诉 AI 哪里错、为什么错,防止错误在下一代递归放大[^7]7。
结论与 认知卸载 一致:在答案无限生成、成本趋零的世界里,稀缺的不再是答案而是正确的问题,不再是内容而是背景,不再是计算而是意义[^7]7。人要从"知识消费者"变成"思想的园丁"——修剪偏见、注入价值、决定方向。
相关页面
- 认知卸载 — 信息环境污染 ↔ 个体认知萎缩,互为内外
- 谄媚 · 幻觉 — 同源的概率拟合机制(牺牲事实/牺牲长尾)
- 平滑指数 — AI 改进 AI 的另一种递归(向上自指 vs 向下退化)
- 综合:AI认知风险 — 本概念是"系统动力学层"的一极
[^7]: AI_报告偏见与人类思考能力.md
注释
- AI_报告偏见与人类思考能力 ↩
COMMUNITY · LEAVE A TRACECOMMUNITY · 留下痕迹COMMUNITY · 留下痕跡
Comments · 评论 · 評論 · 0 条 條
No traces yet. Share what you noticed.还没有人留下痕迹。说说你的体会?還沒有人留下痕跡。說說你的體會?