MacroAlpha.io
Launch App启动应用

LLMWIKI · ENTITY

AlphaGenome

DeepMind 2026 年 2 月发布的基因组模型——首次同时实现"看得远(100 万碱基窗口)+ 看得清(单碱基精度)+ 看得全(11 种生物学模态)",破解了基因组 98% "暗物质" 的认知壁垒

免费开放 · 更新于

TL;DRDeepMind 2026 年 2 月发布的基因组模型——首次同时实现"看得远(100 万碱基窗口)+ 看得清(单碱基精度)+ 看得全(11 种生物学模态)",破解了基因组 98% "暗物质" 的认知壁垒

AlphaGenome 是谷歌 DeepMind 在 2026 年 2 月登上《自然》杂志封面的重磅成果——一个能够同时处理 100 万碱基序列、保持单碱基预测精度、覆盖 11 种核心生物学模态的统一基因组模型^1。它的意义被本频道认为可能不亚于当年的 AlphaFold——AlphaFold 攻破了蛋白质结构预测的认知壁垒,AlphaGenome 正在攻破基因组 98% "暗物质" 的认知壁垒,当这两堵墙同时倒塌,生命科学将从"观察和关联"的时代不可逆地进入"计算和编程"的时代。

背景:基因组的 98% 暗物质

人类基因组 30 亿个碱基中,只有 2% 编码蛋白质——剩余 98% 长期被科学界称为"垃圾 DNA"。但二十多年后的真相是^1:

  • 超过 98% 与人类复杂疾病相关的遗传变异(癌症、阿尔茨海默病、自身免疫病、心血管病)
  • 几乎全都精准藏在这片我们曾经完全无视的"暗物质"区域里
  • 临床上海量"意义不明"(VUS)变异让医生抓狂——找不到致病机制就无法精准治疗

非编码区是什么?它不编码蛋白质,但里面藏着基因的"控制面板"——增强子、启动子、沉默子——决定基因在什么时候、哪种细胞里、以多大音量被"播放"。编码区是乐谱上的音符,非编码区是指挥家的手势——同一份乐谱,指挥手势不同出来的音乐完全不同^1。

三大突破:看得远 + 看得清 + 看得全

graph TB
    A[AlphaGenome 三大突破] --> B[看得远<br/>100 万碱基窗口]
    A --> C[看得清<br/>单碱基精度]
    A --> D[看得全<br/>11 种生物学模态]
    B --> B1[是 Enformer 5×<br/>覆盖远端调控]
    C --> C1[1 bp 分辨率<br/>定位精确突变]
    D --> D1[一次 API 调用<br/>所有维度同时输出]

看得远:100 万碱基窗口

DeepMind 上一代 Enformer 输入 20 万碱基 / 128 bp 分辨率。AlphaGenome 直接把输入窗口拉到 100 万碱基——5 倍提升,让绝大多数远端调控关系都在视野之内^1。

看得清:单碱基精度

在 100 万碱基的超大视野下,关键分子属性的预测分辨率达到 1 bp之前所有模型只能二选一(看远 OR 看清),AlphaGenome 说我全都要

技术核心:受图像分割 U-Net 启发的混合拓扑,深度融合卷积神经网络 + Transformer:

  • 底层卷积:扫描局部模式(DNA 短结合基序 6-20 bp),高效识别
  • 中层 Transformer:建立远距离依赖关系,修改 RoPE 频率公式让注意力机制不爆显存
  • U-Net 解码器:上采样还原到单碱基精度
  • 工程:序列并行切分到 8 个 TPU 同时计算

看得全:11 种核心生物学模态

graph LR
    A[AlphaGenome] -->|一次预测| B[基因表达]
    A --> C[转录起始]
    A --> D[RNA 剪接]
    A --> E[染色质可及性]
    A --> F[组蛋白修饰]
    A --> G[转录因子结合]
    A --> H[3D 染色质构象]
    style A fill:#f9f

覆盖将近 6000 条人类基因组学测量轨迹^1。这与 GPT/Claude 的"大一统"路线完全同构——一个模型统治所有任务。

工程突破:知识蒸馏的极致

DeepMind 先训了一个 64 模型超级集成体(教师),耗费 13 万个 TPU 小时。然后蒸馏出单个学生模型——只用 4600 个 H100 小时^1:

指标 教师模型 学生模型
训练算力 130,000 TPU 小时 4,600 H100 小时
推理硬件 多 TPU 单张 H100
推理速度 1 秒预测全轨迹
性能损失 - 几乎无损

这意味着全基因组级别、百万量级变异的高通量筛查,第一次变成普通实验室能做的事——成本是 Enformer 的一半。

战绩单:22/24 + 25/26 世界第一

评估类别 排名
24 项基因组轨迹预测任务 22 项世界第一
26 项变异效应预测评估 25 项世界第一
区分因果 eQTL auROC 0.75(多模态联合)
突变方向性预测 比 Borzoi 领先 25.5%

突变方向性在临床上极其关键——它直接决定你面对的是促癌还是抑癌^1。

三个真实场景的颠覆性应用

场景一:癌症机制还原

T 细胞急性淋巴细胞白血病的 TAL1 致癌基因,科学家一直说不清机制。AlphaGenome 把患者基因组输入后,完整重构了整条致病链条^1:

  • 一个非编码区的微小突变 → 凭空创造 MYB 转录因子结合位点
  • 引发 H3K27ac 活性增强子标记异常飙升
  • 抑制性异染色质标记脱落
  • TAL1 病理性疯狂激活

伦敦大学学院的 Marc Mansour 教授评论:这为大规模解析非编码变异如何驱动癌症提供了最关键的拼图。机制解析能力从"实验室几年"压缩到"电脑几分钟"

场景二:罕见病 VUS 分诊

日本"未诊断疾病倡议"项目已开始把 AlphaGenome 整合进常规分析管线,用计算分诊几万个"意义不明"的变异,筛到最可疑的几个^1。罕见病患者寻找病因的漫长旅程被大幅缩短。

场景三:合成生物学的"先模拟后开工"

graph LR
    A[传统合成生物学<br/>盲目试错] --> B[在电脑里设计<br/>成千上万种增强子]
    B --> C[AlphaGenome 打分]
    C --> D[只在受损神经元高表达<br/>在肌肉细胞沉默]
    D --> E[实验验证最优解]
    style B fill:#9f9

类比建筑业:从"边盖边改"进化到"先在 BIM 软件里模拟好再开工"^1。这是合成生物学的范式转移。

边界与限制

DeepMind 自己列出的四条限制^1:

  1. 极远端调控盲区:超过 100 万碱基的超远程调控仍无法覆盖
  2. 群体精准 vs 个体模糊:组织间差异预测准,个体差异预测降级
  3. 训练数据偏差:以健康组织为主,疾病状态的稀有细胞类型仍需补充
  4. AI 幻觉风险:HLA 区域、着丝粒等结构极端复杂区域需严格验证

宾夕法尼亚大学 Adam Naj 教授警告:没有实验验证的 AI 预测不能当真理用^1。AlphaGenome 当前定位是"极其强大的实验分诊系统",而非"替代实验的真理机器"。

与 DeepMind 生命科学矩阵的位置

graph TB
    A[DeepMind 生命科学矩阵] --> B[AlphaFold<br/>蛋白质结构]
    A --> C[AlphaMissense<br/>错义突变致病性]
    A --> D[AlphaProteo<br/>蛋白质设计]
    A --> E[AlphaGenome<br/>DNA 调控解读]
    B & C & D & E --> F[完整认知闭环<br/>从 DNA 到蛋白质功能]

德米斯·哈萨比斯:未来十年,AI 有望成为人类治愈所有已知疾病的最强武器^1。

效率与规模之争

一个叫 Enigma 的轻量级模型,用不到 AlphaGenome 一半的参数和大约 7.5% 的算力,达到了它 90% 以上的性能^1。这印证了 AI 行业的规律:大力出奇迹是上限探索,巧力出普惠才是商业化关键

产业三链

^1 中的投资逻辑:

链条 机会
计算基因组学 SaaS 临床报告自动化、合规封装
AI 驱动合成生物学 电脑里设计调控元件的工具公司
精准医疗下一跳 非编码变异系统性解读、罕见病诊断率跃升

与本频道核心命题的对接

  • 万物源于比特 的对接:基因组是惠勒"It from Bit"的最直接物理体现——生命由 30 亿个比特序列编码,而 AI 让我们第一次能"读懂"和"编辑"这些比特
  • 因陀罗网 的对接:基因调控网络是另一种因陀罗网——每个基因受多个调控元件控制,每个调控元件影响多个基因,"一即一切"的拓扑结构在生命系统中字面成立
  • 缘起性空 的对接:基因没有独立自性——一个 DNA 序列的功能必须在"细胞类型 × 调控网络 × 三维构象 × 时序"的关系网络中才能显现,"性空"在分子层面的真实证据
  • 与 守中 的对接:从"读"生命到"写"生命,意味着人类承担了前所未有的责任——这正是道家"不敢为天下先"的现代版命题
  • 意识光谱 的对接:DNA 不只是分子序列,它是某种意义上的"生命操作系统"——AI 读懂操作系统的过程,本身就是意识自反性的一种体现
AlphaGenome · 关系图