90 亿——这是你我的 DNA 里可能出现的单字母突变总数。昨天(9 月 8 日),谷歌 DeepMind 宣布了一件听起来像科幻的事:把每一种突变的分子后果,都用 AI 预先算好了。这套名为 AlphaGenome Atlas 的图谱正式免费开放,数据量 1 PB,比获诺贝尔奖的 AlphaFold 数据库还大 30 多倍,而且已经帮科学家破了一例罕见病。
一张把所有 DNA 错误都标好的地图
人类基因组由约 30 亿个碱基对组成,但科学界对它的理解长期只停留在 2%——那部分负责编码蛋白质的「说明书」。剩下 98% 曾一度被误称为『垃圾 DNA』,实际上是调控基因活性的「总控台」,绝大多数与疾病相关的变异都藏在这里。
问题在于:人类基因组里共有约 90 亿种可能的单字母变异(专业叫单核苷酸变异 SNV),在实验室里逐一测试每一种,几乎不可能。DeepMind 的做法是让 AI 先跑:用去年 6 月发布的 AlphaGenome 模型,把 90 亿种变异的调控影响全部预计算成 1 PB 的数据集,再包上一层查询门户——零编码、免费,任何研究者打开网页就能查。
为了让科学家快速找到「哪个变异最要紧」,图谱还配了一个 AVI 评分:把 AlphaGenome(看基因调控)和 AlphaMissense(看蛋白质影响)两个模型的预测浓缩成一个数字,编码区和非编码区通吃,相当于给每个变异贴了个「危险指数」。测试显示它在多项致病性基准上达到一流水平。
罕见病破案现场:一个被忽略的变异
最能说明价值的,是图谱上线前就已经发生的实战。
美国博德研究所(Broad Institute)的团队在研究一批多年未确诊的罕见病病例。患儿基因里藏着一个 DNM1 基因变异——这个基因与癫痫性脑病密切相关,但此前的分析方法把它漏掉了。用 AVI 评分重新排序后,变异被高亮:AI 预测它制造了一个错误的剪接位点,导致蛋白质异常延长。后续实验筛选验证了预测,还顺藤摸瓜找到了附近一批同类变异。一个「大海捞针」的病例,就这样被 AI 图谱捞了出来。
埃克塞特大学的 Gareth Hawkes 则把图谱用在大人群上:他对 5.4 万余名英国生物样本库参与者的全基因组数据重新分析,按预测的分子效应给变异分组,结果多找回了 22% 的非编码基因关联——这些信号原本淹没在统计噪音里。他还锁定了调控 PLA2G7(与衰老相关)和 EGLN1(细胞氧传感器)的关键变异;聚焦图谱预测影响最大的前 1% 变异后,识别出 19 个与 BMI(身体质量指数)相关的遗传区域。
为什么说这是 AlphaFold 之后的又一步
把时间线拉长,DeepMind 的「AI 破解生命」路线图很清晰:2021 年 AlphaFold 2 解决蛋白质 3D 结构预测,拿下 2024 年诺贝尔化学奖;2022 年 AlphaFold 数据库把已知结构从 19 万实验样本扩展到 2 亿个预测,覆盖「蛋白质宇宙」;2025 年 AlphaGenome 模型登场,从看结构转向看基因调控。
今天的 Atlas 是第三步的规模化落地:如果说 AlphaFold 数据库是「蛋白质的谷歌地图」,AlphaGenome Atlas 就是「人类 DNA 的逐字注疏」——每个字母改写的后果都已标注。人类基因组计划 2003 年完成「读出」全部序列用了 13 年,如今 AI 正把「读懂」每一个变异变成可查询的服务。
边界与判断
冷静的一面要说清楚:这是预测图谱,不是诊断工具。DeepMind 在发布说明里明确标注,AlphaGenome「未经临床验证、不获准用于任何临床用途」;基因与疾病的关系也远比单点突变复杂,图谱的价值是帮研究者缩小范围、加速验证,而不是直接给普通人出「基因体检报告」。商业授权将在后续通过谷歌云开放。
但方向已经明确:AI for Science 正在从「预测单个结构」走向「穷举式解释整个基因组」。DeepMind 自己也把 Atlas 定位为「基线而非终点」——模型每升级一次,这张 90 亿变异的地图就会更精细一层。对全球约 3 亿罕见病患者和无数遗传病研究者来说,这是一份刚打开的礼物。
关注 AI商业快讯,每天一篇 AI 热点深度解读。
相关阅读: