
二十多年前,人类基因组计划完成后,科学家第一次拥有了一本由 30 亿个 DNA 字母组成的“生命之书”。
如今,真正困难的问题已不再是读出这些字母,而是理解它们各自承担什么功能,以及如果其中一个发生突变,会带来怎样的后果。
现在,Google DeepMind 用 AI 把这些结果几乎全部提前算了一遍,做成了一个约 1 PB 的数据集,规模超过 AlphaFold Database 的 30 倍。目前通过免费网页平台向科研人员开放,并支持非商业用途。
9 月 8 日,DeepMind 发布 AlphaGenome Atlas。基于今年初正式发表于 Nature 的基因组 AI 模型 AlphaGenome,研究团队对人类参考基因组中超过 90 亿种可能的单碱基变化进行了预计算,并预测这些变化可能对基因表达、RNA 剪接、染色质状态等产生什么影响。
90 亿这个数字其实很好理解。人类单倍体基因组大约有 30 亿个碱基对,每个位置由 A、T、C、G 四种碱基中的一种组成。如果只改变其中一个位置的碱基,每个位点都还有另外 3 种可能的替换方式。因此,30 亿个位点大约对应 90 亿种可能的单碱基替换。
人类基因组中,真正直接编码蛋白质的部分只占约 2%,其余约 98% 属于非编码区域,其中相当一部分参与基因调控,决定基因在什么细胞中、什么时间以及以多大程度表达。大量与疾病和人体性状相关的遗传变异,也位于这些非编码区域。相比蛋白编码区,这些变异往往更难解释。
现有分析方法各有侧重。一些方法可以结合染色质开放、转录因子结合等实验数据,圈定可能具有调控功能的 DNA 区域,但很难进一步判断区域内部究竟是哪一个碱基的改变产生了影响;另一些方法依赖跨物种进化保守性,对于部分人类特异或进化速度较快的功能位点可能不够敏感。
还有一些综合型算法能够整合大量基因组信息给出一个总体评分,却未必能够进一步说明,一个变异究竟影响了 RNA 剪接、转录因子结合,还是其他分子过程;至于直接依靠实验逐个验证,面对整个基因组数十亿种可能的变化,成本更不现实。
AlphaGenome 瞄准的正是这一问题。
AlphaGenome 最早于 2025 年公布,今年 1 月正式发表于 Nature。它要解决的是基因组研究中一个非常基础的问题:输入一段 DNA 序列后,可以预测这段序列对应的多种分子特征。
AlphaGenome 一次最多可以读取约 100 万个碱基,并预测染色质开放、转录因子结合、组蛋白修饰、RNA 剪接、基因表达以及染色质三维接触等多类指标。面对一个具体 DNA 变异,研究人员可以比较变异前后的预测结果,从而判断它可能扰动哪些分子过程。
不过,AlphaGenome 解决的是如何预测一个具体变异。如果想把这种能力扩展到整个人类基因组,仍然面临巨大的计算量。
于是,研究团队进一步建立了 AlphaGenome Atlas。他们利用 AlphaGenome,将人类参考基因组中超过 90 亿种可能的单碱基变化提前完成计算,再将结果集中整理成可查询的资源。
为了完成如此大规模的预计算,DeepMind 基因组学负责人 Žiga Avsec 在接受 IEEE Spectrum 采访时表示,团队最初估算需要将计算效率提高约 80 倍。最终,研究人员通过模型蒸馏、GPU 计算优化以及减少重复计算等方式完成了这项工作。
对研究人员而言,最直接的变化是:过去需要自行运行 AlphaGenome 获得的部分预测,现在可以直接从 Atlas 中查询。
但仅仅保存 90 亿种变异的预测结果仍然不够。对于遗传学研究而言,另一个实际问题是:面对大量候选变异,究竟应该优先研究哪一个?
为此,研究团队进一步推出了 AVI(AlphaGenome Variant Impact)变异影响分数。
AVI 将 AlphaGenome 对基因调控影响的预测,与 DeepMind 此前开发的 AlphaMissense 对蛋白质影响的预测结合起来,将不同层面的信息整合成一个分数,帮助研究人员对遗传变异进行筛选和排序。它既可以用于蛋白编码区域,也可以用于非编码区域。
同时,Atlas 还提供 AVI 特征归因。也就是说,在得到一个分数之后,研究人员还可以进一步查看这个分数主要来自哪些预测特征,例如 RNA 剪接、基因表达、染色质开放等,从而了解一个变异可能通过什么分子过程产生影响。
因此,AVI 并不是一个简单的“致病分数”。它更主要的作用,是帮助研究人员判断哪些变异具有更明显的潜在分子影响,并为后续实验提供优先级和机制线索。
除了变异评分,AlphaGenome Atlas 还整理了 2,500 多种反复出现的 DNA 短序列,也就是 motif(基序)。这些序列往往是转录因子识别和结合的位置,与不同细胞中的基因调控有关。
研究团队利用 AlphaGenome 的大规模变异预测识别并定位这些基序,从而帮助研究人员进一步判断,一个非编码变异可能破坏了什么调控序列。Atlas 由此不仅提供变异效应预测,也能够用于分析更基础的基因调控规律。

(来源:DeepMind)
研究团队和外部合作机构已经将 AlphaGenome Atlas 用于具体的遗传学问题。
第一个来自罕见病研究。了解罕见病的一大障碍在于,如何从成千上万个候选变异中精准定位少数致病变异。
Broad Institute 研究人员与 GREGoR Consortium 合作,利用 AVI 对此前未能解释的罕见病变异重新进行排序。其中一个病例是一名患有癫痫性脑病的儿童,此前进行过多项遗传检测,但始终没有找到明确原因。
研究人员最终注意到一个影响 DNM1 基因的变异。DNM1 已知与癫痫性脑病密切相关。进一步查看 AVI 背后的 AlphaGenome 预测发现,这个变异可能产生一个异常 RNA 剪接位点,使 RNA 处理出现错误,并最终导致生成的蛋白质异常延长。后续实验筛选支持了这一预测,同时还发现附近存在具有类似作用的其他变异。
第二个案例来自大规模人群遗传学研究。英国埃克塞特大学研究人员利用超过 5.4 万名 UK Biobank 参与者的全基因组数据,寻找可能影响血浆蛋白水平的罕见非编码变异。
这类研究的一项困难是,大量没有明显功能的变异会形成统计噪声,降低真正关联信号被发现的概率。研究人员因此利用 AlphaGenome Atlas 的分子效应预测,先对罕见变异进行筛选和分组,再开展后续关联分析。
结果显示,采用这种方法后,检测到的非编码遗传关联增加了 22%。研究人员进一步锁定了包括 PLA2G7 和 EGLN1 在内的一些与血浆蛋白水平相关的调控变异。在其中一处分析中,原本 526 个候选变异被缩小到 4 个。
Gareth Hawkes 随后又将类似方法用于分析 UK Biobank 中数亿个非编码变异与 BMI 之间的关系。通过聚焦 Atlas 预测影响最大的 1% 非编码变异,研究最终识别出 19 个可以进一步研究的基因组区域。
两个案例体现的是同一种用途:AlphaGenome Atlas 并不直接给出最终结论,而是帮助研究人员从大量候选变异中优先筛出更值得研究的对象,再进行针对性的实验或统计分析。
对于 AlphaGenome Atlas,一些并未参与 DeepMind 项目的研究人员也给出了评价。加州大学圣迭戈分校遗传学家 Jonathan Sebat 在接受 Scientific American 采访时表示,这类预计算数据库可以简化实验室现有的一些分析流程,过去需要研究团队自行部署模型、配置计算资源完成的部分预测,现在可以直接查询。
英属哥伦比亚大学基因组学家 Carl de Boer 则将 AlphaGenome 视为当前这一方向的领先模型之一。他同时指出,AlphaGenome 本身计算量较大,将数十亿种变异的预测结果提前计算完成,可以降低研究人员使用模型的算力门槛,也减少不同团队重复进行相同计算。
DeepMind 此前在 AlphaFold 上也采取过类似方式。2022 年,DeepMind 与 EMBL-EBI 将 AlphaFold Database 扩展至超过 2 亿个蛋白质结构预测,使研究人员无需自行运行模型,也可以直接查询蛋白质结构。如今,AlphaGenome Atlas 同样将大规模预计算结果以数据库形式提供给研究人员。
不过,AlphaGenome Atlas 目前仍存在一些明确局限。尽管其数据规模超过 AlphaFold Database 30 倍,但基因调控涉及细胞类型、发育状态、远距离调控元件等多种因素,预测难度与蛋白质结构预测并不相同。AlphaGenome 一次可以分析约 100 万个碱基的 DNA 序列,但仍可能遗漏更远距离的调控关系,也无法完整覆盖细胞内部复杂的间接调控过程。
英属哥伦比亚大学基因组学家 Carl de Boer 也提醒,将复杂的生物学效应整合为 AVI 分数虽然便于筛选和排序,但需要避免过度解读。较高的 AVI 分数意味着一个变异可能具有较大的分子影响,值得进一步研究,并不等同于已经证明其具有致病性。
此外,AlphaGenome Atlas 主要预测 DNA 变异可能造成的分子层面变化,而不是直接预测疾病结局。相关结果仍需要结合遗传学证据、患者表型和实验验证进一步确认。DeepMind 也明确表示,AlphaGenome Atlas 目前面向科学研究,并未用于临床诊断。
参考链接:
1.https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/?utm_source=chatgpt.com
文章来自于"DeepTech深科技",作者 "胡莉花"。
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda