9 月 8 日,谷歌宣布发布 AlphaGenome Atlas,一个记录人类基因组中每一种可能「单字母突变」影响的公开资源。谷歌用自家 AI 系统把参考基因组里约 30 亿个位置逐一替换成另外三种碱基,共完成约 90 亿次评估,结果整理成研究者可直接查询的数据集。相关论文同期发表于《自然》(Nature)杂志。
AlphaGenome 是什么
AlphaGenome 是谷歌 DeepMind 团队开发的 AI 系统,负责基因组学里一件基础而棘手的事:预测 DNA 序列上一处字母变化会带来什么后果。DNA 由四种碱基(A、T、C、G)组成,可以理解为用一种四字母表写成的约 30 亿字长文;所谓单碱基变化,就是把文中某个字母换成另一个。人体基因组中绝大多数这类变化没有影响,少数会引发疾病。难点在于提前判断哪一处变化是有害的——这正是 AlphaGenome 想回答的问题。
基因组里超过 97% 的「非编码」区域
人类基因组中真正编码蛋白质的部分不到 3%,剩下 97% 以上是非编码 DNA。这部分并非全无用:其中包含调控序列,决定基因在哪种细胞、什么时间被激活,以及转录出的 RNA 如何被加工;另一些结构序列负责染色体的分裂和末端保护。但更大一部分是「垃圾」——远古病毒入侵的残骸、被突变失活的基因等。鉴别非编码区哪些片段有功能,是生物学几十年的难题:与 DNA 结合的调控蛋白对序列并不挑剔,常随机结合;同一段序列在不同细胞类型中的行为也不同。过去研究者用一个个专门的软件工具标定这类位点,而这类「概率模糊、高度依赖上下文」的判断,正是深度学习擅长的问题。
Atlas 做了什么:约 90 亿次评估
AlphaGenome 在人类和小鼠的、经过充分研究的细胞类型数据上完成训练,学习判断一段序列有没有功能。随后谷歌把它应用到整个基因组:从 1 号染色体第一个碱基开始,把每个位置的碱基依次换成另外三种,再移动到下一个位置,累计完成约 90 亿次评估。系统输出的指标包括:基因表达(基因被激活后产生蛋白质的量)、转录起始(基因开始被读取的位置)、染色质可及性(DNA 是否处于可供蛋白质结合的状态)、组蛋白修饰(影响 DNA 包装的化学标记)、转录因子结合(调控蛋白是否还能附着)、染色质接触与剪接位点使用(RNA 加工时的切割拼接位置)等。
对研究者有两个直接用途
第一,测序发现一个突变后,可以立刻查询它对功能的影响,并得到一个可能的机制假说,不必再在多个数据库和工具之间来回比对。第二,可以按影响类型在整个基因组范围搜索,例如找出所有可能改变某个调控蛋白结合的位点。谷歌方面称,AlphaGenome 的预测水平与专门的基因组学软件相当或更好。
局限:训练数据之外仍待验证
需要说明,Atlas 以参考基因组为基线,它不代表任何真实个体——现实中每个人的基因组都与它存在数百万处差异。谷歌评估的 90 亿种变化里,真正会出现在真实人体中又具有功能意义的只是少数。更大的悬而未决之处在于:不少预测信息可能已包含在模型的训练数据(如 ENCODE 项目)中;这套系统的真正价值,要等它能对训练数据覆盖之外的对象——例如尼安德特人、丹尼索瓦人的基因组,或研究较少的细胞类型——给出可信结论时,才能得到验证。它最终能带来多少超出既有工具的新发现,也要看生物学界是否大量采用。
AlphaGenome Atlas 把「查突变后果」从多工具拼凑变成查表,是 AI 大规模应用于基因组学研究的一次标志性尝试。但 AI 的预测本质上是假说——重要的结论仍然需要实验验证。