周二,谷歌宣布推出AlphaGenome Atlas,这是一项尝试预测人类基因组中每一种可能的单碱基变异所带来后果的资源。人类基因组大约有30亿个碱基长,因此要尝试参考基因组中未出现的其他三种DNA碱基,意味着需要将总共90亿个碱基输入AlphaGenome软件进行处理。
AlphaGenome旨在识别非编码DNA的潜在功能,这部分DNA不编码蛋白质,但占人类基因组的绝大多数。这些非编码DNA中有一些对控制蛋白质编码部分的活性至关重要——它告诉细胞何时何地生成信使RNA,以及如何将其加工成成熟的蛋白质编码形式等等。但其中大部分似乎只是病毒和其他分子寄生物留下的残余。
能够识别出具有功能性的部分非常有用,将所有分析整合在一个软件包中完成也是一大优势。但在生物学家开始大量使用它之前(假设他们会这样做),目前还不清楚AlphaGenome能提供哪些超出其训练数据本身价值的东西。
非编码序列
尽管我们通常关注蛋白质,但人类基因组中编码蛋白质的部分不到3%。基因组的大部分是非编码的,包含多种成分,包括帮助确保染色体在细胞分裂时均匀分配的着丝粒,以及保护染色体末端的端粒。此外还有控制基因活性的调控DNA,以及帮助决定基因产生的成熟信使RNA中应包含或不应包含哪些内容的信号。其他序列则有助于控制DNA在细胞内的包装方式。
但大部分非编码DNA其实是"垃圾"——是古代病毒感染、DNA级寄生物以及因突变而失活的基因等的残留物。出于多种原因,弄清楚哪些是有用的、哪些不是,一直是生物学家面临的持续挑战。
首先,与DNA相互作用的蛋白质对其所结合的序列并不十分挑剔,它们可能会随机结合在整个基因组的多个位置,并能容忍一定程度的突变。这些蛋白质中的许多还具有细胞类型特异性;肝细胞、神经细胞、免疫细胞等不同类型的细胞中,存在着不同种类的DNA结合蛋白。在很多情况下,在一个紧凑的空间内拥有多个不同的蛋白质结合位点,比其中任何单一位点的存在更为重要。
我们已经开发了各种软件工具,用于识别非编码DNA中感兴趣的具体位点。但这恰恰是AI擅长解决的问题:涉及不精确且高度依赖上下文的概率判断。因此,谷歌开发了AlphaGenome这一AI系统,用于评估序列的潜在功能。
(对于不想细读论文的生物学爱好者来说,AlphaGenome试图识别的内容包括"基因表达、转录起始、染色质可及性、组蛋白修饰、转录因子结合、染色质接触图谱、剪接位点使用情况,以及剪接连接点的坐标和强度"。)
该系统目前仅限于处理小鼠和人类的序列,并且只在生物学家已深入研究过的有限几种细胞类型上进行过训练。尽管如此,它仍具有实用价值。如果一位研究某个基因的科学家在其非编码区域发现了变化,往往很难判断这些变化是否具有重要意义。AlphaGenome可以就其重要性提供线索,并给出相应的假设解释。而且其预测结果通常与专业软件工具相当,甚至更优。
Q&A
Q1:AlphaGenome是什么?
A:AlphaGenome是谷歌开发的AI基因组系统,用于评估人类基因组中每一种可能的单碱基变异所带来的功能性后果,能够识别非编码DNA区域的潜在作用。
Q2:AlphaGenome能预测哪些内容?
A:AlphaGenome可以预测基因表达、转录起始、染色质可及性、组蛋白修饰、转录因子结合、染色质接触图谱、剪接位点使用情况以及剪接连接点的坐标和强度等多项生物学特征。
Q3:AlphaGenome目前存在哪些局限性?
A:该系统目前仅支持小鼠和人类的基因序列,并且训练数据仅限于生物学家已经深入研究过的有限细胞类型,尚未在生物学界大规模应用验证其实际价值。
