当新冠疫情暴发时,科学家拥有一项关键优势:此前数十年对冠状病毒的研究,使他们能够充分了解该病毒的关键蛋白质,从而以创纪录的速度设计出疫苗。然而,下一场大流行病可能不会给人类同样的先机。
为提高应对胜算,英伟达已加入由谷歌DeepMind、欧洲分子生物学实验室欧洲生物信息研究所(EMBL-EBI)等全球研究机构组成的联盟,共同发布了2800多种病毒蛋白质复合物的预测三维结构,并通过AlphaFold数据库向全球任何科学家开放获取。
此次发布的数据集中的结构,是利用谷歌DeepMind用于预测蛋白质折叠三维形态的AI模型AlphaFold2推断得出的,并借助英伟达BioNeMo推理运行时进行了优化。这使得团队能够将推理规模扩展到数千种病毒蛋白质组,预测出每种病毒所编码的蛋白质复合物(即相互作用的蛋白质群组)。
谷歌DeepMind生命科学合作伙伴关系经理丽莎·帕特尔表示:“我们建立AlphaFold数据库的愿景,始终是让基础生物学研究能够大规模普惠共享。此次合作将数千种病毒复合物纳入数据库,将为全球科学家提供应对未来疫情所需的洞察。”
英伟达还开放发布了用于生成该数据集的GPU加速工作流程——BioNeMo结构预测流水线,使研究人员能够针对自己的研究目标,从蛋白质序列直接得到预测的三维结构。
应对下一场大流行病的准备工作必须从现在开始。全球发展中心的一项分析估计,到2050年,世界面临类似新冠疫情严重程度大流行病的概率约为50%。
英国医学研究理事会格拉斯哥大学病毒研究中心分子病毒学教授、该项目合作者乔·格罗夫表示:“当下一场大流行病来袭时,可能会出现一些我们完全没有预料到的情况,而我们将缺乏应对新冠疫情时所积累的知识。我们正在努力做的,就是提前储备这些知识。”
此次新加入数据库的蛋白质相互作用中,约有30%是科学界前所未知的,呈现出以往从未在蛋白质数据库(即实验测定蛋白质结构的主要存储库)中记录过的相互作用形态。这意味着生物学界将获得可供探索和利用的全新知识。
英伟达数字生物学应用研究科学团队负责人克里斯·达拉戈表示:“这个数据库是产生科学假设的引擎。我们让生物学家和AI社区不仅能够研究单个分子,还能研究蛋白质复合物,从而推动整个领域向前发展。”
预测复杂蛋白质结构
大多数蛋白质并非单独发挥作用,它们会组合成由多个分子构成的复合物,以执行复杂的功能。这些结构往往正是疫苗或药物需要靶向作用、以阻断病毒功能的目标。
例如,了解新冠病毒刺突蛋白的三维结构,为疫苗设计奠定了基础。然而,目前仍有数千种其他病毒缺乏此类结构信息,而这一数据集正开始填补这一空白。
确定蛋白质结构的传统方法——使蛋白质结晶后进行X射线照射——可能需要耗时数年,每个结构的成本高达数千美元。而经英伟达BioNeMo优化、可在英伟达GPU上高效运行的AlphaFold2,仅需数分钟即可完成一次结构预测,并可实现批量运算。科学家随后可以通过实验方法验证高置信度的预测结果。
在这一项目中,团队系统性地梳理了已知感染人类的病毒家族的蛋白质结构,涵盖从普通感冒病毒到猴痘等新发威胁病毒。
全球合作与全球共享
此次合作汇聚了流行病防范创新联盟、EMBL-EBI、谷歌DeepMind、英伟达、首尔国立大学、成均馆大学、瑞士生物信息学研究所以及格拉斯哥大学等多方力量。
该数据集的发布,恰逢本周在纽约举行的、由世界经济论坛召集的联合国大会关于大流行病预防、防范与应对的会议。此次发布也为AlphaFold数据库增添了新内容,目前该数据库已收录超过2.6亿项蛋白质及蛋白质复合物预测结构,几乎涵盖了科学界已知的所有蛋白质。
EMBL-EBI代理主任乔·麦肯泰尔表示:“开放这些数据,对于理解病毒诊断、开发治疗方法和疫苗至关重要。该数据集还涵盖了研究较少的病毒,降低了资源匮乏地区一线应对疫情的科学家的研究门槛。”
该开放数据集中的预测结果均标注了置信度等级,展示了病毒复合物可能呈现的形态,以及病毒蛋白质组内各蛋白质可能的相互作用方式。
总体而言,这一新数据集为数字生物学和疾病研究领域的科学家提供了重要的信息支撑。
格罗夫说:“我读博士的时候,我们研究的蛋白质都没有相应的结构数据,那时做研究就像在黑暗中摸索,我们只能靠猜测。而这一数据集则为当下正在攻读博士学位的研究人员提供了强大的工具,这些高质量的结构数据将加速基础科学的发展。”
研究人员可以在AlphaFold数据库大流行病防范门户网站上探索病毒蛋白质复合物数据集,使用BioNeMo结构预测流水线为自己的蛋白质靶点预测结构,并进一步了解英伟达BioNeMo的更多信息。
Q&A
Q1:AlphaFold数据库新增的病毒蛋白质复合物数据有什么作用?
A:这些数据可以帮助科学家提前了解病毒蛋白质的三维结构及相互作用方式,为未来疫苗和药物设计提供基础知识储备,从而更好地应对下一场可能到来的大流行病。
Q2:英伟达在这次病毒蛋白质结构预测项目中承担了什么角色?
A:英伟达提供了BioNeMo推理运行时对AlphaFold2模型进行优化,使团队能大规模扩展推理,并开放发布了BioNeMo结构预测流水线这一GPU加速工作流程,供研究人员自行预测蛋白质结构。
Q3:传统方法和AlphaFold2预测蛋白质结构相比有什么区别?
A:传统方法需要将蛋白质结晶后用X射线照射,耗时可达数年,每个结构成本高达数千美元;而AlphaFold2经过优化后在GPU上运行,几分钟即可完成预测,还能批量处理,之后再通过实验验证高置信度结果。
