蛋白质的功能由其结构决定,而结构——即蛋白质的折叠方式——则由氨基酸序列决定,氨基酸是构成蛋白质的基本单元。

许多设计新型蛋白质的方法(包括能够结合细胞内致病分子的蛋白质)都采用两步流程:先确定结构,再由机器学习框架生成一系列可能折叠成该结构的氨基酸序列。

在自然界中,许多不同的氨基酸序列可以折叠成相同的结构。与此同时,同一条氨基酸序列也可能因蛋白质的灵活性或功能触发条件不同而形成不同结构。因此,当研究人员使用人工智能设计新蛋白质时,挑战在于如何引导AI"看到"存在多种潜在可行答案——即许多序列都能形成相同的折叠结构。

"多年来,这一领域衡量成功与否的标准,是模型能否复现进化所筛选出的蛋白质序列——我们的研究表明,这并不是评估蛋白质设计的最佳指标。"麻省理工学院生物学系主任、Jay A. Stein(1968届)生物学讲席教授、生物工程学教授、该论文资深作者Amy E. Keating表示。该论文近期已发表于《美国国家科学院院刊》(PNAS)。

PottsMPNN是由麻省理工学院生物学系开发的新型机器学习框架,它融入了支配蛋白质结构与稳定性的物理学原理,从而改善了序列生成能力,并提升了对突变如何影响蛋白质稳定性的预测精度。换言之,该模型对序列-能量景观有了更深入的理解,即每个氨基酸的身份与蛋白质稳定性之间的关系。

将这一框架引入蛋白质设计流程后,研究人员将能够设计出结构上可行、且序列与任何天然蛋白质都不相似的全新蛋白质。

"如果我们考虑的是一种全新的设计结构,就没有天然序列可供比较。"论文第一作者、博士生Foster Birnbaum说,"我们真正关心的是:生成的序列折叠成目标结构的可能性有多大、模型对序列-能量景观的理解有多深,以及它预测突变对蛋白质稳定性影响的能力有多强。"

超越噪声

正如人工智能近年来推动了一些深刻的社会变革,机器学习同样在加速和拓展基础生物学研究的边界。直到不久前,利用计算模型可靠地生成蛋白质结构或序列才成为可能。然而,目前使用最广泛的相关模型仍是2022年发布的那个。

"对于机器学习在生物学领域这样快速发展的方向,那个模型至今未被超越——我们一直在思考这是为什么,以及是什么让它如此有用。"Birnbaum说。

Birnbaum最初对研究人员所称的"噪声"的策略性应用感兴趣,即在训练过程中向蛋白质结构添加变异。引入噪声可以降低模型过度模仿天然序列的倾向,从而提高模型能够生成序列的结构多样性。

PottsMPNN还采用了成对分布来捕捉氨基酸之间的相互作用。能够考虑蛋白质中一对位置上20种可能序列选项之间的物理相互作用,是PottsMPNN比其他方法更准确地建模序列-能量景观的关键原因。

此外,Birnbaum表示,他们在训练PottsMPNN框架时引入了进化相关序列集,以此教会模型不同序列如何采用相同折叠结构。

Birnbaum承认,在尝试摆脱对天然序列依赖的过程中,引入进化信息在某种程度上仍是对天然序列的依赖。但PottsMPNN已成功证明:随着模型对天然序列的依赖程度不断降低,结构兼容性和能量预测能力——包括对新型蛋白质的预测——都得到了提升。

人工智能时代的蛋白质设计

"一旦我们能够随心所欲地设计任何蛋白质,就能实现令人震撼的生物工程应用。"Birnbaum说,"这是一项艰巨的任务,但我对这个世纪生物学领域的进展充满乐观。"

Birnbaum希望该模型能够得到进一步优化,并针对特定任务进行精调——这在过去曾带来更好的预测效果,例如对特定突变的结果或影响作出预判。

Keating总结道:"我们的方法推动这一领域朝着为多样化应用场景设计有用的自然界全新蛋白质的方向迈进,同时为未来的进一步突破奠定了更坚实的基础。"

Q&A

Q1:PottsMPNN是什么,和现有蛋白质设计方法有什么不同?

A:PottsMPNN是由麻省理工学院生物学系开发的新型机器学习框架,专门用于蛋白质序列设计。与现有方法相比,它最大的不同在于融入了支配蛋白质结构与稳定性的物理学原理,并通过成对分布捕捉氨基酸之间的相互作用,使模型能更准确地理解序列与蛋白质稳定性之间的关系,从而生成无需依赖天然序列的新型蛋白质。

Q2:为什么蛋白质设计不应该只依赖天然序列作为评估标准?

A:因为在自然界中,许多不同的氨基酸序列可以折叠成相同结构;同一序列也可能因条件不同而形成不同结构。当设计全新结构时,根本不存在可参照的天然序列。研究团队认为,真正重要的评估维度应该是:生成序列折叠成目标结构的概率、模型对序列-能量景观的理解深度,以及对突变稳定性影响的预测精度。

Q3:PottsMPNN在训练中是如何处理进化信息的?

A:PottsMPNN在训练时引入了进化相关序列集,目的是让模型学习不同氨基酸序列如何折叠成相同结构。研究团队也承认,这在一定程度上仍依赖天然序列信息,但实验结果表明,随着模型对天然序列的依赖逐步降低,其结构兼容性和能量预测能力——包括对全新蛋白质的预测——反而得到了提升。

MIT News