PottsMPNN可生成偏离天然序列、仍可能稳定折叠的新蛋白质。

蛋白质的功能取决于结构,结构又由氨基酸序列决定。设计新蛋白质通常分两步:先确定目标结构,再由机器学习框架生成可能折叠成该结构的一组序列。这类蛋白质有望与细胞内致病分子结合,应用于疾病研究和治疗。

自然界中,多种氨基酸序列可以折叠成相同结构;同一序列也可能因蛋白质的柔性或功能触发因素形成不同结构。人工智能设计蛋白质的难点,是让模型认识到同一种折叠方式可能对应许多有用序列。麻省理工学院生物学系主任、论文资深作者Amy E. Keating认为,多年来该领域常以模型能否复原进化选择的天然序列衡量成功,但这并非蛋白质设计的最佳指标。

生物学系开发的新机器学习框架PottsMPNN把控制蛋白质结构和稳定性的物理原理纳入模型。它更准确地描述序列能量图景,也就是每个氨基酸的身份与蛋白质稳定性之间的关系,并能更好地预测突变对稳定性的影响。把它加入蛋白质设计流程后,研究人员可以寻找结构上可行、序列却不像任何天然蛋白质的设计。

论文第一作者、研究生Foster Birnbaum说,全新设计的结构没有天然序列可供比较。真正需要衡量的是生成序列折叠成目标结构的可能性、模型理解序列能量图景的程度,以及它预测突变稳定性效应的能力。

机器学习近年显著加快并拓宽了基础生物学研究。可靠地用计算模型生成蛋白质结构或序列,直到不久前才成为可能。不过,如今应用最广的相关模型可能仍是2022年发布的版本。Birnbaum及其同事一直试图理解,它为何尚未被超越,以及哪些设计使它持续有效。

PottsMPNN采用了3项关键做法。第一项是在训练中向蛋白质结构加入变化,也就是“噪声”。噪声可降低模型过度模仿天然序列的倾向,让它能为更多样的结构生成序列。第二项是用成对分布捕捉氨基酸之间的相互作用。模型会考虑蛋白质两个位置上全部20种序列选项的物理作用,因此能更准确地描述序列能量图景。第三项是把具有进化亲缘关系的序列组加入训练,教模型理解不同序列如何形成相同折叠结构。Birnbaum承认,这种方法虽然试图减少对天然序列的依赖,却仍在某种程度上使用进化信息。测试结果表明,模型越少依赖天然序列,对结构相容性和能量的预测越好,新型蛋白质也包括在内。

Birnbaum认为,能够按需设计蛋白质将开启规模可观、也可能令人担忧的生物工程能力。他对本世纪生物学的进展仍持乐观态度,并希望继续改进模型,针对具体任务微调,例如提高对特定突变结果或后果的预测。Keating认为,这套方法让可用于不同用途的非天然新蛋白质设计向前迈进,也为后续发展提供了更坚实的基础。

原文:https://phys.org/news/2026-08-ai-potentially-stable-protein-sequences.html