蛋白质为什么要折叠,AI 又是怎么猜出它形状的?

TL;DR

蛋白质是一串氨基酸折成的微型机器,三维形状往往决定它能做什么。传统实验测结构耗时昂贵,AlphaFold 则从序列和已知结构中预测空间关系。本文面向非生物专业读者解释折叠、预测结果与实验验证之间的关系。

蛋白质是一串氨基酸折成的微型机器,三维形状往往决定它能做什么。传统实验测结构耗时昂贵,AlphaFold 则从序列和已知结构中预测空间关系。本文面向非生物专业读者解释折叠、预测结果与实验验证之间的关系。

蛋白质为什么要折叠,AI 又是怎么猜出它形状的?

蛋白质可以想象成一串由氨基酸连接起来的长链,但它在细胞里不会像散乱毛线一样漂浮。链上的不同部分会互相吸引、排斥和弯折,最终形成复杂的三维结构。这个形状往往决定蛋白质能与谁结合、能催化什么反应,以及能否正常工作。

知道氨基酸顺序,只是拿到了零件清单;知道折叠后的结构,才更接近看见这台微型机器。

p53 蛋白质与 DNA 结合的三维结构示意图

为什么形状如此重要

抗体需要用特定表面识别目标,酶需要形成容纳分子的口袋,运输蛋白则依赖能够开合的通道。一个关键位置改变,整条链的折叠方式和功能都可能受到影响。某些错误折叠还与疾病有关。

科学家可以使用 X 射线晶体学、冷冻电镜和核磁共振等实验方法测定结构。这些方法非常重要,却可能耗时、昂贵,也并非适用于所有蛋白质。因此,从序列预测结构长期以来一直是计算生物学的重要难题。

AI 不是在模拟每个原子怎样抖动

直觉上,人们可能认为预测折叠必须从一条直链开始,逐毫秒模拟所有原子的运动。AlphaFold 走的并非这条完整物理模拟路线。它从已知蛋白质序列与结构中学习规律,预测不同氨基酸残基之间的空间关系,再据此构建三维结构。

序列中的共同演化信息尤其有用。如果两个位置在不同物种中经常一起变化,它们可能在结构上相互作用。模型还会利用几何约束与结构模式,把大量局部关系整合成一个空间方案。

Google DeepMind 的五年回顾介绍,AlphaFold 2 在 2020 年的 CASP14 蛋白质结构预测评测中取得突破,之后与 EMBL-EBI 合作建立数据库,并发布了超过两亿个预测结构。规模扩大使研究者能更快形成假设,但数据库里的“预测”二字仍然关键。

加载链接预览…

彩色丝带图不是蛋白质的真实照片

我们常看到的螺旋和彩带,是帮助人理解结构的可视化。真实蛋白质由原子组成,并在溶液与细胞环境中不断运动,不是凝固的雕塑。许多蛋白质还会与其他蛋白、DNA、小分子或金属离子结合,单独结构无法讲完全部故事。

预测结果通常带有置信度。高置信区域可为实验设计提供线索,低置信区域可能表示结构灵活、资料不足或模型不确定。研究者不能把漂亮图像自动当成实验事实,而应结合生化实验、突变研究和其他结构方法验证。

它解决了什么,又没有解决什么

结构预测可以帮助寻找潜在结合位点、解释基因变异、比较蛋白质家族并设计实验。过去可能要先花很久获得结构线索,现在可以先查看预测,再把实验资源集中到最值得验证的方向。

但从结构到新药之间仍有很长距离。药物要进入人体、到达目标、产生足够效果,同时避免毒性和其他副作用。蛋白质也可能拥有多个动态构象,疾病机制更涉及细胞、组织和整个人体。预测一个结构不等于自动找到疗法。

AlphaFold 的意义不是让实验室变得多余,而是改变实验起点。面对一串氨基酸,研究者不再只能从空白纸开始,可以先得到一张有置信标记的三维草图。AI 猜出形状,实验确认现实,两者结合才让这台微型机器真正被理解。

KEEP READING