隐秘口袋是指蛋白质中一类只有在发生构象变化后才形成或暴露的结合位点,代表了重要的潜在可成药靶点。然而,可靠地预测能够结合配体的隐秘口袋仍是计算生物学领域的一项持续挑战。
2026年7月7日,波士顿大学组成的研究团队在《Communications Biology》期刊发表论文,题为"The influence of ligands on AlphaFold3 prediction of cryptic pockets",系统评估了AlphaFold3在生成包含已知隐秘口袋的构象系综方面的能力,并揭示了配体输入对预测结果的显著影响。

研究背景与问题定义
隐秘口袋在药物发现中具有重要价值。它们可以扩展活性位点、充当变构调控位点,或作为PROTAC和分子胶的结合区域。因此,通过各类基于物理的计算方法预测隐秘口袋一直是备受关注的研究方向。混合溶剂分子动力学及相关增强采样技术被广泛用于通过监测优先溶剂结合来识别瞬时可配位的口袋,有时还与SwISH、马尔可夫状态建模或基于集合变量的增强采样等方法结合,以捕获更大尺度的构象变化。近年来,亦有研究者尝试用人工智能增强基于物理的计算方法,使用PocketMiner等模型进行残基水平的隐密性评分,或利用基于AlphaFold的构象系综以及AlphaFold3和NeuralPLexer等深度生成共折叠方法,在推定的隐秘口袋中提出配体 placement 方案。尽管已取得显著进展,挑战依然存在,包括混合溶剂模拟中探针聚集和蛋白质去折叠等特定方法学局限、偏置模拟中需要精心选择集合变量,以及许多基于AI的隐秘口袋发现工具的验证和泛化能力仍较有限。
长期以来已知蛋白质以构象系综的形式存在,蛋白质柔性是理解其功能的关键。配体结合(包括隐秘口袋的打开)本质上与蛋白质柔性相耦合。AlphaFold3相较于AlphaFold2的新增能力在于能够分别预测配体结合态和非结合态结构。它采用统一的基于扩散的方法,从一开始就将所有分子组分作为集成系统的一部分进行处理。尽管AlphaFold3实现了蛋白质与配体的联合建模,近期针对蛋白质-配体共折叠方法的基准测试表明,预测准确性可能强烈依赖于与训练期间观察到的特定配体构象的相似度,这引发了对罕见或稀疏表征的结合模式泛化能力受限的担忧。隐秘口袋正属于此类情况——即使目标蛋白已有结构表征,配体稳定的开放构象相对于闭合状态仍可能表征不足。
研究设计与方法
该研究的测试集主要选自CryptoSite或CryptoBench数据库。研究团队对所有蛋白的PDB结构应用了一套分类标准,将其相对于隐秘口袋分为结合态和非结合态。研究将AF3预测的构象分布(分别在有配体和无配体条件下)与PDB中结合态和非结合态结构的分布进行了比较。同时,研究还评估了AF3放置配体的准确性、配体周围局部结构的合理性,以及使用不同配体运行AF3对预测结果的影响。
对于每个测试案例,研究者将两组结构(有配体和无配体)分别对齐到参考闭合态和开放态结构,然后计算移动残基的均方根偏差。移动残基定义为在结合态和非结合态参考结构中构象不同、且在非结合态下会与参考配体产生空间冲突、但在结合态下不会产生冲突的蛋白区段。对于PDB分布中的每个结构和AF3系综中的每个模型,均计算移动区段相对于开放态和闭合态参考结构的RMSD。通过对每个结构或模型进行分类(开放、闭合或"其他"),研究得以量化不同条件下的构象分布差异。
此外,研究还进行了收敛性分析,通过评估系综观测量对随机种子数量的依赖程度,判断AF3预测对随机采样的敏感性。从100个种子的模型中递增随机采样子集,并对所得构象状态和配体构象的分布进行量化,使用自助抽样法估计有限采样带来的统计不确定性。
AF3预测与PDB分布的一致性
对于隐秘口袋,AF3在多随机种子条件下,当使用配体预测蛋白质结构时倾向于找到优势结合态构象;当不使用配体预测时则倾向于找到优势非结合态构象。使用配体生成的AF3结构模型分布与PDB中结合态结构的分布在16个案例中的13个一致;无配体条件下的分布与PDB中非结合态结构在16个案例中的12个一致。在16个案例中的9个中,预测分布同时匹配结合态和非结合态PDB分布。
这一观察与此前研究结果一致,即AF2的预测受PDB中记忆信息的驱动。在本研究中,AF3相对于PDB观测结果在一定程度上使分布趋于尖锐化。值得注意的是,同一多序列比对能够预测出隐秘口袋形成所需的多种尺度(侧链运动、环区移动和螺旋位移)的构象变化。

图1 结合态和非结合态结构与AF3预测(有配体/无配体)的比较
AF3对训练集内蛋白的预测准确性
根据预测表现,研究团队将16个蛋白划分为若干组别。
Group 1a包含BLG、Myosin II、TEM、MAPK、Ricin、ALDBP和PDK,AF3在有配体条件下正确预测结合态分布以开放构象为主,无配体条件下预测非结合态分布以闭合构象为主。Group 1b包含GluR2、Hsp90和K-Ras,AF3在有配体条件下正确预测结合态分布,但无配体条件下的非结合态分布预测不准确。Group 1c以RNase A为代表,AF3在无配体条件下正确预测非结合态分布,但无法正确预测有配体条件下的结合态分布。RNase A的移动区段为位于β-折叠中间的单个侧链His119。AF3在有配体条件下主要预测闭合构象,这可能是"有害记忆"的一个实例。
Group 2包含AR和AmpC,其PDB分布接近预期,但AF3在有配体条件下错误预测闭合构象,原因是AF3将配体放置在正构位点而非隐秘口袋。对于AR,AF3将配体置于远离隐秘口袋的二氢睾酮结合位点,没有一个模型将配体放置在隐秘口袋中。对于AmpC,AF3无论有配体还是无配体均只预测闭合构象,配体被错误放置在附近的活性位点。
Group 3包含PKA、Thrombin和BACE,其移动区段呈现从闭合到开放的几乎连续分布。PKA和Thrombin的隐秘口袋无论配体是否结合均保持开放可及,因此AF3也预测全开放构象。BACE的大部分结构被分类为闭合,AF3预测全部为闭合,可能同样反映有害记忆。

图2 Group 1a、1b、1c和2中单个结合态和非结合态结构与AF3预测(有配体/无配体)的代表性比较
在有害记忆方面,AF3在本测试集中影响较AF2有所减弱。本研究中描述的有害记忆案例共4例(25%),均涉及AF3在有配体条件下预测闭合构象而非正确的开放构象。此前利用AF2对同一测试集的研究中,存在8例(50%)因PDB结构总数不平衡或"其他"构象占比较大而导致的预测偏差。AF3性能的提升可能归因于配体的存在与否,而这在AF2中显然无法实现。
AF3预测配体构象的准确性
AF3在16个蛋白中的10个中正确定位参考配体。另有4个案例中,正确口袋被识别但部分构象存在偏差。最后2个案例(AR和AmpC),配体被放置在正构位点而非隐秘口袋。配体pLDDT评分与配体构象正确性之间存在整体相关性,即随着系综内配体pLDDT值降低,正确构象的数量也相应减少。
表1 AF3共折叠系综中各蛋白的正确和近正确配体构象

值得注意的是,三个蛋白(PDK、MAPK和Hsp90)中出现了配体构象正确但仍与蛋白质存在空间冲突的情况。在全部三个案例中,配体pLDDT值普遍较高(>70),但高置信度并不保证物理合理性。Hsp90代表了一种更严重的失效模式,其大多数模型尽管pLDDT评分均匀偏高,仍表现出系统性的空间冲突。这一发现与近期其他研究结果一致,即共折叠模型可能产生违反基本物理预期的高置信度预测,凸显了在解释配体构象时进行独立物理合理性检查的必要性。

图3 结合态参考结构与AF3预测结构(与参考配体共折叠)的叠加

图4 AF3系综预测中配体构象准确性的评估
数据还表明,如果使用配体运行AF3,16个蛋白中的14个至少能找到一个在隐秘口袋中结合配体的胜任构象。这一结果在预期之中,因为存在配体结合于隐秘口袋的结构且这些结构在AF3训练集中出现过。研究还发现系综水平分布随种子数量增加而快速收敛,约80个种子后变化极小,表明所报道的构象群体对扩散过程的随机变化具有稳健性。
配体选择对AF3预测的影响
用于AF3预测的配体选择有时会影响结果,特别是当配体结合到PDB中显著存在的构象时。例如,当用较小的配体谷氨酸替代参考配体ATPO对GluR2进行配体结合态AF3预测时,模型预测了正确的闭合构象——谷氨酸因其在隐秘口袋中心的位置,尺寸不足以要求口袋开放才能结合。类似地,TEM-Xe的X射线结构显示Xe同时结合在多个位点(包括隐秘口袋),全部处于闭合构象。用单个Xe进行AF3预测也能正确预测闭合构象,但Xe位于不同的口袋。当要求AF3预测3个Xe结合时,它将全部3个Xe重叠放置在隐秘口袋中,蛋白质处于闭合构象——AF3无法识别这是物理上不可能的情形。

图5 AR的AF3系综预测中DHT和RB1同时预测时的配体构象准确性评估
结果表明,AF3优先稳定配体在优势活性位点的放置,在解析同时占据的结合位点时存在困难,这与偏向优势结构先验而非上下文依赖的配体区分的机制一致。值得注意的是,虽然配体选择对多序列比对无影响,AF3使用基于扩散的框架联合预测蛋白质和配体,不同的配体输入改变了去噪过程的初始条件和约束,即使对同一蛋白质序列也会导致不同的去噪轨迹。这些依赖于配体的去噪路径可能使模型偏向构象景观中的不同局部极小值,这解释了为何AF3在不同配体输入下产生不同的结构系综。
AF3对训练集外隐秘口袋的预测能力
研究团队识别了8个在AF3训练日期之后释放结构的测试案例,其中6个在AF3训练日期前无该蛋白结构释放,2个仅有1个闭合结构且无隐秘口袋形成。
表2 研究中使用的AF3训练日期之后释放的蛋白

对于8个案例中的5个(FTHFS、DHFR、DDL、UGT和12-Lox),AF3在有配体条件下能够正确预测开放口袋。这意味着即使在训练集中不存在隐秘口袋开放的结构,AF3仍能在大多数情况下成功预测隐秘口袋。这些案例均归类为Group 1b,即AF3无论有无配体均预测开放口袋。对于2个案例(pepA和DhbA),无配体时AF3正确预测闭合结构(Group 1c)。对于ARHGEF2,PDB分布仅在有配体时口袋开放、无配体时闭合,但AF3在C端区域出现折叠错误——所有PDB结构中C端为环区后接短螺旋段,而AF3模型将其全部建模为更长的螺旋。

图6 AF3训练日期后释放案例的结合态和非结合态结构与AF3预测(有配体/无配体)的比较
参考链接:
https://doi.org/10.1038/s42003-026-10596-z
|