扩散模型+蛋白质口袋:conDitar-dev实现三维分子生成与ADMET性质联合优化

Akkio
2026-07-21 18:35:30
人工智能
生命科学
论文精读与讲座笔记

今天介绍的是一篇发布在arXiv上的文章,题目为 Generating Developable 3D Molecules via Pocket-Conditioned Diffusion and Property-Aware Optimization。文章提出了一个名为 conDitar-dev 的结构基础药物设计框架,不仅能够根据蛋白质结合口袋生成具有较强结合能力的三维小分子,还试图在生成阶段直接优化致癌性、致突变性、心脏毒性、肠道吸收和血脑屏障通透性等ADMET性质。




———


从发现一个具有生物活性的分子,到最终将其开发为可以进入临床的药物,通常需要经历靶点确认、先导化合物发现、活性优化、药代动力学评价、安全性评价和临床试验等多个阶段。一个分子即使能够与目标蛋白紧密结合,也不意味着它一定能够成为药物:它可能难以被人体吸收,可能无法到达作用部位,也可能存在肝毒性、心脏毒性、致突变性或其他安全风险。


近年来,扩散模型逐渐成为三维分子生成的重要方法。以TargetDiff、DecompDiff和DiffSBDD等模型为代表的结构基础药物设计方法,可以将蛋白质结合口袋作为条件,从随机噪声中逐步生成配体的原子类型和三维坐标。与传统的虚拟筛选不同,这些模型不是从已有分子库中寻找候选物,而是直接在化学空间中设计新的分子。


然而,现有基于扩散模型的SBDD方法仍然存在三个主要问题。


在方法层面,许多模型在每一个去噪步骤中同时学习蛋白口袋表示和配体表示。由于扩散早期的配体结构接近随机噪声,这些错误或不稳定的配体信息可能反过来干扰口袋表示,使条件信息在多轮去噪过程中发生漂移。此外,很多模型主要在原子尺度上描述蛋白质与配体之间的相互作用,却较少显式利用残基层面的信息。原子尺度可以描述局部距离和方向,但残基尺度包含疏水性、电荷、极性以及更大范围的结构环境,两种尺度共同决定配体识别和结合。


在应用层面,现有模型大多优先优化结合亲和力,而将ADMET性质留到后续先导化合物优化阶段。这样可能产生大量"对接分数很好,但开发价值有限"的分子,增加后续筛选和实验验证的成本。


针对这些问题,作者提出了 conDitar-dev。其核心思想可以概括为:先单独学习稳定、可复用的多尺度蛋白口袋表示,再以该表示为固定条件生成三维配体,最后在不重新训练扩散模型的情况下,通过优化采样噪声轨迹改善分子的ADMET性质。


方法概览:三个模块的分工与协作


conDitar-dev由三个主要模块组成。



 


msPRL 是一个预训练的多尺度口袋表示学习模块。它同时编码口袋中的原子和残基,输出具有旋转、平移几何性质的标量与向量表示。关键在于,这一阶段只处理蛋白口袋,不依赖当前正在生成的配体。因此,在后续扩散过程中,口袋条件可以保持固定,避免因为早期配体噪声而不断改变。为了进行自监督预训练,模型随机遮蔽口袋中20%的原子类型并扰动其坐标,随后通过解码器尝试恢复原始信息,以此迫使网络学习能够反映局部几何和化学环境的稳定口袋嵌入。


conDitar 是以msPRL产生的口袋嵌入为条件的三维分子扩散模型。它从随机初始化的配体原子坐标和原子类型出发,逐步执行反向扩散。其内部的 pcLG 图神经网络同时建模三类相互作用:配体内部的原子—原子关系、配体原子与口袋原子的精细相互作用、以及配体原子与口袋残基的高层次化学环境。原子级信息帮助判断氢键、空间排斥和局部方向,残基级信息则提供疏水性、极性、电荷和口袋形状等背景,两者结合使模型能够更全面地理解蛋白口袋适合容纳的配体特征。模型最终输出配体的原子类型和三维坐标,并根据预测的原子关系辅助判断化学键类型。


paOPT 是一种生成时运行的性质感知优化模块。它不修改conDitar的模型参数,而是记录扩散采样过程中注入的高斯噪声和Gumbel噪声,并将整条噪声轨迹视为可优化变量。每完成一次生成,外部性质预测器都会为最终分子计算一个目标分数——例如致癌风险、Ames致突变风险、hERG抑制风险、人肠道吸收概率或血脑屏障通透概率。paOPT随后根据该分数调整噪声轨迹,再次生成分子,使结果逐步向目标性质更优的方向移动。由于实际使用的ADMET预测器通常是黑盒模型,无法直接反向传播梯度,作者采用零阶梯度估计:对噪声轨迹施加正、负随机扰动,比较两次性质分数的差异来估计优化方向。这种方法理论上可以接入任何能给出标量奖励的评分函数,具有较好的可插拔性。


简而言之,conDitar负责"生成能够适配口袋的分子",paOPT负责"在保持口袋条件和生成模型不变的情况下,将采样方向推向更可开发的区域"。在确定配体大小时,模型通过统计训练集中每个口袋大小区间对应的配体原子数分布,从经验分布中采样,使配体大小与口袋空间相匹配,而非为所有口袋生成固定大小的分子。


计算评价:结合能力、ADMET性质与分子质量


作者在包含72个人类疾病相关靶点的CDH测试集上进行了系统比较,评价指标覆盖结合亲和力、类药性、合成可及性、分子多样性以及综合成功率。conDitar取得了平均Vina D为-8.85 kcal/mol的成绩,中位数HA%达-74.6%,综合成功率SR为-22.0%,在上述指标上均优于AR、Pocket2Mol、DiffSBDD、TargetDiff、DecompDiff和DecompOpt等基线方法。作者认为性能提升主要来自两个设计:口袋由msPRL提前编码,无需在每个扩散时间步重新学习;以及pcLG同时使用原子和残基尺度的口袋—配体相互作用。需要说明的是,IPDiff在部分Vina指标上数值优异,但其生成结果明显偏向富碳、单键占比过高的简单疏水结构,可能通过非特异性疏水作用获得较好的对接分数,因此未被作为主要最佳结果进行比较。


ADMET性质优化是本文的核心亮点。在五项性质(致癌性、Ames致突变性、hERG风险、人肠道吸收、血脑屏障通透性)上,conDitar-dev相比原始conDitar均有显著改善。以Ames致突变性为例,平均风险分数从0.37降至0.10,改善幅度约73%。更为重要的是,paOPT优化ADMET性质后,整体结合能力仍然与原始conDitar接近,并未因为性质优化而完全破坏口袋适配。实验还显示,每次只指定一个目标性质进行优化时,其他未被直接优化的性质大多保持相对稳定。不过,提高肠道吸收或血脑屏障通透性有时会伴随hERG风险上升,提示单目标优化仍不能完全解决真实药物设计中的多性质权衡问题。



在化学稳定性与药物过滤规则方面,conDitar和conDitar-dev的原子价态稳定性均达到0.935以上。ADMET优化还在BMS、PAINS、SureChEMBL和NIBR等结构警报指标上带来进一步改善,说明优化减少了一部分潜在反应性或非特异性结构片段。不过,与多数扩散模型相似,生成的分子仍存在碳原子和单键偏多、芳香键偏少的问题,反映出三维扩散模型对完整芳香环等全局拓扑结构的恢复仍较为困难。



实验验证:PD-L1与CSF1R


作者不仅进行了大规模计算评价,还选择PD-L1和CSF1R两个药物靶点开展分子合成与生物实验,这是本文区别于大多数纯计算生成方法的重要特色。


在PD-L1案例中,研究人员从conDitar-dev直接生成的分子中筛选候选物进行合成与表面等离子共振实验。两个直接生成的分子PL-1和PL-2分别获得了3.49 μM和3.75 μM的SPR结合常数,QED均为0.65。对接分析显示,生成分子与参考配体在PD-L1二聚体界面具有相似的结合模式,都能够在TYR-56附近形成芳香相互作用,并与ASP-122附近区域发生作用。这一结果表明,conDitar-dev产生的不只是具有较好计算对接分数的三维结构,其中部分分子能够被真实合成并在体外实验中表现出可检测的靶点结合能力。


CSF1R案例采用了不同的策略。作者将生成分子作为三维形状查询模板,使用FastROCS在Sanofi内部化合物库中搜索类似物,再结合对接、机器学习活性预测和多参数排序筛选候选物。最终发现的两个高活性分子CL-1和CL-2分别对CSF1R具有200 nM和309 nM的抑制活性,且激酶非特异命中率分别仅为1.1%和2.4%。这里需要说明的是,CL-1和CL-2并不是conDitar-dev直接输出的新分子,而是以生成分子为模板从已有化合物集合中发现的类似物。因此,CSF1R案例更准确地证明了模型可用于提出新的三维结构模板并支持后续hit expansion,而非证明模型能在所有靶点上直接一次生成纳摩尔活性分子。


总结与讨论


conDitar-dev的贡献体现在三个层面:将口袋表示学习与配体扩散解耦,减少了口袋条件受早期噪声干扰的风险;同时建模原子尺度和残基尺度的信息,使模型更全面地理解口袋与配体的互补关系;以及通过paOPT提供了一种不重新训练扩散模型的性质控制方式,具有较强的可插拔性。


不过,在理解这项工作时也有几点需要保持审慎。论文中的ADMET结果来自预测模型而非实验测定,优化黑盒预测器理论上存在"利用预测模型漏洞"的风险,预测分数改善不等同于真实药物性质改善。paOPT当前主要采用单目标优化,迭代曲线已显示不同性质之间存在冲突,未来需要发展多目标Pareto优化方法。在蛋白质柔性方面,conDitar-dev仍以单一静态口袋结构作为条件,对于构象变化明显的靶点,如何让生成模型适应动态口袋仍是一个开放问题。此外,CSF1R的高活性分子来源于类似物搜索而非直接生成,这一点在理解模型能力时需要加以区分。


总体而言,conDitar-dev的重要意义并不只是将Vina分数再提高一些,而是尝试把"结合驱动的分子生成"和"可开发性优化"前移到同一个生成阶段。文章还通过真实的分子合成和生物实验说明,生成模型可以参与从结构设计、候选筛选到类似物扩展的早期药物发现流程,为AI辅助药物设计提供了一条从"能结合"走向"能成药"的新思路。


———



论文链接:https://arxiv.org/abs/2607.12349


项目代码:https://github.com/ninglab/conDitar-dev


8
0
0
0
关于作者
相关文章
  • 论文精读:量子辅助玻尔兹曼机用于风力发电概率学习 ...
    1.背景介绍​可再生能源发电概率的精确建模对于现代电力系统中的功率预测和不确定性感知运行至关 ...
    了解详情 
  • 专用量子计算与Madelung变换在流体力学纳维-斯托克斯方程模拟中 ...
    本文围绕湍流模拟长期受困于经典计算“非线性计算深渊”的瓶颈展开,针对经典计算流体 ...
    了解详情 
  • MOLWORLD:面向药物设计的分子世界模型与可达性感知分子优化技术 ...
    针对现有分子优化方法多聚焦于孤立地最大化预测分数,而忽视候选分子在实际药物研发中所需的结构 ...
    了解详情 
  • Adv. Mater.:AMDEN非晶材料逆向设计框架发布,基于扩散模型实现 ...
    针对晶体材料因缺乏长程有序结构导致逆向设计难度大的核心挑战,本文提出基于扩散模型的首个多元 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas