扩散模型+大语言模型双轮驱动:AI小分子生成从虚拟设计走向临床与实验验证

宇宙微尘
2026-07-27 15:10:19
人工智能
生命科学
量子科普
本帖最后由 宇宙微尘 于 2026-7-27 15:11 编辑


本文系统梳理了2016年以来AI驱动小分子设计的发展脉络。文章将分子生成AI拆解为四大核心模块:分子表示(一维SMILES/SELFIES字符串、二维分子图、三维等变构象表征)、生成策略(涵盖VAE、GAN、归一化流、Transformer/LLM、扩散模型等前沿方法,以及组合生成等传统路径)、优化策略(融合贝叶斯优化、强化学习、遗传算法及蒙特卡洛树搜索等多类搜索算法,兼顾合成路线规划与量子计算集成)及评估体系(覆盖性质预测、合成可及性打分与多目标优化,依托GuacaMol等基准平台实现标准化评测)。文中验证了AI设计在药物发现(如进入临床的TNIK抑制剂)、材料开发(如有机光伏受体效率达11.8%)及自驱动实验室闭环验证中的落地成果。最后指出当前面临数据偏倚、复杂性质预测不准等挑战,展望了多模态融合、量子化学耦合及大模型赋能的未来方向,标志着化学研究正从“解释现象”迈向“主动设计”的新范式。




化学本质上是一门"逆向工程"学科。天然产物全合成是从分子结构倒推断键策略,光谱解析是从谱线指纹反推原子连接方式,而药物化学的核心命题——给定一个蛋白靶点,找到能精准调控它的分子——同样是一个逆问题。在AI深度嵌入化学研究之前,这些逆问题的求解高度依赖专家的经验直觉和漫长的试错迭代。2016年,深度学习技术被引入分子生成领域,事情开始发生变化。七年后的今天,AI设计的小分子已经不仅存在于计算模拟的虚拟空间里——有的进入了临床试验管线,有的在自动化实验室里被真实合成和验证。


2026年7月,东京大学Koji Tsuda团队在Chemical Reviews(IF 55.8)上发表了一篇系统综述,完整勾勒了这条从算法创新到实验验证的技术演进脉络。文章涵盖变分自编码器、生成对抗网络、归一化流等传统深度生成模型,也系统梳理了Transformer大语言模型和扩散模型这两股正在重塑领域格局的新力量,并对合成可及性评估、自驱动实验室等落地瓶颈给出了务实讨论。


分子的"语言":三种表示方法各自为战


在分子生成AI的底层,始终横亘着一个根本选择:用什么数据结构来描述一个分子。这个选择决定了后续模型能捕捉到什么层级的化学信息,也决定了哪些机器学习技术可以派上用场。



分子生成AI的核心组件与分子表示方法


一维表示将分子压缩为字符串——SMILES是最广为人知的通行证,简洁、可读、占空间小,但它的语法并非对任意字符排列都宽容:随机拼接生成的SMILES字符串大概率对应一个根本不存在的分子。SELFIES通过自引用的嵌入规则修复了这一缺陷,保证任意合法字符串都能解码回有效分子。此外,分子指纹和理化描述符作为经典的QSAR/QSPR输入,仍然在一维表示体系里占据一席之地。二维表示把分子看作图——原子为节点,键为边——这种视角天然适配消息传递图神经网络(MPNN),但如何让模型对节点编号顺序不敏感、如何处理立体化学的手性信息,仍是工程上的持续挑战。三维表示则直接对原子的空间坐标进行编码,要求模型具备E(3)或SE(3)等变性——这正是扩散模型得以在分子生成中大放异彩的关键基础,因为三维坐标天然适配扩散过程的连续去噪范式。


三种表示并非互斥。事实上,这篇综述中梳理的大量工作表明,当一个框架能够跨模态融合一维字符串、二维拓扑和三维构象信息时,生成分子的质量和下游任务的适配性往往会出现跃升。



多样化的生成策略


从VAE到扩散模型:生成范式的三次转向


综述以生成策略为纲,对近七年的方法演进做了清晰的分期。


第一波浪潮以变分自编码器(VAE)为代表,核心思路是将离散的分子映射到连续隐空间,在这个平滑的向量空间里做插值、优化和采样。早期直接基于SMILES的VAE面临有效性困境——解码器产出的字符串经常不合化学语法。GrammarVAE用形式语法约束解码过程,JT-VAE把分子切成子图再组装,两者从不同角度缓解了这个问题。同期出现的GAN(如MolGAN)则引入了生成器-判别器的对抗训练框架,在分子图生成上展现了另一种思路,但训练不稳定性始终是隐忧。


第二波转型来自Transformer和自注意力机制。SMILES Transformer率先将序列到序列的自回归范式带入分子生成,随后的ChemBERTa、Chemformer通过在大规模分子语料上预训练,让模型学会了化学语言的内在统计规律。2023年以后,真正的"大语言模型"——如结合上下文感知生成的Llamol——开始模糊通用语言模型和专用分子生成器之间的边界:给定一段"设计一个logP在2-4之间、分子量不超过500的激酶抑制剂"的自然语言提示,模型能直接输出候选分子结构。


第三波、也即当前最前沿的范式,是扩散模型的崛起。与在文本空间里操作的LLM不同,扩散模型在三维坐标空间中进行生成——从一个随机的原子云出发,通过逐步去噪过程收敛到稳定的三维分子构象。EDM和3DMolNet等方法利用等变网络处理分子的旋转平移对称性,TargetDiff更进一步,将蛋白质结合口袋的三维结构作为条件输入,实现了真正意义上的"靶向三维分子生成"。这种从口袋形状出发、在原子精度上"生长"出配体的能力,是目前任何一维或二维方法难以企及的。


搜索策略:生成只是第一步,优化才是硬仗


分子生成模型的输出是候选分子集合,但"生成"和"找到好分子"之间隔着一条搜索策略的鸿沟。综述将分子优化策略归纳为一个黑箱优化框架,并梳理了若干条并行路径。



遗传算法和进化策略在分子优化中拥有出人意料的竞争力——图基遗传算法(GB-GA)通过图的交叉和突变操作迭代改进分子种群,在多项基准测试中的表现不逊于深度学习方法。贝叶斯优化则在VAE隐空间中找到了舞台:用代理模型预测分子性质,用获取函数权衡"探索陌生区域"和"深耕已知好区域",避免了大量无效的湿实验验证。强化学习将分子生成建模为序列决策过程——REINVENT使用策略梯度算法,将SMILES字符串的逐字符生成看作一个可优化的策略网络,每一步字符选择都受目标性质的奖励信号牵引。


蒙特卡洛树搜索(MCTS)是另一个值得关注的方向。ChemTS等框架将分子构建看作一棵由化学键连接的分支搜索树,用MCTS的上置信界策略在探索和利用之间拿捏分寸。加上虚拟损失和哈希驱动的大规模并行化技术,MCTS能够在合理的时间内搜索远超贪婪采样所能触及的化学空间。


 



 


 


合成可及性:从"纸上分子"到"瓶中化合物"的最后一公里


一个AI生成的分子,即便计算上各项指标完美,如果化学合成路径不可行,本质上仍然只是一个虚拟结构。综述对合成可及性评估的讨论格外务实。经典的SAScore基于分子复杂度和片段贡献估算合成难度,SCScore则通过反应数据库中分子出现的先后顺序推断合成阶段的早晚。近年出现的SYBA和GASA等模型直接学习反应数据预测合成可行性,准确率相比传统打分有了显著提升,但距离替代资深合成化学家的直觉判断仍有差距。


自驱动实验室的出现正在试图将这道"最后一公里"变成闭环——AI负责设计候选分子,自动化合成平台负责制造,高通量测试平台负责验证,验证结果反馈回AI模型更新下一轮的设计方向。综述引用的案例中,Strieth-Kalthoff等人搭建的闭环系统成功发现了新型有机激光发射器,展示了"设计-合成-测试-学习"全自动化循环的可行性。


临床候选物与光伏材料:AI生成分子的实证成绩单


综述中最具说服力的部分或许是那张"AI设计分子实战成绩表"。Insilico Medicine的GENTRL平台在两个月内发现了纳摩尔级DDR1激酶抑制剂(IC50 = 10 nM),从靶点选择到候选分子仅用时46天——传统流程通常需要2-3年。ChemTS设计的TNIK抑制剂已进入临床试验阶段,标志着AI从头设计的分子首次迈入人体试验的门槛。在材料领域,Tan等人通过AI模型设计的非富勒烯受体使有机光伏器件达到了11.8%的光电转换效率,Matsuzawa团队则通过强化学习发现了粘度仅0.61 mPa·s的超低粘度分子——这些数字背后不再是模拟预测,而是真实的器件测试和流变学测量数据。



前瞻:大语言模型将为化学知识整合带来质变


综述在展望部分并不回避当前领域的短板。训练数据偏倚意味着模型倾向于"记住"已知化学空间中人口稠密的区域,而对稀疏的、潜在的优质分子类型缺乏探索动机。复杂性质(如体内药代动力学、长期毒性)的预测仍不可靠——这些性质本身就是多因素耦合的涌现行为,而当前的黑箱预测模型缺乏对底层生物机制的显式建模。


真正令人兴奋的前景在于大语言模型与化学知识的深度融合。当一个LLM不仅读过PubChem的结构数据,还读过全套Organic Syntheses、专利反应库、以及数十年药物化学的结构-活性关系文献时,它生成分子时就不仅仅是在做概率采样,而是在调用积累的化学推理能力。结合量子化学模拟的生成模型、多光谱整合的分子识别、以及更普适的自驱动实验平台,AI驱动的小分子设计正在从"辅助工具"蜕变为"发现伙伴"——从解释已知的化学现象,走向主动设计未知的分子世界。

151
1
0
0
关于作者
相关文章
  • mRNA与蛋白质相关性由什么决定?
    了解详情 
  • 图神经网络+物理启发评分:高通量发现二维平带材料新框架登Scien ...
    了解详情 
  • JACS Au|SynPROTAC模型实现可合成PROTAC分子的理性设计 ...
    中山大学等多单位合作在 JACS Au 发表研究,提出名为 SynPROTAC​ 的生成式AI模型,用于解决PROT ...
    了解详情 
  • World Action Models:具身智能的下一个前沿
    视觉-语言-动作模型(VLA)在具身策略学习中展现了强大的语义泛化能力,然而它们学习的是反应式 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas