2026年8月31日,华东师范大学药学院李诗良/李洪林团队在《JACS Au》期刊发表题为 “MacroTox: A Macroscopic Graph Topology-Based Multimodal Learning Framework for Robust Molecular Toxicity Prediction” 的研究论文。该研究针对药物诱导骨毒性等数据稀缺的复杂毒性终点预测难题,提出宏观拓扑驱动的多模态深度学习框架MacroTox,通过动态构建批内药物相似性图与拓扑感知协同优化机制,有效缓解了传统模型表征碎片化的困境。研究表明该模型在骨毒性数据集上实现AUC 0.93的优异性能,有效平衡预测敏感性与特异性,大幅降低毒性漏报风险,在MoleculeNet数据集上开展的基准测试,进一步验证了模型良好的泛化迁移能力。此外,多水平特征归因分析证明MacroTox能够精准定位特异性毒性基团、解析复杂的活性悬崖现象,揭示符合化学直觉的构效关系。总体而言,MacroTox为早期药物研发提供了一种可靠、泛化性强且具备可解释性的虚拟筛选工具。

研究背景
计算毒理学已成为早期药物研发安全评估的核心技术,在急性肝、心脏等器官毒性预测中进展显著,但药物诱导骨毒性等起病隐匿、进展缓慢的复杂慢性终点存在数据稀缺问题,且常常被忽视。传统监督学习模型仅聚焦分子内特征融合,忽略化学空间的宏观分子间相似拓扑,导致潜在表征碎片化、泛化能力不足、假阴性率偏高,难以满足实际药物筛选的安全评估需求。
研究内容
1. 数据来源
本研究在经过严格筛选的骨毒性数据集上对模型进行评估。该数据集包含563个毒性化合物(源自FAERS、SIDER和CTD)与600个无毒对照化合物(从DrugBank随机抽取,无骨骼不良事件记录)。为验证模型的泛化能力,研究还在MoleculeNet基准下涵盖分类与回归任务的7个不同领域数据集(包括BBBP、Tox21、BACE、SIDER、ESOL、FreeSolv和Lipophilicity)上进行了广泛测试。所有数据集均按8:1:1比例随机划分为训练、验证和测试集,以确保评估的严谨性。
2. 模型结构
(1). 分子表征:从规范的SMILES字符串中提取四种互补的化学模态:经XGBoost筛选的100维Mordred物理化学描述符、167维稀疏MACCS结构指纹、MolFormer编码的768维上下文序列表示,以及经图同构网络 (GIN) 处理的伪3D分子图。这些异构特征被投影到统一的潜在空间并拼接成综合的多模态特征谱。
(2). 核心架构:在多模态融合的基础上,该框架引入了动态相似性图模块 (DSGM)。在每个训练微批次中,模型动态计算化合物特征向量之间的余弦相似度,通过阈值筛选构建宏观的药物-药物相似性拓扑矩阵,并应用随机边丢弃 (DropEdge) 机制以增强训练鲁棒性。随后,利用图注意力网络 (GAT) 选择性地聚合相似药物的特征,实现潜在特征的深度交互与细化。
(3). 模型训练:整个架构在复合目标函数的指导下进行端到端优化。该目标函数结合了用于建立准确毒性预测决策边界的任务特定损失(分类任务使用BCE,回归任务使用MSE),以及作为结构正则化项的拓扑感知边损失 (Edge Loss)。边损失在潜在空间中强制推开不同类别的样本,同时保留同类样本内有意义的化学多样性。

图1 MacroTox框架
研究结果
1. 稳健的预测性能与漏报风险控制
在骨毒性预测任务中,MacroTox展现出极具竞争力的性能 (AUC: 0.93, ACC: 0.87),显著优于BTP-MFFGNN等基准模型。更重要的是,它缓解了现有模型的多数类偏差,实现了更优的敏感性 (SEN: 0.88) 和特异性 (SPE: 0.86) 平衡,大幅降低了毒理学筛选中极具临床意义的漏报风险。

图2 MacroTox在骨毒性数据集上的综合性能对比与稳定性分析
2. 消融实验研究
广泛的消融实验表明,动态相似性图与拓扑感知边损失的协同结合不仅实现了SEN与SPE的高度平衡,还作为正则化器大幅降低了预测方差(图2)。t-SNE与KDE可视化证实,相较于单一模态的特征纠缠,全面融合多维特征和宏观图表示能将样本自然分层为边界清晰、高度可分离的毒性聚类。

图3 渐进式模态融合下的隐表征与预测分布演变
3. 跨领域泛化能力验证
在MoleculeNet基准测试中,MacroTox无需针对特定任务大幅调整超参数,便在BBBP、SIDER、ESOL等数据集上取得卓越表现。这可归功于其宏观相似性图机制促进了深度的批次内特征对齐并放大了类间可分离性,证明了其在数据稀缺场景下的高可靠性与可迁移性。

图4 MacroTox和八个基线模型在MoleculeNet数据集上的预测性能
4. 可解释性分析
多层次特征归因分析证实模型捕捉到了真实的毒理学SAR机制。MACCS指纹SHAP分析成功区分了毒效团(如伯胺、七元环增加毒性概率)与保护性基团(如末端溴化物、亚胺连接基团)。原子级分子热力图精准聚焦关键子结构,成功分辨出结构高度相似但毒性相反的“活性悬崖”化合物对。

图5 MacroTox的机制可解释性分析
总结
本研究针对数据稀缺的复杂毒性预测痛点,提出了基于宏观图拓扑的多模态学习新范式 MacroTox,该计算框架不仅在药物诱导的骨毒性预测中实现了高精度和更优的敏感性-特异性平衡,还展现出稳健的跨任务鲁棒泛化能力与深层次的化学可解释性。它避免了对表面数据模式的死记硬背,能够精准识别关键毒效团并解析复杂的活性悬崖现象,为早期药物研发的毒性虚拟筛选提供了可靠工具,也可为其他数据受限的分子性质预测任务提供方法借鉴。
论文第一作者为华东师范大学博士研究生黄鹤,通讯作者为华东师范大学药学院李洪林教授与李诗良研究员。该工作得到国家自然科学基金 (82425104、82622110)、国家重点研发计划 (2022YFC3400504) 及上海市科技项目 (26JS2830100、26JS2830102) 及中央高校基本科研业务费的资助。
参考文献 :He Huang, Qinyi Wang, Manzhan Zhang. et al. MacroTox: A Macroscopic Graph Topology-Based Multimodal Learning Framework for Robust Molecular Toxicity Prediction. JACS Au. 2026.
原文链接:https://mp.weixin.qq.com/s/tdcrGPp1L6osx9eX53zbKA |