中国科学院上海药物研究所郑明月/李叙潼团队在《Journal of Advanced Research》发表综述,系统阐述了人工智能驱动mRNA药物设计从单一元件优化向全长序列协同设计的范式转变。文章指出,传统基于经验规则的设计策略难以平衡翻译效率、稳定性及免疫原性等多重属性。AI模型通过解析大规模平行报告实验(MPRA)数据及预训练语言模型,已在5'/3'UTR活性预测、密码子优化及生成式设计方面取得突破,代表性工具如LinearDesign、UTR-LM及GEMORNA等显著提升了蛋白表达水平与疫苗免疫原性。然而,数据标准化缺失、模型跨场景泛化能力不足及缺乏端到端生成框架仍是主要瓶颈。未来需构建多模态基础模型与闭环验证体系,以实现面向临床需求的mRNA精准序列工程。

背景
mRNA药物凭借在疫苗、蛋白替代疗法及肿瘤免疫治疗领域的巨大潜力,已成为生物医药的黄金赛道。不同于传统小分子药物,mRNA药物的核心在于一条功能性核酸序列,其在细胞内的递送、翻译、降解等全流程表现,高度依赖于序列本身的特性。长期以来,行业依赖经验规则进行设计,例如在5’UTR引入Kozak序列增强翻译,或通过替换高频密码子提升表达。然而,这些方法往往顾此失彼:局部优化容易忽视全长的长程结构互作,且同一序列在不同细胞环境或修饰体系下的表现差异巨大。更重要的是,UTR与CDS并非独立运作,单一模块的极致优化有时会牺牲整体的稳定性或翻译效率。在此背景下,AI特别是深度学习模型,凭借其解析海量序列与功能数据间复杂关系的能力,正推动mRNA设计从“经验试错”迈向“全局理性设计”的新时代。

图1 人工智能在mRNA设计中的应用
数据与评价指标
高质量的AI模型离不开坚实的数据底座。目前,虽然公共数据库提供了丰富的天然序列,但受限于注释不完整和实验条件异质性,难以直接用于精准预测。相比之下,大规模并行报告实验(MPRA)通过可控地构建合成文库,已成为训练UTR和密码子模型的主流数据源。但合成数据也存在局限性,各研究间的序列长度、修饰体系差异阻碍了通用基准的形成。在评价指标上,行业已达成共识:mRNA设计绝非单一指标的较量。单纯追求最低自由能(MFE)可能阻碍核糖体扫描,而密码子适应指数(CAI)的高低也不能直接等同于翻译效率。未来的评价体系必须囊括平均核糖体负载、翻译效率、mRNA半衰期,乃至体内的抗体滴度与免疫原性,这是一个典型的多目标优化命题。
UTR设计
作为关键的顺式调控元件,UTR直接决定了翻译起始效率和mRNA稳定性。AI在该领域的应用已从预测走向生成。早期的Optimus 5-Prime模型利用卷积神经网络预测5’UTR活性,开启了数据驱动设计的篇章;随后的UTR-LM等预训练语言模型,则通过自监督学习整合序列与结构信息,获得了更通用的调控表征能力。在生成式设计方面,UTRGAN利用生成对抗网络挖掘高活性序列特征,Smart5UTR针对m1Ψ修饰疫苗场景生成特定序列,在小鼠实验中显著提升了抗体滴度;最新的PARADE模型更是利用扩散模型,实现了兼具细胞类型选择性的5’和3’UTR组合设计。

图2 mRNA基础模型的预训练和微调框架
尽管成果显著,但现有模型在从合成数据向复杂内源环境迁移时,性能往往会出现大幅衰减,提升跨场景的泛化能力是当务之急。
表1 人工智能辅助mRNA序列设计的代表性计算模型

CDS优化
得益于遗传密码的简并性,同一蛋白对应着海量的同义CDS序列空间,传统的穷举法无从下手。LinearDesign作为该领域的里程碑式工具,虽非深度学习模型,但通过确定性有限自动机与动态规划算法,巧妙地在同义序列空间中联合优化了CAI和结构稳定性(MFE)。实验证明,经其优化的新冠Spike蛋白序列,在稳定性与小鼠免疫原性上均有数量级的提升。另一技术路线则是预训练语言模型,如CodonBERT将密码子作为基本单元进行自监督学习,成功捕捉到了密码子使用的深层语义特征,在表达量和稳定性预测上超越了传统方法。这标志着CDS优化已告别单纯的频率统计,进入了考虑多维因素的精细化阶段。

图3 算法CDS优化和LinearDesign工作流程
协同设计
当前,mRNA设计的最高形态正朝着UTR与CDS的协同设计演进。传统的割裂式优化容易破坏分子内部的整体平衡,协同设计旨在寻找全局最优解。

图4 多区域mRNA优化的协同设计策略
LinearDesign2在原有基础上引入了5’UTR与CDS的交替优化机制,在保证结构稳定性的同时提升了翻译起始效率。GEMORNA则采用了模块化生成策略,分别构建CDS、5’UTR和3’UTR候选序列再进行组装筛选,在治疗蛋白表达上展现了惊人的倍数提升。此外,mRNABERT将语言模型直接扩展至全长mRNA层面,通过区分核苷酸级和密码子级Token,构建了强大的全序列表征骨架。尽管目前的协同设计多处于模块化拼接或半端到端阶段,但毫无疑问,这已是下一代mRNA设计平台的必然方向。
总结
这篇综述清晰地描绘了AI辅助mRNA药物设计的技术演进路线图:即从依赖经验规则转向数据驱动预测,从局部元件优化转向多目标全局设计,从单一区域优化迈向全长mRNA协同建模。尽管AI展现了颠覆性的潜力,但要真正跨越临床转化的鸿沟,仍需解决四大核心问题:建立开放标准化的分层数据基准,开发能融合序列、结构与多组学的多模态基础模型,构建涵盖表达强度、安全性及生产可行性的多目标优化体系,以及完善“设计-构建-测试-学习”的闭环实验验证流程。AI并非要彻底抛弃传统经验,而是要在更广阔的序列空间和更复杂的约束条件下,重塑mRNA药物研发的逻辑,最终推动该领域从“筛选可表达序列”迈向“精准定制目标序列”的全新阶段。
参考链接:https://doi.org/10.1016/j.jare.2026.06.013
原文链接:https://mp.weixin.qq.com/s/CMk6aEYtG6ef7eZ_K4o4DQ?scene=1
|