驱动mRNA药物设计:LinearDesign与UTR-LM如何实现UTR-CDS协同优化

宇宙微尘
2026-07-08 11:59:22
人工智能
生命科学
论文精读与讲座笔记

中国科学院上海药物研究所郑明月/李叙潼团队在《Journal of Advanced Research》发表综述,系统阐述了人工智能驱动mRNA药物设计从单一元件优化向全长序列协同设计的范式转变。文章指出,传统基于经验规则的设计策略难以平衡翻译效率、稳定性及免疫原性等多重属性。AI模型通过解析大规模平行报告实验(MPRA)数据及预训练语言模型,已在5'/3'UTR活性预测、密码子优化及生成式设计方面取得突破,代表性工具如LinearDesignUTR-LMGEMORNA等显著提升了蛋白表达水平与疫苗免疫原性。然而,数据标准化缺失、模型跨场景泛化能力不足及缺乏端到端生成框架仍是主要瓶颈。未来需构建多模态基础模型与闭环验证体系,以实现面向临床需求的mRNA精准序列工程。




背景


mRNA药物凭借在疫苗、蛋白替代疗法及肿瘤免疫治疗领域的巨大潜力,已成为生物医药的黄金赛道。不同于传统小分子药物,mRNA药物的核心在于一条功能性核酸序列,其在细胞内的递送、翻译、降解等全流程表现,高度依赖于序列本身的特性。长期以来,行业依赖经验规则进行设计,例如在5’UTR引入Kozak序列增强翻译,或通过替换高频密码子提升表达。然而,这些方法往往顾此失彼:局部优化容易忽视全长的长程结构互作,且同一序列在不同细胞环境或修饰体系下的表现差异巨大。更重要的是,UTRCDS并非独立运作,单一模块的极致优化有时会牺牲整体的稳定性或翻译效率。在此背景下,AI特别是深度学习模型,凭借其解析海量序列与功能数据间复杂关系的能力,正推动mRNA设计从经验试错迈向全局理性设计的新时代。



图1 人工智能在mRNA设计中的应用


数据与评价指标


高质量的AI模型离不开坚实的数据底座。目前,虽然公共数据库提供了丰富的天然序列,但受限于注释不完整和实验条件异质性,难以直接用于精准预测。相比之下,大规模并行报告实验(MPRA)通过可控地构建合成文库,已成为训练UTR和密码子模型的主流数据源。但合成数据也存在局限性,各研究间的序列长度、修饰体系差异阻碍了通用基准的形成。在评价指标上,行业已达成共识:mRNA设计绝非单一指标的较量。单纯追求最低自由能(MFE)可能阻碍核糖体扫描,而密码子适应指数(CAI)的高低也不能直接等同于翻译效率。未来的评价体系必须囊括平均核糖体负载、翻译效率、mRNA半衰期,乃至体内的抗体滴度与免疫原性,这是一个典型的多目标优化命题。


UTR设计


作为关键的顺式调控元件,UTR直接决定了翻译起始效率和mRNA稳定性AI在该领域的应用已从预测走向生成。早期的Optimus 5-Prime模型利用卷积神经网络预测5’UTR活性,开启了数据驱动设计的篇章;随后的UTR-LM等预训练语言模型,则通过自监督学习整合序列与结构信息,获得了更通用的调控表征能力。在生成式设计方面,UTRGAN利用生成对抗网络挖掘高活性序列特征,Smart5UTR针对m1Ψ修饰疫苗场景生成特定序列,在小鼠实验中显著提升了抗体滴度;最新的PARADE模型更是利用扩散模型,实现了兼具细胞类型选择性的5’3’UTR组合设计。



图2 mRNA基础模型的预训练和微调框架


尽管成果显著,但现有模型在从合成数据向复杂内源环境迁移时,性能往往会出现大幅衰减,提升跨场景的泛化能力是当务之急。


表1 人工智能辅助mRNA序列设计的代表性计算模型



CDS优化


得益于遗传密码的简并性,同一蛋白对应着海量的同义CDS序列空间,传统的穷举法无从下手。LinearDesign作为该领域的里程碑式工具,虽非深度学习模型,但通过确定性有限自动机与动态规划算法,巧妙地在同义序列空间中联合优化了CAI和结构稳定性(MFE)。实验证明,经其优化的新冠Spike蛋白序列,在稳定性与小鼠免疫原性上均有数量级的提升。另一技术路线则是预训练语言模型,如CodonBERT将密码子作为基本单元进行自监督学习,成功捕捉到了密码子使用的深层语义特征,在表达量和稳定性预测上超越了传统方法。这标志着CDS优化已告别单纯的频率统计,进入了考虑多维因素的精细化阶段。



图3 算法CDS优化和LinearDesign工作流程


协同设计


当前,mRNA设计的最高形态正朝着UTRCDS的协同设计演进。传统的割裂式优化容易破坏分子内部的整体平衡,协同设计旨在寻找全局最优解。



图4 多区域mRNA优化的协同设计策略


LinearDesign2在原有基础上引入了5’UTRCDS的交替优化机制,在保证结构稳定性的同时提升了翻译起始效率。GEMORNA则采用了模块化生成策略,分别构建CDS5’UTR3’UTR候选序列再进行组装筛选,在治疗蛋白表达上展现了惊人的倍数提升。此外,mRNABERT将语言模型直接扩展至全长mRNA层面,通过区分核苷酸级和密码子级Token,构建了强大的全序列表征骨架。尽管目前的协同设计多处于模块化拼接或半端到端阶段,但毫无疑问,这已是下一代mRNA设计平台的必然方向。


总结


这篇综述清晰地描绘了AI辅助mRNA药物设计的技术演进路线图:即从依赖经验规则转向数据驱动预测,从局部元件优化转向多目标全局设计,从单一区域优化迈向全长mRNA协同建模。尽管AI展现了颠覆性的潜力,但要真正跨越临床转化的鸿沟,仍需解决四大核心问题:建立开放标准化的分层数据基准,开发能融合序列、结构与多组学的多模态基础模型,构建涵盖表达强度、安全性及生产可行性的多目标优化体系,以及完善设计-构建-测试-学习的闭环实验验证流程。AI并非要彻底抛弃传统经验,而是要在更广阔的序列空间和更复杂的约束条件下,重塑mRNA药物研发的逻辑,最终推动该领域从筛选可表达序列迈向精准定制目标序列的全新阶段。



参考链接:https://doi.org/10.1016/j.jare.2026.06.013


原文链接:https://mp.weixin.qq.com/s/CMk6aEYtG6ef7eZ_K4o4DQ?scene=1


125
0
0
0
关于作者
相关文章
  • JACS Au|SynPROTAC模型实现可合成PROTAC分子的理性设计 ...
    中山大学等多单位合作在 JACS Au 发表研究,提出名为 SynPROTAC​ 的生成式AI模型,用于解决PROT ...
    了解详情 
  • World Action Models:具身智能的下一个前沿
    视觉-语言-动作模型(VLA)在具身策略学习中展现了强大的语义泛化能力,然而它们学习的是反应式 ...
    了解详情 
  • Janus-QUBO:一种兼具对偶性感知的基于可调量子启发式景观探索化 ...
    一、背景介绍​在广阔的化学空间中发现新分子是一项核心科学挑战,利用深度生成模型(DGMs)进行 ...
    了解详情 
  • Fast LeWorldModel:用动作前缀并行预测,让世界模型动态估计加 ...
    西安交通大学许翔宇团队提出Fast LeWorldModel(Fast-LeWM),针对视觉世界模型在规划阶段的自回 ...
    了解详情 
  • 正式公布 | 2026CAAI-玻色量子计算应用创新基金入选名单 ...
    CAAI-玻色量子计算应用创新基金由中国人工智能学会和玻色量子公司共同发起,2025年首届基金成效 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas