量子自编码器QO-BRA:21参数实现Ca²⁺/Mg²⁺/Zn²⁺金属蛋白的de novo设计

薛定谔了么
2026-08-06 01:04:54
人工智能
生命科学
量子科普

在分子生成领域,一个持续困扰研究者的核心矛盾是模型的表达能力与参数效率之间的张力。当前主流的蛋白质设计模型——无论是基于 CNN 的变分自编码器、ProteinMPNN 还是 RFdiffusion——动辄携带百万甚至千万级别的可训练参数,这意味着它们需要海量的训练数据、昂贵的计算资源,并且在生成具有特定功能约束(如金属离子配位)的分子时,有限的实验数据往往不足以支撑可靠的生成建模。耶鲁大学 Victor Batista 团队于 2026 年 2 月在 JCTC 发表的 QO-BRA(Quantum Operator-Based Real Amplitude Autoencoder)正是对这一困境的量子回应——它仅用 18 到 27 个变分量子参数,就在金属蛋白的 de novo 设计中全面超越了参数规模上千倍于自身的经典 CNN-VAE 模型。



方法架构:三大技术支柱


QO-BRA 的核心架构建立在三个互为支撑的技术决策之上。第一个决策是实振幅编码——模型采用 Qiskit 的 RealAmplitudes 量子电路作为编码器的基础结构。这一选择并非出于简洁性的追求,而是有着深刻的物理与计算考量:将量子态的虚部相位约束为零,使得可访问的酉变换空间被显著收窄,这在小样本训练场景中反而成为了优势——它抑制了过参数化带来的过拟合风险,同时也天然适配当前 NISQ 设备的噪声特性。RealAmplitudes 电路的另一个实用优势是它仅包含 RY 旋转门和 CNOT 纠缠门,电路深度可控,足以在当前的量子硬件或经典模拟器上高效运行。


第二个架构决策是伴随解码器设计。在经典的变分自编码器框架中,编码器和解码器是两套独立的神经网络,各自拥有庞大的参数集。QO-BRA 则取了一条截然不同的路径:解码器被严格定义为编码器电路的逆(伴随)操作。这一约束背后的信息论直觉是优雅的——如果编码过程将离散的分子序列映射到连续的隐变量空间,那么该映射的逆过程应当能够从隐变量中重建分子序列,而无需引入额外的自由参数。伴随解码器将 QO-BRA 的变分参数数量从编码器-解码器双重优化的需求中解放出来,全部可训练参数集中在编码器一侧,使得模型在仅有约 6000 条序列的训练集上也不会陷入参数欠定的困境。


第三个也是最具量子特色的技术要素是 SWAP 测试损失函数。经典 VAE 使用 KL 散度和交叉熵等经典距离度量来定义重构误差和正则化损失,而 QO-BRA 则用 SWAP 测试量子电路来直接估计输入量子态与重构量子态之间的保真度。这一策略的实际收益是多方面的:它避免了全量子态层析的指数级测量开销,将重构质量的评估压缩为量子比特间 SWAP 操作的测量统计;同时,保真度作为量子信息理论中最自然的相似性度量,在振幅空间中刻画重构误差时比经典的距离函数更加忠实于量子编码的本质。作者将重构保真度和隐空间正则化统一纳入一个基于 SWAP 测试的联合损失函数中,通过经典优化器对变分电路参数进行梯度下降。


训练配置与超参数选择


训练过程的具体配置也值得关注。电路重复层数 r 被系统性地在 1 到 3 之间扫描,发现 r=1 时模型欠拟合(表达能力不足),r=3 时收益递减(增加的计算开销不再带来显著的性能提升),r=2 是最优折中。量子比特数 Nq 在 6 到 9 之间进行了优化,Nq=9 表现最佳(可编码最长 511 个残基的蛋白质序列)。训练在 48 核 x86_64 Intel CPU 上完成,r=2 配置下的训练时间约为 5.9 小时——远低于训练一个可比规模的经典深度学习模型所需的时间。隐变量先验被设为零均值的多变量高斯分布,标准差 σ = (1.5 × 2^(Nq/2))⁻¹ 的选取平衡了隐空间的覆盖范围与采样密度。


应用场景:金属蛋白 de novo 设计


QO-BRA 的应用场景选在了 de novo 金属蛋白设计——一个在计算蛋白质设计中具有重要生物学和药学意义的难题。Ca²⁺、Mg²⁺ 和 Zn²⁺ 是生物体系中最关键的三种二价金属离子,它们分别参与信号传导、酶催化和结构稳定等核心生物学过程,设计能够高选择性、高亲和力结合特定金属离子的蛋白质对于开发金属酶、生物传感器和金属离子药物递送系统具有重要意义。金属结合位点对氨基酸的化学特性(电荷、侧链配位原子种类和空间排布)有极为严苛的约束,这使得训练数据天然稀缺——自然界中已知的结合特定金属离子的蛋白序列数量远少于通用蛋白序列库。


生成结果与性能对比


研究团队使用 NUVR 四维评估体系来量化生成质量:新颖性衡量生成序列是否不同于训练集中的任何序列;唯一性检测生成样本之间的重复率;有效性判断生成序列中金属结合残基的种类和空间分布是否符合目标金属离子的配位化学规律;重构精度则验证编码器-解码器管线能否无损地往返映射。在最优配置下,Ca²⁺ 结合蛋白的 NUVR 综合得分为 0.79(7 量子比特,21 参数),Mg²⁺ 为 0.81(7 量子比特,21 参数),Zn²⁺ 在 9 量子比特配置下表现最佳。三项任务的重构精度均为完美的 1.00——无论是训练集还是测试集——这意味着 QO-BRA 的伴随架构真正实现了可逆编码。


作为对比基线,研究团队训练了一个参数超过 940 万的经典 CNN-VAE 模型。该经典模型的轨迹令人印象深刻地反向证实了 QO-BRA 的优越性:CNN-VAE 的 NUVR 综合得分仅为 0.036 到 0.062,重构精度在 0.048 到 0.11 之间,意味着经典模型根本无法可靠地从隐变量中重建金属蛋白序列。这一对比揭示的不仅是"量子比经典更好"这样一个过于简化的叙事,而是一个更深层的方法论洞见:在训练数据极度稀缺的约束下,庞大的经典参数空间实际上成为了一种负担——模型缺乏足够的数据来有效约束如此多的自由度,从而导致泛化崩溃。QO-BRA 的极简参数化——将可优化的自由度从百万级压缩到二十个左右——反而在这种数据贫乏场景中获得了结构性优势。



下游结构验证:从序列到三维结构


QO-BRA 生成的金属蛋白序列并未停留在一维的氨基酸字符串层面。研究团队设计了一套模块化的下游验证流程:首先使用 Chai-1 进行从头三维结构预测,随后在 OpenMM 8 中以 AMBER14 力场和 TIP3P 显式水模型进行溶剂化和分子动力学平衡模拟,通过 MDTraj 分析 RMSD 评估结构稳定性,最后基于金属离子特异性的配位距离截断值来评价结合位点的几何合理性。结果表明,模型生成的序列不仅在一级结构水平上呈现正确的金属结合 motif,而且在预测的三维结构中,配位侧链的空间排布也符合目标金属离子的配位化学规律——例如 Zn²⁺ 倾向于 Cys/His 四配位四面体几何,Ca²⁺ 偏好 Asp/Glu 羧酸氧的多齿配位,Mg²⁺ 则呈现更严格的八面体配位偏好。二级结构分析显示生成的蛋白质具有与天然金属蛋白一致的折叠特征:α-螺旋占比 30%–45%,β-折叠 20%–30%,环区和转角 25%–40%。


总结与讨论


这篇论文的深层意义或许超越了金属蛋白设计这一具体案例。从方法论演进的角度审视,QO-BRA 代表了一种与当前"大力出奇迹"的 AI 范式截然不同的设计哲学。当整个领域的主流趋势是不断扩大模型规模和训练数据量时,Batista 团队反其道而行,证明了在结构化的先验物理约束下,极简的量子参数化完全可以匹敌甚至超越海量参数的经典模型——前提是你能找到正确的约束形式。RealAmplitudes 电路提供的酉变换子空间、伴随解码器施加的可逆性约束、SWAP 测试赋予的量子原生损失度量,这三者共同构成了一套高度自洽的生成建模框架。


作者在文中明确指出,QO-BRA 的定位并非取代 ProteinMPNN 或 RFdiffusion 等以大规模预训练为基础的经典蛋白质设计模型,而是作为一种量子增强的补充工具——在数据稀缺、功能约束严苛、需要强物理先验的场景中发挥独特优势。论文标题中的"A Quantum Operator-Based Autoencoder"而非"A Quantum Autoencoder"本身就传递了这一审慎的姿态:重点不在于宣布量子优于经典,而在于探索基于量子算符的变分表示是否能为分子生成提供一种新的信息编码范式。QO-BRA 的实验结果对这一假设给出了相当令人信服的肯定回答。


对于关注量子计算在生命科学中实际应用的研究者来说,QO-BRA 提供了一个极具参考价值的范例。它在技术上务实(全经典模拟、无需量子硬件)、在参数效率上极端(18–27 个参数)、在评估上严谨(四维 NUVR 指标加下游结构验证),展示了在当前 NISQ 时代,量子启发的变分算法如何在实际生物化学问题中产生超越经典基线的结果——尽管量子优势的正式证明仍然遥远,但在特定问题约束下展示"量子启发的方法学优势"本身就具有重要的探索价值。这篇 JCTC 论文在 15 页的篇幅内为量子分子生成这一新兴方向建立了一套完整的技术框架和评估基准,值得从事量子机器学习、计算蛋白质设计和分子生成的研究者仔细研读。



原文链接:https://pubs.acs.org/doi/10.1021/acs.jctc.5c01704


50
0
0
0
关于作者
相关文章
  • 量子计算×AI×驱动量子动力学:三支柱协同加速量子材料发现 ...
    下一代量子材料的发现正在经历一场深刻的方法论变革。传统的材料研发依赖直觉、经验积累和大量试 ...
    了解详情 
  • Nat Protoc|浙江大学/澳门理工大学等:AI驱动结构虚拟筛选平台C ...
    2026年6月,浙江大学、澳门理工大学等团队在《Nature Protocols》发表研究,推出AI驱动的结构虚 ...
    了解详情 
  • 分子动力学+MM/GBSA:AI药物发现的大规模结合自由能数据引擎 ...
    了解详情 
  • 量子-经典异构计算驱动的生物分子模拟研究进展:从千原子到万原 ...
    本文介绍2026年5月克利夫兰诊所、日本理化学研究所与IBM团队的量子计算生物医药应用突破。研究依 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas