十万个原子,发生一次化学反应,用计算机模拟一遍要多久?
如果用传统的量子化学方法,每往前走一步,理论上要约一千三百万天,大约三万五千六百多年,现实中根本难以执行。
原因一点也不复杂。
模拟是一步一步往前推的,每一步只推进1飞秒,也就是千万亿分之一秒;可每推这么一小步,都得把十万个原子的电子结构和相互作用力重新算一遍。
这,只是一步。
想看完一次完整的反应,得走几十万甚至几百万步。
所以计算化学领域一直有个绕不过去的「不可能三角」:精度、速度、尺度,三样只能挑两样。
量子力学看得准,却跑不远,通常只能算几百上千个原子、皮秒级的片段。
经典力场跑得远,却看不见反应,成键关系一开始就写死了,化学键既不会断,也不会生。
把反应区交给量子力学、其余交给经典力场,结果区域边界本身又成了新的误差来源。
机器学习力场(MLFF)试图兼得,却还要通过长时间动态稳定性的考验。
这个三角,困住了计算化学几十年。
如今,一个中国团队正在把这个「不可能三角」的边界向外推。
分子之心(MoleculeMind)自主研发的反应性机器学习力场QuantaMind,以接近DFT的精度、与经典分子动力学相当的速度,在万原子级体系上稳定模拟了完整的酶催化循环,并在内部产业项目中把尺度推到了十万原子、百纳秒。论文登上《Science Advances》。而十万原子级反应体系的单步模拟耗时,已经从传统方法的千万天量级,压缩到了0.25秒。

一千三百万天到0.25秒,4.5万亿倍的提速,这不是优化,这是范式的跃迁。
为什么「反应性模拟」这么难
要理解QuantaMind的突破有多难,得先知道「反应性分子动力学」到底卡在哪。
常规的分子动力学(MD)能模拟分子结构如何运动——蛋白质怎么折叠、配体怎么结合、构象怎么变化。但它有一个根本局限:原子之间的成键关系是预先固定的,不会自行断裂或形成新的化学键。
这意味着,常规MD能告诉你「分子怎么动」,但无法告诉你「反应怎么发生」。
而酶催化、质子转移、配体结合后的构象变化、药物分子与靶点的共价作用,这些恰恰是研发中最关键的机制问题。
要模拟这些过程,需要反应性分子动力学:让AI在原子尺度上完整「看见」质子转移、化学键断裂与生成,乃至完整的催化循环。
但反应性模拟的难度,比常规MD高出一个数量级。
第一,精度要求极高。化学反应涉及电子结构的变化,只有量子力学方法(如DFT)才能准确描述成键和断键。但DFT的计算成本是O(N³)甚至更高,体系稍大就完全算不动。
第二,时间尺度要求极长。很多化学反应是罕见事件——水的自解离可能要跑几纳秒才出现一次,酶催化的限速步骤可能需要更久。
要捕捉这些事件,模型必须在数十万至数百万时间步的连续推演中保持稳定,不能跑着跑着就「崩了」。
第三,空间尺度要求极大。真实的生物体系包含蛋白质、底物、离子和大量显式水分子,动辄数万乃至十万原子。
精度、时间、空间三个维度同时拉满,这就是反应性分子动力学的「地狱难度」。
机器学习力场(MLFF)的出现,让人们看到了希望:用神经网络拟合量子化学数据,以推理代替每步电子结构计算,理论上可以兼顾精度和速度。
但MLFF有一个致命问题:单个构型上预测准确,不等于能完成可靠的长时间模拟。
准确生成一帧画面,不意味着能连续生成一部符合物理规律的「原子电影」。很多MLFF在短时间模拟中表现不错,但一跑长轨迹就出现能量漂移、构型崩坏,最终只能算小分子、短时间。
QuantaMind要解决的,正是这个「从一帧到一部电影」的问题。
QuantaMind怎么破局
三个关键设计
QuantaMind是分子之心自主研发的反应性机器学习力场框架。
MLFF本身已是国际前沿机构持续投入的方向,Meta、微软、DeepMind等近年来均发布了相关模型与研究。
但QuantaMind的关键,不在于简单堆叠更大的模型,而在于围绕「反应性」重新设计了数据组织和训练方法。
第一,以过渡态为中心的训练数据。
许多MLFF主要从平衡或近平衡构象中学习,模型没见过「过渡态长什么样」,遇到断键成键就露怯。
QuantaMind重点纳入非平衡构型和以过渡态为中心的反应数据,论文用5286个酶催化过渡态构型训练模型,让AI「真正见过」键正在断裂、正在形成的瞬间。
这就像教一个人画画:如果只给他看成品照片,他永远画不出中间的动态过程;但如果给他看每一帧的分解动作,他就能理解运动的规律。
第二,DFT方法分类嵌入。
不同泛函和基组的量子化学数据精度不同,传统做法要么只用一种精度的数据(浪费了其他数据),要么简单混合(模型分不清数据质量)。
QuantaMind将计算设置编码为模型可识别的类别特征,统一纳入训练,让模型能区分并利用不同精度层次的数据。
第三,主动学习式迭代闭环。
面对新体系,QuantaMind先跑出轨迹,识别模型尚未充分覆盖的构型,补充DFT计算继续训练。
每一次新任务不仅解决具体问题,也沉淀可复用的反应数据,持续扩大模型能可靠处理的体系和反应类型,这是一个不断自我强化的数据飞轮。
稳定性也有硬指标:1ns NVE(微正则系综)模拟中,纯水体系的总能量漂移只有10⁻⁵ kcal/mol/atom/ps量级,可稳定支撑数十纳秒的长时间模拟。
这个数字看起来很小,但在MLFF领域,能量漂移控制在这个量级意味着模型真正通过了「长时间动态稳定性」的考验。
硬核验证
四个最震撼的数字
技术设计说得再好,最终要看数据。
QuantaMind的验证沿着体系和过程复杂度逐级展开,这里提炼四个最有冲击力的数字。
数字一:偏差降低87%。
质子转移是生命化学中最基础的反应,质子扩散系数是对模型长时间反应性模拟能力的严苛检验——它不是一次跳跃的速度,而是质子沿氢键网络在水分子之间上万次「接力」后形成的统计结果。
QuantaMind对六种尺寸水体系分别做1纳秒模拟,最大体系24001原子,每条轨迹观察到上万次质子转移。最终预测扩散系数0.87±0.10 Ų/ps,与实验值0.94、0.96高度吻合。相比此前报道的同类MLFF研究(Huo et al., 2023),偏差降低了约87%。
更关键的是,QuantaMind并没有专门训练过水合氢离子,它凭「通用反应能力」自己学会了质子跳跃。
数字二:AI自己算出了水的pH。
水的自电离是一个极其罕见的事件,很难在有限模拟中直接捕捉。
QuantaMind在373K下对9,999原子体系模拟3纳秒,成功捕获多次自发电离事件,预测平均pH 6.34±0.06,与同温度实验值6.13±0.03接近。
模型并未预先写入传统恒pH模拟中的经验酸碱规则,而是从原子级反应动力学中自然涌现出与实验接近的宏观pH。又通过100条独立模拟估算酸碱中和速率,与实验值处于同一数量级,再现了皮秒尺度的微观中和过程。
数字三:pKa 5.81,与NMR实验值5.5接近。
蛋白质残基的质子化状态会影响结构、相互作用和功能,但传统模拟通常需要预先指定这些状态。
QuantaMind将溶菌酶放入真实磷酸盐缓冲液中模拟20纳秒,让组氨酸自己「决定」质子化,缓冲液中磷酸盐物种的电离、水解与酸碱平衡,也被一并真实模拟出来。
估算His15 pKa约5.81,与核磁共振实验值5.5接近。这意味着研究者无需事先假定残基状态,QuantaMind便能模拟其随酸碱环境的动态转换,更真实地描述蛋白质对pH变化的响应。
数字四:17792原子,完整催化循环,原子力分量验证r>0.99。
这是最具标志性的验证。
QuantaMind对由257残基PET水解酶、1个MHET底物和4898个水分子构成的17792原子体系做全原子反应性模拟,所有原子(包括溶剂水)均由QuantaMind统一显式处理,无需QM/MM式区域切分。
在6纳秒轨迹中,完整模拟了酰化、脱酰化和催化位点恢复全过程,观察到亲核进攻、质子转移、酯键断裂和关键中间体形成。
结果与实验高度一致:限速步骤能垒14.5±0.1 kcal/mol,落在实验LCC类酶的14.5–16.5区间。从轨迹中抽取342个构型做独立DFT单点验证,原子力分量Pearson相关系数均超过0.99,AI的「手感」与DFT几乎完全一致。
以前研究者看反应模拟,往往只能看「剧照」:一个个静态构型。这一次,QuantaMind把整部「催化电影」放了出来。
从论文到产业
边界正在被推到哪里
论文验证的是1.8万原子、6纳秒。但QuantaMind的脚步没有停在论文里。
在最新内部测试中,QuantaMind的推理速度达到约2.1×10⁻⁶秒/原子/步(单张A100 80GB),较论文版本提升近一倍,达到当前MLFF的SOTA水平。这意味着什么?
十万原子级反应体系单位时间步的模拟耗时,已从传统方法的千万天量级,压缩至0.25秒。
一千三百万天到0.25秒,这是十三个数量级的跃迁。
模拟体系也从论文的万原子级扩大到十万原子级,模拟时长从纳秒级拓展至百纳秒级。
更大的体系、更长的时间,意味着可以模拟更接近真实研发环境的生物分子体系——更完整的蛋白质复合物、更真实的细胞膜环境、更长时间尺度的动态过程。
更重要的是,QuantaMind已经在产业项目中跑出了实际成果。
在酶工程领域,分子之心已将QuantaMind用于更加复杂的酶催化反应模拟,通过计算和实验的结合,发现了多种复杂催化酶的反应机理,对项目后续的突变选择起到了关键的指导作用。
传统酶工程是「改了再测」,提出大量突变方案,逐个表达纯化测试,多轮实验才能收敛。有了QuantaMind,可以先在计算端比较不同突变如何改变质子转移路径、反应能垒和关键步骤,更有针对性地优选突变位点、缩小实验范围,走向「先算再测」。
在抗体设计领域,一个已经跑通的案例是pH敏感性抗体设计。在一项以延长半衰期为目标的项目中,QuantaMind与自研AI模型协同工作,模拟目标pH区间内关键残基的状态切换,解析其对局部电荷、分子构象及结合力的微观影响。
实验测试显示,得到的候选抗体在pH 6.0下的解离速率达到pH 7.4下的62倍,展现出显著的pH响应特性与成药价值。
62倍,这不是论文里的模拟数字,而是实验测出来的实际成果。
QuantaMind的相关功能已集成到分子之心的AI原生生物「智」造操作系统MoleculeOS(MOS)上,构建连通「生成设计—结果预测—机制模拟」的完整研发工作流。
生成与预测模型高效提出并筛选候选方案,QuantaMind进一步模拟重点候选在特定环境中的动态行为与化学反应,为判断物理化学合理性、理解作用机制和确定优化方向提供依据。
这意味着,QuantaMind不是一个孤立的模拟工具,而是AI研发闭环中的「机制评估引擎」,让每一次设计决策都有可解释、可验证的物理依据。
许锦波
从破解结构到攻坚反应
2016年,许锦波提出的RaptorX-Contact,第一次证明了AI能有效预测蛋白质结构,比AlphaFold1还早了两年。
这一突破,直接推动了AI蛋白质结构预测领域的爆发。但结构预测回答的是「蛋白质长什么样」。
在真实的生物环境中,蛋白质如何催化反应、如何与配体动态结合、如何在不同pH下改变状态,这些「怎么工作」的动态过程,才是决定药物能否起效、酶能否高效催化的关键,也是计算化学几十年来未能补齐的缺口。
在结构预测逐步成熟之后,许锦波把目光投向了这个更难的问题。
2022年,他回国创办分子之心,立志在AI for Science的关键赛道上做出中国自己的底层技术,这不仅是科学探索的需要,更是中国在生物医药底层计算工具上实现自主可控的战略选择。
随着公司的发展,从「预测结构」到「理解机制」的技术缺口逐渐清晰,成为团队攻坚的核心方向。
QuantaMind,就是这一方向上的关键落子。
团队的目标很明确:让DFT精度的反应模拟,从「连超级计算机也难碰」变成「普通实验室也能用」,把计算化学的底层工具掌握在自己手里。
回顾计算化学的发展,每一次精度和尺度的突破,都在推动研发范式的改变。
从只能算小分子的量子化学,到能算蛋白质的经典MD,再到今天能以DFT精度完整模拟酶催化循环的反应性MLFF,计算正在从「辅助验证」走向「前置预测」。
当十万原子的催化过程能在计算机里完整「上演」,当pH响应特性能在实验前被精准预测,当酶突变方案能先算再测而不是盲目试错,化学反应的「黑箱」,正在被AI一点点打开。
一千三百万天到0.25秒,不只是速度的提升,更是可能性的跃迁。
当模拟成本降到这个量级,曾经「算不起」的大型生物体系反应模拟,将成为研发流程中的常规操作。
化学反应的「AI摄影机」,已经开机。而它将要拍下的,是整个生命科学的下一个十年。
文章来自于微信公众号 “新智元”,作者 “新智元”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)