计算化学 · AI for Science力场这道坎:Uni-FEP 在 FEP 江湖的起家史
一个造了神经网络力场的公司,主力 FEP 产品为何仍用经典力场?深势科技 Uni-FEP 的起家故事。
自由能微扰(FEP)这门手艺,原理早在 1954 年就被 Zwanzig 写定了。半个多世纪过去,采样方法精进了,估计器升级了,算力翻了不知多少倍,可有一块软肋一直没被根治–力场。
力场,就是一套描述原子之间如何相互作用的规则。两个原子靠多近会排斥、拉多远会吸引、键角怎么弯、电荷怎么分布,全靠力场里的参数说了算。自由能微扰算得准不准,采样和估计器当然重要,但天花板多半卡在力场身上:力场把分子间的相互作用描述错了,后面算得再精细,也是在错的势能面上打转。
过去几十年,FEP 江湖用的几乎都是”经典力场”–OPLS、AMBER、CHARMM、GAFF、OpenFF。它们是一套套手工打磨的参数集,靠物理直觉和实验数据拟合而成,对研究得透的化学空间挺好使,可一旦碰上结构新颖的分子、复杂的化学环境,就开始力不从心。参数要靠人去设,量子力学计算又贵得吓人,新分子常常落在力场的舒适区之外。
力场,是横在所有 FEP 玩家面前的一道坎。翻这道坎的姿势各不相同:有人几十年如一日迭代经典力场(Schrödinger 的 OPLS),有人用机器学习给经典力场重新调参(字节的 ByteFF),还有人攥着一把号称要重写力场的神经网络利刃,真到了主力产品上阵的时候,用的却还是那套经典力场。
最后这一家,叫深势科技,那个 FEP 产品叫 Uni-FEP。2026 年,当一篇论文把十几家 FEP 工具拉到同一张表上同台比拼,这道力场坎上的众生相,才第一次看得这么清楚。一、深势的来路:从一条方程到独角兽
2026 年的深势科技,给自己挂的招牌是”全球 AI for Science 的开拓者和引领者”。这话听着像口号,但往回倒几年,它的来路是实打实的学术硬通货。
故事得从 2017 年 7 月说起。那个月,arXiv 上接连挂出两篇论文(后分别于 2018 年正式发表于 Communications in Computational Physics 和 Physical Review Letters),作者名单几乎一样:Linfeng Zhang、Jiequn Han、Han Wang,加上普林斯顿的 Roberto Car 和 Weinan E。第一篇叫《Deep Potential:势能面的一种通用表示》,第二篇叫《Deep Potential 分子动力学:一个兼具量子力学精度的可扩展模型》。
这两篇论文做了一件挺激进的事:用深度神经网络去拟合势能面。把量子力学算出来的能量和力当作训练数据,喂给一个精心设计的网络,让它学会预测任意原子构型的能量。网络结构天然尊重物理对称性,没有任何拼凑的经验函数。训练好之后,跑分子动力学的速度比第一性原理快好几个数量级,精度却几乎不掉。
这就是 Deep Potential,以及它的实现 DeePMD。它打开了一扇门:也许可以不再死磕手工力场,转而让神经网络从量子数据里直接学出原子间的相互作用。在分子模拟圈子里,这是一条全新的路。
2018 年,深势科技(DP Technology)成立,总部北京,在上海、深圳、宜宾等地设了办公室和研发中心。核心团队就来自这几位论文作者:鄂维南是中国科学院院士,挂首席科学顾问;张林峰是创始人兼首席科学家;孙伟杰是创始人兼 CEO。张林峰和孙伟杰都出身北大元培学院,是两位 90 后。公司的底子,正是 Deep Potential 这套技术,使命写在明面上–“加速科学发现,释放科学价值”,要做”AI 科学家”和自主科学发现的智能系统。
和很多纯商业的科学软件公司不同,深势走的是”核心引擎开源、集成平台商业化”的路子。2017 年底,DeePMD-kit 的代码就开源到了 GitHub 的 DeepModeling 组织下,协议 LGPL,如今攒下近两千颗星。这套打法后来在药物设计侧反复上演:从公司 GitHub 组织 dptech-corp 的时间线能看出一条清晰的开源节拍–2021 年 9 月开源 Uni-GBSA,2022 年 7 月开源 Uni-Fold(四百多颗星,是深势最火的仓库之一),2023 年 5 月开源 Uni-Dock,同年 8 月开源 Uni-pKa。底层引擎一个个抛给社区,深势再把它们封装成面向具体场景的商业平台。
这套打法分化出几条产品线。以”深势·宇知®科学发现智能引擎”为基座,深势搭了一系列”读文献、做计算、做实验”的工具和科学智能体,构成它所谓的 Science as a Service 矩阵:Bohrium® 玻尔空间站是通用计算平台,Piloteye® 做电池设计,RiDYMO® 攻难成药靶标与高质量 Hit 发现,外加勒贝格智算、SciMaster 科学智能体。面向药物发现的,是 Hermite® 药物计算平台。深势不 only 卖软件,自己也下场做药–2024 年初它提名了一款潜在”Best-in-Class”的口服 Kv1.3 抑制剂,用于炎症性肠病和特应性皮炎等免疫疾病。能把自家的计算平台拿来喂自己的管线,是平台型公司常见的话语权构建方式。
资本也买账。2024 年 12 月 24 日,深势宣布完成总额超 8 亿元人民币的 C 轮融资,投资人名单拉了一长串:达晨财智、京国瑞基金、北京市人工智能产业投资基金、北京市医药健康产业投资基金、联想创投、元禾璞华。再往前一轮,它拿过超 7 亿人民币,众源资本、和玉资本、正心谷资本等入局。几轮加起来,累计融资已达数十亿人民币,正式跻身独角兽俱乐部。这个体量,在 AI for Science 这个还在找商业闭环的赛道里,相当扎眼。Uni-FEP,就长在 Hermite 这棵树上。二、Hermite 与 Uni- 家族
Hermite® 的定位,是”基于人工智能、物理建模和高性能计算的新一代药物计算平台”。它以网页应用的形式,串起一条药物设计的流水线:从靶点结构解析、预测与精修,到苗头化合物筛选,再到先导化合物优化和性质预测,外加蛋白、抗体设计。
“Uni-“是深势的命名惯例,几乎每个药物设计环节都有一个 Uni- 开头的模块顶着:Uni-Fold 做蛋白结构预测,Uni-Dock 做分子对接,Uni-GBSA 做 MM-GB/PBSA,Uni-VSW 做虚拟筛选,Uni-Mol 做相似分子搜索,Uni-IFD 做诱导契合对接,Uni-Aquasite 算结合水自由能,Uni-QSAR 做定量构效关系,Uni-pKa 算解离常数。自由能微扰这一环,由 Uni-FEP 负责。深势官网的关键词里,”自由能微扰”“FEP”“先导化合物优化”写得明明白白–FEP 是它药物优化环节的核心能力之一。
这套 Uni- 家族的铺开节奏,和开源时间线基本对得上:先做结构(Uni-Fold)、再做对接(Uni-Dock)、再做打分近似(Uni-GBSA),最后才把最重也最难的自由能微扰(Uni-FEP)摆上来。这个顺序本身有逻辑–FEP 是计算成本最高、对上游结构质量最敏感的一环,得等前面的基建稳了才好上。
Uni-FEP 提供两种计算模式:相对结合自由能(RBFE)和绝对结合自由能(ABFE)。前者在相似分子之间排相对座次,是先导化合物优化阶段最常用的;后者直接算单个配体和蛋白的结合强度,不必依赖参照物,难度更高、适用场景更前沿。两种模式都做,可见 Uni-FEP 想覆盖从”排序”到”绝对预测”的完整链条。
深势给 Uni-FEP 总结了一套叫 F.A.I.R. 的设计理念:Fast(快,核心代码针对 GPU 优化,叠加 REST2 增强采样)、Accessible(易用,图形界面)、Intuitive(直观,3D 结构查看、任务监控、结果分析的可视化)、Robust(稳健,官方宣称结合自由能误差可控制在化学精度 1 kcal/mol 内,能处理骨架跃迁和大环变化)。这套话术听着像营销,但背后对应的,是一个商业产品要想在工业流水线上立足,必须同时解决的”速度、门槛、可信”三件事。
光说理念不够,深势也给得出具体案例。2024 年 7 月,官网发了一条”靶点探月计划”动态,讲 Uni-FEP 准确评估了 CDK4-Cyclin D3 抑制剂的亲和力,助力肿瘤治疗项目。CDK4 是个公认的难啃靶点,抑制剂结合模式复杂,能在这上面把 FEP 跑准并拿来说事,说明 Uni-FEP 至少在自家例子里是站得住的。三、Uni-FEP 的武功:经典力场的底子
把营销词剥掉,看 Uni-FEP 真正跑的是什么,得翻它的技术文档。
Hermite 官方文档把 Uni-FEP 的家底交代得很清楚:模拟引擎是 GROMACS-2021.1;蛋白力场支持 AMBER99SB 和 AMBER99SB-ILDN;配体力场支持 GAFF2 和 GAFF;增强采样用 REST2(Replica Exchange with Solute Tempering);λ 窗口固定 16 个中间态,范德华和静电同时变换;静电用 PME 处理。
这套配置,熟悉 FEP 的人一眼就能看出门道。GROMACS 是欧洲学术界的主力 MD 引擎,AMBER/GAFF 是学术界事实标准的经典力场,REST2 是社区里成熟的增强采样方法。Uni-FEP 真正上阵用的,是一套和大多数同行一样的、地地道道的经典力场底盘。它和 FEP+ 的差别(FEP+ 用 OPLS、Desmond)、和 OpenFE 的差别(OpenFE 用 OpenFF、OpenMM),都在”经典力场”这个大框架内部,属于参数和引擎的选择,算不上范式上的分野。
Uni-FEP 真正下功夫的地方,在工程化和规模化。官方宣称,核心代码针对 GPU 高度优化后,8 小时能跑完 1000 个以上的 FEP 计算;客户累计使用超过 20 万次 Uni-FEP 任务;Hermite 平台已在 50 多条药物管线项目中落地,超六成国内头部企业选择使用。这些数字无法逐一独立核实,但它们指向一个清晰的策略:Uni-FEP 不靠力场上的奇招取胜,靠的是把一套成熟方法,在 GPU 上跑得又快又稳,再借着 Hermite 平台的一站式集成,把 FEP 塞进药物化学家点鼠标就能用的流水线里。
最能说明这份”规模化”决心的,是一个公开的基准仓库。2025 年 2 月,深势在 GitHub 上放了 dptech-corp/Uni-FEP-Benchmarks,Apache-2.0 协议,专门用来系统评估 Uni-FEP。配套的 ChemRxiv 预印本里写得明白:这套基准从 ChEMBL 数据库出发,筛出约 1000 个适合做 FEP 的蛋白-配体体系、约 4 万个配体,覆盖骨架跃迁、电荷变化等真实药化场景,规模远超此前任何公开 FEP 基准。仓库至今仍在更新(2026 年 5 月还有提交,攒下五十多颗星),每个体系的 RMSE、R²、Kendall’s tau 都摆出来(一个让 FEP "不再只跑理想题"的真实世界基准:Uni-FEP Benchmarks 是怎么炼成的?)。
得诚实地说一句:Uni-FEP 至今没有一篇经过同行评审、专门讲述自己方法学的学术论文。它的验证,主要靠这个自建的公开基准仓库和一篇预印本,靠官方宣称的精度和规模。和 Flare FEP 有一篇 JCIM 方法学论文(2020 年)、OpenFE 有一篇十多家机构协作评估(2025 年 ChemRxiv 预印本,2026 年正式发表于 JCIM(15 家药企联合“大考”:开源自由能计算 OpenFE 能否挑战商业软件?)相比,Uni-FEP 在”同行评审”这一栏上,暂时是空白的。这是它成绩单上一处绕不开的留白。四、力场这道坎:三条路,一道坎
讲到这,故事才到了最有意思的地方。
前面说过,深势的根,是 Deep Potential,是用神经网络去拟合势能面、替代手工力场的那套技术。这些年深势在力场上没少下注,走的是一条名为 DPA 的谱系。DPA(全称 Deep Potential with Attention,但后来也被用来涵盖更广泛的模型家族),野心写在名字里–一套”通用”的势函数。
2022 年 8 月,深势团队在 arXiv 放出 DPA-1(后于 2024 年正式发表于 npj Computational Materials),把注意力机制引进 Deep Potential。论文讲得很直白:随着高质量电子结构数据越攒越多,要是一个模型能在所有可用数据上预训练、再花很小代价微调到下游任务,整个分子模拟领域就会进入新阶段。DPA-1 就是冲着这个去的,用注意力机制高效表示原子体系的构象和化学空间。
2024 年,深势团队在 Nature 旗下的 npj Computational Materials 发表 DPA-2,正式提出”大原子模型”(Large Atomic Model)的概念,对标大语言模型的预训练-微调范式。DPA-2 拿 18 个数据集、覆盖 73 种化学元素做多任务预训练,相比单任务预训练,零样本泛化的误差砍掉一半还多,下游微调的数据需求能降一到两个数量级。预训练数据里已经把药物分子纳入版图,为后来 DPA-3 在 FEP 上验证埋下了伏笔。论文通讯作者是 Linfeng Zhang 和 Han Wang,第一作者 Duo Zhang 和 Xinzijian Liu,Weinan E、Junhan Chang、Xinyan Wang 也都在作者列表里——一条研究线的人马连贯而稳定。这步棋的格局不小,论文里顺势发起了 OpenLAM(Open Large Atomic Model)倡议,要把它做成开放协作的生态;深势 2024 年 2 月拉起一个云集诺奖得主和院士的顾问团,7 月在世界人工智能大会上发布最新进展。把”大原子模型”做成一个社区议程,是深势特有的打法。
这条力场研究线,在 2026 年结出了一颗和 FEP 直接相关的果子。2026 年 6 月,《化学信息与建模杂志》(JCIM)发了一篇论文,标题《使用 DPA-3 对生物分子进行高效精确的力场优化》。作者是深势科技和北京大学化学与分子工程学院的联合团队–深势这边有 Duo Zhang、Hongrui Lin、Weijie Sun、Linfeng Zhang、Hang Zheng、Xinyan Wang,北大那边有 Junhan Chang、Zhe Xu、Zhirong Liu。论文发在 JCIM 第 66 卷第 11 期,页码 6418 到 6428。
这篇论文做的事,恰好踩在 FEP 的命门上。他们微调了一个高精度的 DPA-3 预训练模型,引入 Δ-learning 策略,用 DPA-3 去修正 GFN2-xTB 半经验量子化学方法的误差,得到一个专门为 torsion scan 设计的模型 DPA-3-TB。训练数据来自 ChEMBL 中 334 个药物分子片段的约 60 万构象,参考标签算到 ωB97X-D/def2-SVP 级别。用这套模型做 torsion scan,速度快了约 50 倍——单条 torsion 在 Apple M2 CPU 上只需 55.9 秒,对应的 DFT 计算需要 46 分钟。配合基于节点嵌入的相似度度量,分子片段的指纹自动匹配,人工干预几乎为零。
但这里的”力场优化”需要准确理解它的边界。论文改的只有配体分子的二面角参数,电荷和范德华参数没动,蛋白质力场也没动。论文原文说得很清楚:”only intramolecular torsional parameters in the ligand force field were updated; nonbonded terms (charges and Lennard-Jones parameters) and protein force-field parameters were kept unchanged”。它没有替换经典力场,只是在经典力场的框架内把 torsion 这一项修得更准。
这套方法在两个 FEP 标准体系上验证了效果。TYK2 抑制剂系列(16 个配体,38 条扰动边),GAFF2 原始力场的 ΔG RMSE 为 0.91 kcal/mol,DPA-3-TB 修正后降至 0.50,R² 从 0.69 提升到 0.85。PTP1B 体系(23 个配体,49 条扰动边),ΔG RMSE 从 1.15 降至 0.91。一条代表性边上(20667→23482),磺酰胺基团的扭转构象从 gauche 被修正为 trans,避免了苯基脱离亚口袋,|ΔΔG| 从 2.74 骤降至 0.40 kcal/mol。
读懂这里面的张力。DP 系列从诞生之初就瞄准了”用神经网络替代手工力场去表示势能面”这个目标,张林峰在回顾中直言”我们目前还都只是在做 proof of concept 的事情”。DPA-3-TB 是这条路上第一个直接和 FEP 挂钩的成果——它做的不是用神经网络替代力场,只是用神经网络优化经典力场里最头疼的二面角参数。这步棋走得谨慎,论文也坦承局限:只改单 torsion、没改非键、改进效果因体系而异。另一方面,DeePDih 工具已通过 deepmodeling 组织开源,论文所有数据和训练流程公开可复现。但论文从头到尾没有提及深势的 Uni-FEP 产品,深势的官方文档和 Hermite 操作手册里也找不到 DPA-3 参与 Uni-FEP 优化的痕迹。两条线——研究端的 DPA 和产品端的 Uni-FEP——在公开信息中是独立的。
而这个落差,放在 2026 年的江湖里看,尤其耐人寻味。因为同样打”AI for Science”旗号、同样手握机器学习力场的字节跳动,交出了另一份答卷。
2026 年 6 月,字节旗下的 AI 制药团队(ByteDance AI Drug Discovery 与 Anew Labs)在 ChemRxiv 放出一篇 29 页的预印本(开源 RBFE 能追平 FEP+ 吗?AnewFEP 的工程拆解与 AI 模型的分布偏移大考),正式推出自己的 FEP 工作流–AnewFEP。它的底子同样是 GROMACS 加 REST2 采样,和 Uni-FEP 算同门同派。关键差别在力场:AnewFEP 用的是自家的 AnewFF 小分子力场,AnewFF 脱胎自字节 2025 年发表在《化学科学》(Chemical Science)上的 ByteFF。
ByteFF 是个什么路数?论文标题说得很清楚–“分子力学力场的数据驱动参数化”。它保留经典力场的函数形式(键长、键角、二面角、范德华、电荷),但用数据驱动方法把成键和非键参数重新拟合一遍,让覆盖的化学空间更宽。它是”用 AI 给经典力场调参”,而且调的是全套参数——键长、键角、二面角、电荷、范德华,一个不落,覆盖完整。这和 DPA-3-TB 只改二面角的策略不是同一层级的操作。DP 那条路更激进——它想扔掉经典函数形式,用神经网络直接拟合势能面——但 DPA-3-TB 这篇论文实际做的,是这条激进路线上的一个务实折中:保留经典力场框架,用 NN 只修其中最难搞的一环。
这两条路,难度天差地别。ByteFF 这种”改良派”落地快,函数形式不变,和现成的 MD 引擎、FEP 框架天然兼容;DPA 这种”革命派”天花板更高,但要重写整套模拟栈,外推稳定性、单步算力成本都是硬骨头。而 AnewFEP 的成绩单,恰恰证明”改良派”已经能尝到甜头:在一个 1147 个配体的公开基准上,AnewFEP 的整体 RMSE 做到了 1.38 kcal/mol,几乎追平 FEP+ 的 1.26。
更值得细看的是 AnewFEP 在工程上下的死功夫。字节这篇论文花了不少篇幅拆解 GROMACS 做 FEP 时的各种暗坑:GPU 混合精度计算里,非确定性的求和顺序会在小数点后第七位蹦出不可复现的误差,让”A 变成 A”的零扰动算出非零的自由能差,他们用双精度 GPU 归约把它摁住;骨架跃迁要软核势处理,传统软核势在 λ 趋近 0 时会出奇点,他们另写了一套软核势公式;他们还让配体 A、配体 B 和公共原子三组原子的 λ 标度能独立控制,显著改善了相空间重叠;再加上多时间步积分(MTS)、氢质量重分配(HMR)的 GPU 优化,以及对 GROMACS Ewald 排除项长程修正的纠错。这些都不是力场本身的事,是让一套 FEP 跑得稳、跑得准的工程地基。
论文还给了几个力场细节如何撬动 FEP 结果的鲜活案例。HIF-2α 体系里,一个 SO₂ 氧原子的范德华尺寸参数 σ 没调好,就能让单条扰动的误差超过 3 kcal/mol;把 σ 从 3.04 Å 调到 3.50 Å,整个体系的 RMSE 从 2.1 降到 1.5。JNK1 体系里,苯环翻转的构象采不到,算出来 A 和它的翻转异构体差 4.1 kcal/mol(理论上应该正好是 0),根子不在力场,在 λ 调度没把蛋白-配体非键耦合解开;换一套”相互作用分离”的 λ 调度,平均绝对误差从 2.27 降到 0.49。BACE1 压力测试里更微妙:两个配体只差芳环上一个碳换成氮,按理说扭转能垒不该有大变化,可原力场算出的二面角能垒偏高,硬生生造出 2 kcal/mol 的虚假稳定化,把扭转参数修正后误差才消下去。FXa 体系则是另一种坑,错不在配体,在蛋白:不加骨架二面角约束时,结合口袋里一个甘氨酸的羰基会翻转跑开,让 RMSE 飙到 2.41;加上骨架约束把羰基摁住,RMSE 降到 1.57。一个力场参数、一个蛋白构象控制,各自能撬动近 1 个 kcal/mol 的体系级误差。这些案例说明一件事:FEP 的精度,是力场、协议、工程三者咬合出来的,任何一环掉链子都会以多 kcal/mol 的级别显形。
有意思的是,字节论文还专门用一节拆解”为什么 FEP+ 通常那么准”,给出三个假设:一是 OPLS 力场经多代迭代、浸淫药物发现经验深厚,基线就稳;二是它的哑原子和约束构造得当,让哑原子的贡献在自由能差里干净抵消,不引入系统偏差;三是它为电荷扰动、骨架跃迁、共价配体、片段连接、显式水等场景备了一堆专项协议,默认设置翻车时能兜底。可见 FEP+ 的领先,从来不只是力场好,是力场、构造、协议、工程一整套打磨了几十年的护城河。AnewFEP 能逼近它,靠的也是在每一环上死磕。
这么一对照,Uni-FEP 的处境就清楚了。深势手里那条 DPA 路线,还在 proof of concept 阶段——DPA-3-TB 在两个体系上验证了 NN 辅助 torsion 优化能改进 FEP,但修改范围仅限于二面角,论文里也只字未提 Uni-FEP 产品。产品等不起,于是 Uni-FEP 务实地选了经典 GAFF2 先把阵地占住。字节走的 ByteFF 路线,已经把一整套 ML 参数化的经典力场塞进了 FEP 产品并逼近 FEP+;深势的 DPA 路线,赌注更大,回报也更远。
为什么会这样?公开资料没有给出官方解释,下面的判断属于我的推测。最合理的解读,是深势选了一条更难、但天花板更高的路,代价是产品端的力场暂时落后于”改良派”。DPA 真正成熟之前,经典力场是更保险的选择–它经过几十年打磨,行为可预期,出错的模式也被人摸得透。深势的姿态,像是两头下注:产品这边,先用经典力场把 Uni-FEP 做稳、做快、做出规模,把市场占住;研究那边,让 DPA 持续往力场这道坎上撞,等神经网络力场真正成熟了,再把它接进产品。只是这条路,被字节用一条更务实的中间路线抢了先手。
这道坎,深势比别人更有动力去翻–因为翻过去的技术,恰恰攥在它自己手里。它当下和它的可能性,暂时还是两副面孔。五、座次:江湖里的位置
把镜头拉远,看看 Uni-FEP 在 FEP 江湖里到底站在哪。
FEP+ 仍是综合实力最强的霸主(自由能的赌局:薛定谔FEP+的六十年)。它的家谱可以追溯到 2015 年 2 月《美国化学会志》(JACS)上那篇奠基论文,Lingle Wang 和 Schrödinger 团队提出了现代 FEP 协议,这篇论文至今被引一千二百多次,是整个领域的起点。此后十年,Schrödinger 沿着”啃硬骨头”的路线一路推进:2017 年拿下骨架跃迁,同年攻克大环,2018 年解决电荷变化的自由能计算。OPLS 力场、Desmond 引擎、Maestro 图形界面、LiveDesign 协作平台、Active Learning 模块,一整套闭源生态堆出来的护城河。闭源、昂贵、绑死 OPLS,短板鲜明,但市场用脚投票,它仍是多数大药企的标配,绝对精度也是行业天花板。前面字节论文拆解的那三个”为什么 FEP+ 准”的假设,恰恰说明它的领先是几十年系统打磨的结果,不是单点突破能撼动的。
紧追 FEP+ 的,如今多了一个 AnewFEP(开源 RBFE 能追平 FEP+ 吗?AnewFEP 的工程拆解与 AI 模型的分布偏移大考)。字节这套 GROMACS + AnewFF + REST2 的工作流,在 1147 个配体的公开基准上把整体 RMSE 压到 1.38,只比 FEP+ 的 1.26 慢了半个肩膀。论文里把它和 FEP+ 并列为”最强整体表现”,在骨架跃迁、电荷变化、压力测试这些硬骨头上都稳得住。它甚至配了一个对话式 AI agent,能自动设任务、收结果、筛分子。短板也明显:这篇 29 页的成果还是 ChemRxiv 预印本,未经同行评审;内部前瞻数据集没有公开;AnewFF 力场的细节有待社区检验。但论公开基准上的精度,AnewFEP 已经挤进了第一梯队。
Uni-FEP 站在哪?好在 2026 年这篇字节论文做了一件江湖等了许久的事–把十几家 FEP 工具拉到同一张表里同台比。Table 1 和 Figure 2 汇总了十二个物理方法、三个 AI 方法,在同一个公开基准套件(Gregory 数据集,1147 个配体)上的表现。数据来源交代得也老实:物理方法的成绩从各家原始论文里提取,AI 方法由字节本地统一重跑,只统计基准全覆盖的方法,避免以偏概全。
这张同台表上,Uni-FEP 的位置一目了然。在 Merck 数据集(264 个配体、8 个体系)上,FEP+ 约 1.34,Uni-FEP 报的是 1.82,OpenFE 报的是 2.00。在更难的 HIF-2α 体系上,FEP+ 1.1,晶泰的 XFEP 1.9,Uni-FEP 2.2,OpenFE 2.3,Rowan 2.7。加上前文 AnewFEP 整体 1.38 的成绩,第一梯队(FEP+、AnewFEP)和第二梯队(Uni-FEP、OpenFE、XFEP、Rowan 等)之间,隔着 0.4 到 0.7 kcal/mol 的差距–在 RBFE 这个锱铢必较的行当里,这个差距足以影响成百上千条边的研发决策。
客观讲,Uni-FEP 的强项不在单体系精度,在覆盖广度。它的 Uni-FEP Benchmarks 近千个体系、约 4 万个配体,是业内规模最大的公开 FEP 基准,连字节的 AnewFEP 论文都在致谢里专门感谢深势的 Rongfeng Zou 和 Hang Zheng 更新了这套数据,说它”极大方便了对比表的编制”(一个让 FEP "不再只跑理想题"的真实世界基准:Uni-FEP Benchmarks 是怎么炼成的?)。能被竞品直接拿来当试金石,本身就是一种江湖地位。配上 Hermite 平台的一站式集成、GPU 规模化、以及在中国市场”超六成头部企业”的占有率,Uni-FEP 在”商业 + 经典力场”这一档里站得很稳。
但稳,不等于顶尖。横向看一圈,几家主要竞品各有来路。OpenFE 占的是”开源 + 工业级工程化 + 产业联盟”这个全新生态位,它的根可以追到 2020 年 1 月–彼时 Chodera 实验室(纪念斯隆-凯特琳癌症中心)的 cinnabar 自由能分析库悄然上了 GitHub,算是 Open Free Energy 这场运动的起点(为自由能而自由:OpenFE 在 FEP)。2022 年 1 月,主仓库 openfe 创建,项目挂靠在开放分子软件基金会(OMSF)下,由 Chodera 和 Mobley(加州大学尔湾分校)等学术团队推动,MIT 协议、十多家药企凑钱养着。它的技术栈是 OpenFF 力场加 OpenMM 引擎,全开源,摆明了要对冲 Schrödinger 的闭源垄断–药企不想被 FEP+ 绑死,OpenFE 是那个能自己攥在手里的备胎。它的透明度在圈里出了名:2026 年 7 月还专门开了个 openfe-failure-cases 仓库,把跑出 NaN 的失败协议案例公开摆出来,供社区复现和排查。2025 年底在 ChemRxiv 发布的那篇十多家机构协作的大规模评估,2026 年正式发表于 JCIM,与深势自家的 DPA-3 论文在同一期,页码相隔仅一页。从预印本到同行评审正式发表,为 OpenFE 的工业级可用性补上了最硬的一块证据。它的短板是易用性,至今还是命令行和 Python API 为主,对非计算背景的用户门槛不低。
英国的 Cresset 带着 Flare FEP(借开源的刃,破 FEP 的局:Cresset Flare FEP),2019 年起家,底下踩着爱丁堡学术圈开源的 Sire/SOMD 引擎和 OpenMM,力场用 AMBER/GAFF/OpenFF。2020 年那篇 JCIM 方法学论文,第一作者 Kuhn,通讯是爱丁堡大学的 Julien Michel–SOMD 正是出自 Michel 课题组。Flare FEP 还公布过一项 TYK2 的前瞻性盲测,16 个 benchmark 配体的平均无符号误差 0.50、18 个盲测配体 0.59,真阳性率八成,算是商业 FEP 里少数把前瞻盲测结果公开摆出来的。有意思的是,Cresset 自己就是养着 OpenFE 的那个 Open Free Energy Fund 的出资方之一–一边卖商业 FEP,一边掏钱养开源 FEP,两头对冲。学术圈里,AMBER 走热力学积分路线,AmberTools 免费;GROMACS 配合 de Groot 实验室的 PMX,完全开源,在欧洲流行;NAMD 来自 UIUC,学术免费。晶泰的 XFEP 也有自己的力场论文,2024 年发在 JCTC,做了一套 AMBER-consistent 的小分子力场,HIF-2α 上跑出 1.9。这些工具底蕴深、各有据点,但端到端工作流得用户自己搭。
还有一个维度是这两年才冒出来的,值得专门说说:AI 直接预测亲和力,对物理 FEP 的挑战。字节这篇论文顺带评了三个 AI 方法,其中 Boltz-2 这类”结构预测基础模型”最值得琢磨。它在精心整理的公开基准上 RMSE 能做到 1.25,看着比 FEP+ 还漂亮;可一旦放到字节内部的全新分子(de novo)前瞻数据集上,它和实验的相关性近乎归零,完全丧失了区分强弱 binder 的能力。论文的解释很直接:这类模型预测的亲和力严重依赖它自己生成的结合构象,构象一偏,亲和力就跟着偏,对没见过的化学骨架和结合模式尤其脆弱。而 AnewFEP 靠物理采样,在同样的分布外场景下仍能保持单调的判别力。这个对比点出了物理 FEP 当下最硬的一条护城河:在分布偏移下仍可信。AI 亲和力预测在 curated benchmark 上看着惊艳,离”能在前瞻决策里替代物理 FEP”还差得远。
把 Uni-FEP 放进整个版图,它更像”中国市场的成熟商业 FEP + 业界最大的公开基准提供者”,离”和 FEP+ 平起平坐”还隔着相当的距离,也未必能稳压 AnewFEP 一头。它真正的差异化筹码有两张:一是规模和集成度,二是那道还没翻过去、但只有它有动机去翻的力场坎–DPA。前者是当下的饭碗,后者是未来的赌注。六、前路:那道坎翻得过去吗
故事讲到这,自然会想问:Uni-FEP 这道力场坎,翻得过去吗?
往乐观里想,如果 DPA 这条神经网络力场的路线真的成熟,Uni-FEP 手里就多了一张别人都没有的牌。经典力场在结构新颖的分子上力不从心,这恰恰是药物研发里最值钱的地带–越新的化学结构越可能成药,也越容易让经典力场翻车。DPA-3 论文已经在 TYK2 和 PTP1B 上证明了方向可行,要是这套东西能从”论文里的两个体系”扩展到”工业流水线上的成千上万个分子”,Uni-FEP 就有可能在那些经典力场搞不定的复杂体系上拉开差距。再加上 Hermite 平台的一站式集成、深势在算力侧(Bohrium)的积累、以及在中国市场已经铺开的客户基本盘,Uni-FEP 有一个不错的起跑位置。
不过暗礁也是实打实的。最硬的一块,是”证据”。FEP+ 有十年的产业验证和无数论文撑腰,AnewFEP 拿出了 1147 个配体的同台对比,OpenFE 有十多家机构的协作评估,Flare FEP 有 JCIM 方法学论文和 TYK2 前瞻研究。Uni-FEP 目前的公开证据,主要还是自建的基准仓库和一篇预印本,缺一场由第三方主导、不留情面的大规模盲评。在 FEP 这个认 benchmark 的圈子里,自家说自己准,和同行公认你准,是两回事。这场”成名战”没打下来之前,Uni-FEP 的精度声明总带着一层”自证”的影子。
另一块暗礁,是力场路线的赛跑。字节已经用 ByteFF 这条”改良派”路线证明了 ML 力场进 FEP 可行,并且先尝到了逼近 FEP+ 的甜头;深势的 DPA 是”革命派”,天花板更高,但 DPA-3 在两个体系上结果变好,离”大规模工业可用、精度全面超越 FEP+”还隔得远。训练数据依赖量子计算的质量,外推到训练分布之外未必可靠,单步成本也比经典力场高。更要紧的是,DPA 何时、以什么形态接进 Uni-FEP,公开资料里没有任何承诺。这道坎,有可能两三年内翻过去,也有可能像很多”下一代力场”那样,长期停在”研究很亮眼、产品用不上”的状态。而在这段空窗里,AnewFEP 这种更务实的中间路线,很可能先把”ML 力场 FEP”的市场认知占住。
还有个绕不开的问题:可复现和可审计。OpenFE 的透明度近乎偏执,连跑出 NaN 的失败协议都公开摆出来;Flare FEP 底下的引擎是开源的 Sire/SOMD、力场是学术主流的 AMBER/GAFF,外部多少能审。Uni-FEP 作为商业平台模块,”招式”封装在产品里,外部很难独立审视它在哪些体系上强、哪些体系上翻车。对于要把 FEP 结果拿去支撑研发决策甚至监管沟通的药企,这种透明度的差距是实打实的考量。深势放过一个 FEP Open Challenge 的悬赏–谁拿别的商业 FEP 工具在同等条件下显著超过 Uni-FEP,就奖励礼品卡。姿态是开放的,但这个挑战本身久未有新的动静,更像一次性的姿态,而非持续的机制。
最现实的图景,大概是这样:Uni-FEP 会继续靠”经典力场 + 规模化 + 平台集成”在中国市场稳扎稳打,把先发优势和客户基本盘做大;DPA 则作为一支偏师,在研究侧持续往力场这道坎上撞。这两条线短期内不会合一。等到哪天 DPA 真的在第三方盲评里证明了它能在工业级 FEP 上稳赢经典力场,Uni-FEP 才有资格去争那个”第一梯队”的位置。在那之前,它是一个有规模、有地盘、手里还藏着一张未亮底牌的有力竞争者,仅此而已。
真正值得警惕的危险,是两层夹击。一层来自上面:AnewFEP 已经用 ML 力场把 FEP 做到逼近 FEP+,如果字节持续迭代 AnewFF 并补上同行评审和第三方盲评,”ML 力场 FEP”这个叙事的旗手就稳稳落在字节手里,深势的 DPA 哪怕后来居上,也是追赶者。另一层来自侧面:Boltz-2 这类 AI 亲和力模型在 curated benchmark 上已经能跑出比 FEP+ 还好看的数字,一旦它的分布外鲁棒性补上来,物理 FEP 整个赛道的价值都会被重估。Uni-FEP 夹在中间–精度上被第一梯队拉开,叙事上被 ML 力场同行抢跑,下游还面临 AI 预测的降维打击。这道力场坎,对它来说不只是”何时翻过去”,还有层”还翻不翻得及”的意味。
好在物理 FEP 的护城河还没被真正突破:AI 模型在分布外的失能、经典力场在新化学空间上的力不从心,恰恰把”更好的力场”这件事的价值钉死了。只要这个判断成立,深势手里那张 DPA 底牌就还有分量。
回头看 Deep Potential 那两篇 2017 年的论文。当时大概没几个人想到,一套用来拟合势能面的神经网络,会和一个跑经典力场的 FEP 产品,同属一家公司。这中间的落差,与其说是个矛盾,不如说是 AI for Science 这条路真实的样子:研究的锋芒,常常远远跑在产品的稳妥前面。只是当隔壁的字节已经用一条更务实的 ML 力场路线把 FEP 做到了逼近 FEP+,当 OpenFE 把失败案例都摊在阳光下,当 AI 亲和力模型在 benchmark 上逼近乃至超过物理方法,深势这道力场坎,就不再只是自己的技术叙事,而成了整个 FEP 江湖力场路线之争里,最具悬念的一局。
力场这道坎,横在所有 FEP 玩家面前。有人绕着走,有人硬扛。深势的姿态是,先用经典力场把桥搭起来、让人能过河,再在岸边磨那把据说能劈开坎的神经网络刀。刀磨得成磨不成,江湖还不知道;但桥已经搭上了,过河的人,已经不少。主要参考与来源
DP Technology 深势科技官网与”关于我们”(公司 2018 成立、北京/上海/深圳/宜宾、产品矩阵、深势·宇知®基座、Science as a Service、Kv1.3 抑制剂管线、OpenLAM 进展、Uni-FEP/CDK4-Cyclin D3 案例):https://www.dp.tech
Hermite FEP 计算操作文档(Uni-FEP 引擎 GROMACS-2021.1、AMBER99SB/AMBER99SB-ILDN、GAFF2/GAFF、REST2、16 λ 窗口、PME、F.A.I.R.):https://hermite.dp.tech/tutorial/docs/operation-manual/FEP-Calculation/FEP_Calculation-trans/
Uni-FEP-Benchmarks 公开基准仓库(Apache-2.0,2025-02-05 建立,2026-05-16 更新,58 星):https://github.com/dptech-corp/Uni-FEP-Benchmarks
dptech-corp GitHub 组织(Uni-GBSA 2021-09、Uni-Fold 2022-07、Uni-Dock 2023-05、Uni-pKa 2023-08 等开源时间线):https://github.com/dptech-corp
Rongfeng Zou, Liguo Wang, Xinyan Wang, Ye Ding, Hang Zheng,《Breaking Barriers in FEP Benchmarking: A Large-Scale Dataset Reflecting Real-World Drug Discovery Challenges》,ChemRxiv 预印本(2025-07-15),约 1000 体系、约 4 万配体:DOI 10.26434/chemrxiv-2025-rf8mf
深势科技 C 轮融资(超 8 亿人民币,2024-12-24,达晨财智/京国瑞/北京 AI 产业基金/北京医药健康基金/联想创投/元禾璞华等)及往轮融资公开报道(多源印证,累计数十亿人民币,独角兽)
Jiequn Han, Linfeng Zhang, Roberto Car, Weinan E,《Deep Potential: a general representation of a many-body potential energy surface》,Communications in Computational Physics 23, 629–639 (2018),DOI: 10.4208/cicp.oa-2017-0213(arXiv:1707.01478 2017)
Linfeng Zhang, Jiequn Han, Han Wang, Roberto Car, Weinan E,《Deep Potential Molecular Dynamics: A Scalable Model with the Accuracy of Quantum Mechanics》,Physical Review Letters 120, 143001 (2018),DOI: 10.1103/physrevlett.120.143001(arXiv:1707.09571 2017)
DeePMD-kit 软件论文,Computer Physics Communications 2018,DOI: 10.1016/j.cpc.2018.03.016;开源仓库 https://github.com/deepmodeling/deepmd-kit
DPA-1: Duo Zhang, Hangrui Bi, Fu-Zhi Dai, Wanrun Jiang, Linfeng Zhang, Han Wang,《Pretraining of Attention-based Deep Learning Potential Model for Molecular Simulation》,npj Computational Materials 10, 94 (2024),DOI: 10.1038/s41524-024-01278-7(arXiv:2208.08236 2022-08-17)
DPA-2: Duo Zhang, Xinzijian Liu, …, Weinan E, Linfeng Zhang, Han Wang,《DPA-2: a large atomic model as a multi-task learner》,npj Computational Materials 10, 293 (2024),DOI: 10.1038/s41524-024-01493-2(Received 2024-08-19, Accepted 2024-11-27,同行评审;18 数据集/73 元素多任务预训练,含药物分子,论文发起 OpenLAM 倡议)
Junhan Chang, Zhe Xu, Duo Zhang, Hongrui Lin, Weijie Sun, Linfeng Zhang, Zhirong Liu, Hang Zheng, Xinyan Wang,《Efficient and Precise Force Field Optimization for Biomolecules Using DPA-3》,J. Chem. Inf. Model. 2026, 66(11), 6418–6428,DOI: 10.1021/acs.jcim.6c00423(深势科技与北京大学合作;DPA-3-TB 为 Δ-learning 模型,用 DPA-3 修正 GFN2-xTB,用于 torsion scan 以优化 GAFF2 二面角参数;TYK2 ΔG RMSE 0.91→0.50,PTP1B 1.15→0.91;仅改配体 torsion 参数,不改非键和蛋白质力场;DeePDih 开源于 deepmodeling 组织;论文未提及 Uni-FEP 产品)
Wentao Li, Chao Lu, …, Haoyu Yu, Kai Liu(ByteDance AI Drug Discovery / Anew Labs),《Physics-Based vs AI-Based Free Energy Prediction for Protein-Ligand Potency: Public Benchmarks and Internal Project Evidence》,ChemRxiv 预印本(2026-06-02,v2 日期 2026-05-29),29 页。介绍 AnewFEP(GROMACS + AnewFF + REST2 + Amber ff14SB),1147 配体整体 RMSE 1.38 kcal/mol;工程创新(双精度 GPU 归约、软核势公式、独立 λ 控制、MTS、HMR、Ewald 修正);Table 1/Figure 2 同台对比 12 个物理方法与 3 个 AI 方法;Boltz-2 前瞻对比:DOI 10.26434/chemrxiv.15002526/v2
Tianze Zheng, Ailun Wang, Xu Han, Yu Xia, …, Wen Yan,《Data-driven parametrization of molecular mechanics force fields for expansive chemical space coverage》,Chemical Science 2025,DOI: 10.1039/d4sc06640e(ByteFF 力场,机器学习参数化的分子力学力场,AnewFF 的基础)
FEP+ 里程碑论文:Wang 等,JACS 2015,DOI: 10.1021/ja512751q(被引 1200+);骨架跃迁 Wang 等 JCTC 2017,DOI: 10.1021/acs.jctc.6b00991;大环 Yu 等 JCTC 2017,DOI: 10.1021/acs.jctc.7b00885;电荷变化 Chen 等 JCTC 2018,DOI: 10.1021/acs.jctc.8b00825
OpenFE:OpenFreeEnergy GitHub 组织(cinnabar 2020-01-29 起源、openfe 2022-01-24 创建、openfe-failure-cases 2026-07-27 失败案例公开):https://github.com/OpenFreeEnergy;大规模协作评估 Baumann 等,JCIM 2026, 66(11), 6429–6452,DOI: 10.1021/acs.jcim.6c00089(与 DPA-3 同卷同期,页码相隔仅一页);ChemRxiv 预印本(2025-12-18),DOI: 10.26434/chemrxiv-2025-7sthd
Flare FEP 方法学论文:Kuhn, Firth-Clarke, Tosco, Mey, Mackey, Michel,JCIM 2020,DOI: 10.1021/acs.jcim.0c00165(Sire/SOMD 引擎出自爱丁堡 Julien Michel 课题组)
XFEP(晶泰):Xue 等,JCTC 2024,DOI: 10.1021/acs.jctc.3c00920(AMBER-consistent 小分子力场)
张林峰,《对Deep Potential系列方法发展的回顾》,知乎专栏(2020-07-09,审校2021-01-30),https://zhuanlan.zhihu.com/p/348284750(DP 系列方法的发展四阶段,”我们目前还都只是在做 proof of concept 的事情”)
Gregory 基准数据集:Ross 等,Communications Chemistry 2023,DOI: 10.1038/s42004-023-00943-3,1147 配体(同台对比的统一基准)