我AI我药
AI × 生物医药
2026 · 第 19 期
Nature BiotechnologyNat. Biotechnol.!不再暴力筛690亿分子:18维化学空间导航,找到真实纳摩尔Hit!
01 研究速览
论文首页 | Nature Biotechnology,2026 | DOI 10.1038/s41587-026-03217-x
虚拟筛选(virtual screening)的化学空间正从百万、千万迅速膨胀到百亿甚至万亿级;当可购买化学空间迈向百亿、千亿、万亿,穷举全部分子本身开始成为瓶颈——问题从「怎样算得更快」变成「该算哪一片」。
虚拟筛选(virtual screening)的化学空间正在迅速膨胀:厂商目录里可购买、可即时合成的分子,当前估计已高达约 3 万亿(3 trillion)个,早已不是过去百万、千万的量级。问题也随之改变——分子越来越多,要把每一个都完整算一遍,已经既不现实也不经济。Christoph Gorgulla 等团队这次在 Nature Biotechnology 提出的 AdaptiveFlow,试图解决的不是「怎样把 690 亿个分子全部算完」,而是另一件事:怎样先判断,690 亿个分子里哪些区域最值得算。
它的核心是把一个巨大的「分子名单」改造成一张「可导航的化学地图」:先用少量代表分子去各个区域探路,判断哪里最可能藏着好分子,再把计算资源集中过去。下面先用四个快照快速看清这次工作的研究对象、科学问题、关键突破与核心数字。
研究对象AdaptiveFlow:面向超大规模虚拟筛选的开放平台,围绕约 690 亿个 ready-to-dock 分子构建自适应筛选体系。
科学问题当化学库扩展到数百亿甚至更大规模时,如何避免穷举全部分子,又不明显牺牲高质量 hit 的发现能力?
关键突破把约 690 亿个分子组织成 18 维性质空间,先用代表分子定位与特定靶点最匹配的「热点区域」,再把计算资源集中进去;机器学习(ML)还可继续缩小需要完整 dock 的范围,整体比穷举全库少 >5,000 倍的计算量。
核心数字690 亿 / 18 维 / 1,200 万个 tranche / >5,000 倍 / 8.8 nM。
02 为什么值得关注
过去的问题
超大规模虚拟筛选过去有一条非常直接的逻辑:库越大,就多算一些。
· 当数据库从百万增长到十亿时,这还能靠更多 CPU、GPU 和云计算硬撑
· 但当可购买化学空间进一步迈向百亿、千亿甚至万亿级,穷举本身开始成为瓶颈
· 这并非「虚拟筛选很重要」之类的空话,而是算力增长追不上库规模增长的结构性矛盾
↓
这篇文章改变什么
AdaptiveFlow 换了一个问题。
· 它不问:「怎样更快地把 690 亿个分子全部算完?」
· 而是先问:「针对这个靶点,690 亿个分子中的哪一片化学空间最值得深入搜索?」
· 然后用 18 维性质网格把整个库组织成可导航的空间,让「先选区域再算」成为可能
↓
为什么重要
关键不只是「少算一点」,而是少算很多以后,还能找到真的 hit。
· 这篇工作的价值在于最终没有停在 docking score
· 它一路走到分子合成、生化活性、细胞靶点结合以及 X-ray 共晶结构
· 这正是它能从「又一种筛选算法」变成「可信发现」的原因
支撑这套思路的是实打实的工程规模:AdaptiveFlow 集成了超过 1,500 套 docking 协议、来自 40 多个程序(含 DiffDock、TANKBind 等 ML 对接方法);在云上可做到最高 560 万vCPU 的近线性扩展,把涉及数十亿分子的大规模筛选从「数周乃至数月」压缩到「数小时」。
相对穷举,这带来最高 10,000 倍加速与最高 1,000 倍成本下降。换句话说,它不是在「更小」和「更强」之间二选一,而是同时做到了——这也是它敢说「不必穷举」的底气。
03 研究如何展开
AdaptiveFlow 的做法可以拆成四步,每一步都让下一步更聚焦。它先算 28 种理化性质、挑出 18 个关键维度,把约 690 亿个 ready-to-dock 分子组织成一张「化学地图」;再用少数代表分子去地图的各个区域探路、找到热点;然后用机器学习(ML)进一步收缩要完整对接的范围;最后把候选真正合成出来做实验验证。下面逐一展开。
1建地图
原始 REAL Space 约 315 亿分子;经立体异构体、互变异构体、质子化与 3D 构象准备后,得到约 687 亿 ready-to-dock 实体,再按 18 种性质分成约 1,200 万个 tranche。
2代表分子探路
每个 tranche 约 5,600 个分子;不全部计算,而取 1–10 个代表分子做 ATG prescreen,定位对当前靶点 docking 最好的「热点区域」。
3机器学习收缩
在选中区域再训练机器学习(ML)分类器(输入 Morgan 指纹、监督来自前轮 docking score),按靶点再把完整 dock 量缩减 30%–70%。
4真正做实验
最后用两个靶点验收:FSP1 与 PARP1。
值得强调的是「自适应」三个字:每个 tranche 只取 1–10 个代表分子去探路,选中区域后再用 ML 分类器(输入 Morgan 指纹、监督来自前一轮 docking 分数)按靶点把完整对接量再削减 30%–70%。也就是说,算得越少,模型越知道下一步该往哪里看——搜索过程本身在持续变聪明,而不是一次性跑完就结束。
04 核心实验结果
下面用 5 张图把方法到验证讲清楚:图 1 展示「把 690 亿分子变成可导航的化学地图」的整体思路;图 2 说明为什么不必穷举全库——1,200 万个代表分子就足以探路;图 3 用10 个靶点的 benchmark 证明「少筛约 10 倍」仍能找到同级的虚拟 hit;图 4、图 5 则把算法真正落到实验——FSP1 与 PARP1 上,从虚拟候选一路走到共晶结构与 8.8 nM 实测活性。遇到真正硬核的数字,再单独用大数字卡放大。
图 1 | 把 690 亿个分子变成一张「可导航」的化学地图
科学问题:百亿级分子库如果只是一个名单,后续仍然只能一个个算。能不能先把整个空间组织起来,让它变成可以选择区域的地图?
关键发现:AdaptiveFlow 把制备后的约 687 亿个 ready-to-dock 分子,按 18 个性质维度(先算 28 种理化性质,再挑 18 个关键维度)划入约 1,200 万个实际占用的 tranche,并支持 >1,500 套 docking protocol 与 CPU/GPU 计算。整个 REAL Space 因此从一个巨大的清单,变成一张可以「按区域搜索」的高维化学地图。
为什么重要:真正改变的是数据结构。分子库从「一个巨大的清单」变成了「可以选择区域的空间」,后续所有筛选都能先选区域再算,而不是从第一个分子算到最后一个。
怎么读这张图:不要把 Figure 1 当软件功能图读。抓住三件事:分子库 → 18 维组织 → 靶点引导筛选。它展示的是「把库变成可导航空间」的整体思路,而不是某个具体打分结果。
图 2 | 690 亿不用全部算:1,200 万个代表分子先探路
科学问题:如果整个库有 690 亿个分子,最少需要算多少,才能先判断哪些区域更值得深入?这是整篇最朴素也最关键的问题。
关键发现:每个 tranche 平均约 5,600 个分子;ATG prescreen 只取 1 个代表分子时,整个 690 亿级化学空间的 prescreen 约需 1,200 万次 docking,计算量比穷举全库少 >5,000 倍。
为什么重要:这不是把 690 亿变成 1,200 万候选,而是用 1,200 万个「侦察兵」,先判断 690 亿分子的哪一片区域最值得继续搜索。这句话是整篇最关键的科学边界。
怎么读这张图:看「全库穷举 vs 代表分子探路」的对比。重点是左侧巨大的库被压缩成稀疏的代表点网格;点的位置代表该 tranche 的探路结果。
690亿 → 1200万 探路首轮只需对接约 1200 万代表分子
ATG prescreen 对接 1,200 万分子探索 690 亿库,计算量比穷举全库少 >5,000 倍——不是把 690 亿变成 1,200 万候选,而是用 1,200 万个「侦察兵」先判断哪片区域最值得继续搜索
图 3 | 少筛 10 倍,仍能找到同等级甚至更好的虚拟 hit
科学问题:少算这么多,会不会把好分子一起漏掉?这正好承接读者最自然的问题。
关键发现:论文在 10 个不同靶点上做 benchmark,比较 100 万随机筛选 vs 10 万 ATG vs 10 万 ATG + active learning。结果显示,多数靶点上 10 万规模 ATG 已经能够达到与 100 万随机筛选相当甚至更好的 top docking 表现,而筛选分子数降为约 1/10(tenfold reduction)。
为什么重要:证明「缩小搜索范围」不是简单少算,而是提高每一次计算落在高价值区域里的概率——这才是 ATG 真正的收益来源。
怎么读这张图:不要逐个看 KRAS、CB1、JNK3……只看两件事:蓝色是 100 万随机筛,另外两组只用了 10 万;看顶部 50 个 hit 的分布即可。
benchmark 证明了「少算也能找到好分子」,但虚拟筛选的老问题始终是:高分候选在真实实验里能不能成立?接下来两张图就是把「690 亿 → 1,200 万 → 热点区域」这套筛选,真正接到湿实验上去——一个挑全新的 ferroptosis 靶点 FSP1,一个挑成熟的临床靶点PARP1。
图 4 | FSP1:从虚拟候选走到真实结合
科学问题:AdaptiveFlow 得到的高分候选,在实验里还能不能成立?这是算法最该被质疑的一关。
关键发现:FSP1 路线:1,200 万 prescreen → 1,000 万 primary → 42 个候选下单 → 33 个成功合成测试 → 得到真实 FSP1 抑制剂 afi-FSP1-1(Ki 0.283 µM,Kd 0.098 µM)与 afi-FSP1-2(Ki 0.777 µM);并完成细胞靶点结合与共晶结构验证。
为什么重要:这一步把「计算得分」变成了「真实分子 → 生化活性 → 细胞 target engagement → 共晶结构」,形成完整闭环验证。
怎么读这张图:重点指出:共晶结构显示 afi-FSP1-1 确实进入预期的 coenzyme-Q 结合区域,且实验观察到的结合模式与计算预测基本一致——不必逐个讲每个残基。
图 5 | PARP1:160 个候选,最后打到 8.8 nM
科学问题:同一套筛选框架换一个成熟的临床靶点,还能不能工作?这是检验方法通用性的关键。
关键发现:PARP1 方向:1 亿分子 primary screen → 160 个候选合成 → 7 个抑制剂(4 个 IC50 < 250 nM)→ iParp1 IC50 8.8 nM,与 FDA 批准的 olaparib 相当;并给出 2.05 Å X 射线、NMR 直接结合与 BRCA1 缺陷三阴性乳腺癌克隆形成选择性毒性证据。该 hit 不依赖已知 PARP1 抑制剂先验、也未经过药化优化。
为什么重要:证明这套框架不只在一个靶点有效,换成熟临床靶点同样能走通「虚拟→ 合成 → 活性 → 结构」闭环,且达到与上市药相当的酶水平活性。
怎么读这张图:看最右的晶体结构与活性数据。重点是 iParp1 的酶水平 IC50(8.8 nM)与 olaparib 相当;但这是酶学数据,不代表临床效果——细胞活性受水解与膜通透性限制。
8.8 nM iParp1 酶水平 IC50
PARP1 方向 160 个合成候选中打到 iParp1,IC50 8.8 nM,与 FDA 批准的 olaparib 相当;但这是酶学数据,不代表临床效果(细胞活性受水解与膜通透性限制)
05 科研意义
这项研究告诉我们:过去超大规模虚拟筛选的逻辑是「库越大 → 算得越多」,试图用更多算力把更大的库硬扛下来。AdaptiveFlow 展示的是另一条路——「库越大 → 越需要先判断哪里值得算」。当可购买化学空间迈向 3 万亿级别,穷举本身正在变得不现实,这种「先选区域再算」的范式,可能是百亿、万亿级化学空间真正可用之后更关键的算法问题。
这篇文章比较扎实的一点是,它没有停在 docking benchmark 层面。它真正把候选合成 → 生化验证 → 细胞验证 → 结构验证走成了闭环:FSP1 从 1,200 万探路一路缩到33 个合成测试、拿到 2 个真实抑制剂;PARP1 从 1 亿初筛到 160 个合成、7 个抑制剂。所以「690 亿」负责说明规模,「实验闭环」才负责说明方法到底有没有价值。
AI 真正扮演的角色值得单独讲:它不是「AI 筛了 690 亿个分子」,而是「AI 帮助决定下一步把计算资源花在哪里」。每个 tranche 只派 1–10 个代表分子去探路,选中区域后再用 ML 把完整对接量砍掉 30%–70%——算得越少,模型越知道下一步该往哪里看。这和active learning、自驱动实验室、自动化制药属于同一趋势:AI 正从「给答案」,走向「决定下一步做什么」。
从方法学的角度看,图 3 的 10 靶点 benchmark 反而是最容易被忽略的亮点:在 KRAS、CB1、JNK3 等十个差异很大的靶点上,约 10 万规模的 ATG 筛选(再叠加 active learning)普遍能达到甚至超过 100 万随机筛选的 top hit 水平,而筛选分子数降到约 1/10。这说明「缩小搜索范围」省下的不是随便丢掉的分子,而是把每一次计算都更可能落在高价值区域——这正是 active learning 式自适应搜索的本质收益。
这套平台并不绑定 FSP1 或 PARP1 两个靶点。它支持小分子、多肽、共价配体,以及蛋白-蛋白、RNA/DNA 等不同 target 类型;兼容 40 多个程序、超过 1,500 套 docking协议(含 DiffDock、TANKBind 等 ML 对接),还提供 SELFIES 与生成模型的接口。论文同时发布了代码与数据可用性说明(统一、开源、可大规模扩展)。所以它更像超大规模AI 药物发现里的一层基础设施,而不是一个只能复现本文结果的脚本。
适用范围与边界也必须写清:ATG 的效果具有靶点依赖性,并非对所有靶点都同样省力;docking score 仍然不是实验活性,高分候选仍可能被生化实验淘汰;8.8 nM 是酶学的IC50,不代表临床效果,细胞活性还受水解与膜通透性限制;更强的 hit 仍需要后续药化、ADME 与体内验证;即便计算量被大幅缩减,超大规模云计算本身依然消耗可观资源。把这些边界讲清楚,反而让「690 亿 → 真实纳摩尔 Hit」这条主线更可信。
06 往期推荐
01AI 读懂细胞:不用重训、跨物种通用 · 3,600 万个细胞、8 个物种嵌进同一个表示空间,连训练时没见过的物种都能直接入图——单细胞分析告别「一个数据集一个模型」。
02AI 自己提假设、自己写代码验证:癌症病理新范式 · 让 AI 自己提假设、自己写代码验证,从常规病理切片产出 1,115 个可解释参数——不训练模型,总成本约 4,000 欧元。
03511 个 AI 抗体接受盲法实测:AI 设计什么水平 · 29 家机构的 511 条 AI 抗体序列先交卷后测量:最优设计 95 pM,与实验最佳抗体统计上不可区分——AI 设计的真实水平第一次有了硬标尺。
07 研究团队与论文信息
期刊:Nature Biotechnology(2026,Article,2026-09 在线)
DOI:10.1038/s41587-026-03217-x
团队:通讯:Christoph Gorgulla(St. Jude Children's Research Hospital)、Haribabu Arthanari(Harvard Medical School)、Andrea Mattevi(University of Pavia);共同一作(equal contribution):Domiziana Cecchini、AkshatKumar Nigam、Ming Tang、Joana Reis
机构:St. Jude Children's Research Hospital(美国)、Harvard Medical School(美国)、University of Pavia(意大利)、University of Oxford(英国)等
权利:CC BY-NC-ND 4.0;本推文非商业、无广告,原样截取论文原图并完整署名(作者/期刊/DOI),符合「不得演绎」
文献来源
AI-enhanced adaptive virtual screening of large libraries for ligand discovery
Nature Biotechnology · 2026
DOI:10.1038/s41587-026-03217-x