导语AI虚拟细胞是AI制药的操作系统
AI虚拟细胞(AI Virtual Cells, AIVC)不是AI药物发现(AIDD)的替代品,而是其上层操作系统。AIDD回答"该设计什么分子",AIVC回答"这个分子进入真实细胞后,会把生命系统推向什么状态"。
本文基于2024–2026年公开数据,得出五个关键结论:
▪ 需求侧:药物临床转化整体成功率仅9.6%,II期仅31%;失败原因中40–50%是疗效问题、约30%是毒性——这两类失败的根源都位于细胞层动态(通路补偿、肿瘤异质性、微环境),而非分子层设计缺陷。分子中心AI存在结构性天花板,这是AIVC范式的需求原点。
▪ 供给侧:数据基座在24个月内扩张了两个数量级——Arc虚拟细胞图谱聚合超6亿细胞,Tahoe-100M提供1亿个药物扰动单细胞数据;但模型性能仍然早期:2025年首届Virtual Cell Challenge中,4,325支队伍无一让纯端到端深度学习稳定击败统计基线,Arc Institute研究员Hani Goodarzi承认"纯神经网络尚未跑赢混合模型"。
▪ 商业化验证:赛道已从论文走向临床与真实世界——Xaira Therapeutics以10亿美元融资开局并于2026年发布X-Cell模型(Tahoe-100M上Pearson 0.31,较STATE基线0.22提升约40%);Cellarity的CLY-124(DCN1抑制剂,镰刀型贫血)已进入I期临床,2026年Q4读出28天数据;微软GigaTIME在14,256名真实患者上验证并通过独立TCGA队列外部复现(Spearman 0.88)。
▪ 竞争格局:美国定义范式(Xaira、Cellarity、Tahoe、Arc Institute、微软),中国深度参与且在标准竞争中已拔头筹——百图生科xTrimoSCPerturb夺得首届全球虚拟细胞挑战赛冠军(114国4,325支队伍),2026年4月以来国内近10起融资落地,红杉、君联、BV百度风投入场。
▪ 风险提示:基因组尺度Perturb-seq中仅41%的基因扰动产生可测量的全转录组信号,意味着59%的"沉默扰动"是当前所有模型的共同盲区;细胞模型与患者结局之间的鸿沟是品类问题而非规模问题。AIVC的资本热度领先其技术成熟度约一个 hype cycle。
1研究背景与方法
虚拟细胞(Virtual Cell)指在计算机上模拟细胞部分或全部生物学行为的计算模型。与2024年由斯坦福大学、陈-扎克伯格倡议(CZI)与基因泰克(Genentech)团队在《Cell》上正式概念化之前散落的尝试不同,当前AIVC产业的共同定义收敛为两项核心任务:描述细胞状态(Cell State Representation),以及预测外界扰动对细胞状态的影响(Perturbation Response Prediction)。
本文的研究范围覆盖2024年1月至2026年9月的全球公开信息,数据来源包括:Arc Institute Virtual Cell Challenge官方数据与《Cell》评述文章、Tahoe-100M数据集文档(Hugging Face/bioRxiv)、微软GigaTIME研究(《Cell》2026年1月刊)、Cellarity公司公告与ASH 2025会议数据、BIO/BioMedTracker/Amplion对2006–2015年7,455个药物开发项目的追溯分析,以及动脉网、医药魔方等对中国的产业跟踪报道。所有关键数字均在正文标注来源,未获得数据支持的推断均明确标注为判断而非事实。
分析框架上,报告采用"需求侧失败根源 → 供给侧技术架构 → 商业化验证 → 竞争格局 → 协同效应"的五层递进结构,并在第八章对技术成熟度做逆向压力测试。这与市场主流叙事的最大差异在于:本报告不回避2025年挑战赛暴露的性能问题——这些负面证据恰恰是判断投资时点与商业模式可行性的关键变量。
2范式判断:临床失败的结构性根源决定了AIVC的必然性
2.1 9.6%的临床成功率:失败发生在分子之外
▲ 临床转化漏斗与失败原因结构
BIO联合BioMedTracker与Amplion对2006–2015年间7,455个进入临床的药物开发项目的追溯分析,给出了行业最常引用的转化漏斗:I期成功率63%,II期31%,III期58%,上市审评85%,从临床到获批的整体成功率仅9.6%。失败原因的结构比成功率本身更值得注意:约40–50%的失败源于疗效缺乏或不足,约30%源于不可管理的毒性,10–15%源于药代动力学缺陷。
这组数字揭示了一个被分子中心AI叙事长期遮蔽的事实:药物失败的 majority 场景,不是"分子设计得不好",而是"分子作用的生命系统与预期不符"。 一个化合物可以完美结合靶点、拥有良好的PK性质,仍然在II期死掉——因为动物模型中验证的生物学假设在人体疾病环境中不成立。2022年Replogle等人在《Cell》发表的基因组尺度Perturb-seq研究给出了更深一层的量化:只有41%的基因扰动能产生可测量的全转录组信号。换言之,连"扰动→转录组响应"这条虚拟细胞最基础的映射,都有59%的输入端是近乎沉默的——这既是模型的机会,也是模型的天花板。
II期临床因此被称为"药物研发的坟场":它首次在真实患者身上检验疗效,淘汰率40–60%。行业对这一困境的标准回应是阿斯利康的"5R框架"(Right Target、Right Patient等)——本质是在承认:问题出在靶点假设与患者选择,即细胞与组织层面的生物学判断,而现有工具链在这一层几乎不具备预测能力。
2.2 Molecule-centric AI的天花板
过去八年AIDD的技术栈——AlphaFold的蛋白结构预测、GNN分子性质预测、Diffusion分子生成、Transformer学习SMILES表示——全部服务于同一条流水线:给定靶点,找到配体。这套工具链在分子层确实创造了增量价值(Insilico Medicine的INS018_055推进至II期、Exscientia与Recursion的管线验证了从头设计的工程可行性),但它对2.1节所列的三类主要失败原因的贡献接近于零:
失败原因 | 占比 | Molecule-centric AI能否解决 | 需要的信息层级
疗效缺乏/不足 40–50% | 不能 | 通路补偿、细胞可塑性、疾病状态网络
毒性/安全性 ~30% | 部分可预测(hERG、肝毒性等分子性质) | 组织与细胞层面的脱靶效应、微环境响应
药代动力学 10–15% | 部分可预测(ADMET模型) | 分子性质为主
商业/策略原因 ~10% | 不能 | 市场与竞争判断
表中"疗效缺乏"一行是关键:占据失败近半壁江山的病因,恰恰位于AIDD工具链的能力边界之外。通路补偿(Pathway Compensation)意味着敲掉一个基因,网络会绕行;肿瘤异质性意味着同一药物在不同亚克隆中效果相反;免疫串扰(Immune Crosstalk)意味着体外实验设计得再精细也还原不了微环境。这些都是细胞层与系统层的动态行为,需要的是对整个细胞状态空间的建模,而非对单个蛋白口袋的建模。
2.3 三阶段演进:分子→细胞→人体
▲ AI生物医药三阶段范式演进
将上述需求侧证据与供给侧能力叠加,本报告采用如下的三阶段框架(该框架与用户提供的原始框架一致,但以2024–2026年实际发生的产业事件做了时间校准):
第一阶段(2018–2024):AI Drug Discovery。 建模对象是分子。标志性事件是2024年10月诺贝尔化学奖授予蛋白质结构预测。该阶段的局限在于:AI渗透进研发流程的中段(靶点到先导化合物),对全流程成功率9.6%的结构性困境没有系统性改善。
第二阶段(2024–2030):AI Virtual Cells。 建模对象是细胞。三个事件锚定了起点:2024年《Cell》虚拟细胞概念文发布;2024年Xaira Therapeutics携10亿美元融资成立,明确以虚拟细胞范式重塑AI制药;2025年2月Tahoe-100M开源与6月Arc Institute虚拟细胞挑战赛启动。本阶段的核心问题是"细胞将如何响应药物、基因扰动与疾病"。
第三阶段(2030+):AI Virtual Human。 建模对象是多器官与人体系统,核心问题是预测患者长期疗效、安全性与疾病演化。值得注意的先行者是微软:其与Providence合作的TRIALSCOPE框架已于2025年11月发表于NEJM AI,用真实世界数据模拟临床试验结果——技术形态上已经踩进了第三阶段的地界。
一句话判断:AIVC之所以是"第二阶段"而非"AIDD的一个分支",在于它改变了AI建模的对象本体——从分子这一静态化学实体,变成细胞这一动态生命系统。
3技术架构拆解:虚拟细胞到底在模拟什么
3.1 定义与四层模拟对象
对AIVC最常见的误解是把它理解为"一个数字化的细胞3D模型"。实际上,主流技术路径并不渲染细胞形态,而是把细胞建模为一个连续的、可干预的状态空间(Continuous Latent Space)。模型输入多组学数据(基因表达、蛋白、突变、表观遗传、空间信息)与扰动信息(药物、基因编辑、时间),输出状态预测、表型、轨迹与响应。
按模拟对象的抽象层级,当前工作可分为四层:
层级 | 模拟对象 | 输出示例 | 代表工作
L1 细胞状态 状态空间中的位置与转移 | 健康→激活→炎症→衰老→凋亡的连续轨迹 | Cellarity转录组建模、scFoundation
L2 基因调控网络 扰动传播(Perturbation Prediction) | 敲除基因A后B/C/D的变化,CRISPR模拟 | GEARS、xTrimoSCPerturb、STATE
L3 药物响应 化合物→细胞状态映射 | 转录组、活力、毒性、耐药、协同 | Tahoe-x1、X-Cell、ChemCPA
L4 细胞命运 长期轨迹建模 | 干细胞分化方向、CAR-T耗竭、耐药演化 | 谱系追踪+轨迹推断模型
这四层的商业价值密度不同:L2/L3是当前融资与论文的密集区(因为Perturb-seq数据可标准化、可基准测试),L1是Cellarity等公司管线价值的来源,L4是细胞治疗赛道的长期方向,但数据最稀缺。
需要同时记录这一技术架构的边界:当前绝大多数模型消费的核心模态是转录组——即基因表达的一个快照向量。而细胞真实状态由蛋白质丰度与磷酸化、代谢物、染色质可及性、空间邻域关系共同定义,转录组只是这些层级的上游代理变量。翻译效率与蛋白降解速率的非线性,意味着mRNA层面"没有变化"不等于蛋白层面"没有变化",反之亦然。GigaTIME代表的空间蛋白组学路线、以及VCC 2026年计划引入的多组学与时空动态任务,正是对这一单模态局限的补课。因此对L1–L4任何一层输出的解读,都应默认携带"转录组代理误差"这一系统性的不确定性注脚——这是所有厂商演示视频中不会说明、但尽调时必须追问的技术细节。
3.2 数据基座:谁拥有数据,谁拥有模型
▲ 核心数据基座规模对比
虚拟细胞是数据密集度远超蛋白结构预测的赛道——AlphaFold只需要17万条PDB结构,而一个细胞的状态由约2万个基因的表达向量定义,扰动空间是"化合物×细胞类型×剂量×时间"的四维乘积。24个月内数据供给侧发生了数量级跃迁:
▪ - Arc Virtual Cell Atlas(2025年2月首发):聚合观测与扰动数据超6亿细胞,是该领域事实上的公共数据基座,CC0协议完全开放。
▪ - scBaseCount(Arc):以AI代理流水线自动清洗SRA原始数据,收录超5亿细胞、21个物种、72种组织,持续更新。
▪ - Tahoe-100M(Tahoe Therapeutics,2025年2月开源):全球最大药物扰动单细胞数据集,1亿个细胞、50种癌细胞系、约1,100种小分子、约6万个药物扰动实验,由Mosaic平台与Parse Biosciences/Ultima Genomics合作生成。这是"扰动数据商品化"的标志性事件——一家融资仅4,200万美元的公司,用数据开源换来了行业公共品地位。
▪ - GeneCompass(中科院动物所李鑫团队):基于超1.2亿个跨物种单细胞转录组预训练,2025年10月开源,是跨物种数据整合路线的代表。
▪ - 私有数据:Cellarity积累了4,500万单细胞转录组的专有库;Altos Labs在挑战赛中动用约700万个手工策划的高质量私有细胞赢得通用奖。
数据格局呈现清晰的"公共基座+私有纵深"双层结构:公共数据决定模型的下限,私有、高信噪比、带湿实验闭环的数据决定护城河。Altos Labs在VCC中的获胜路径(7M精选私有细胞+流匹配生成模型)证明:在当前阶段,数据策划(curation)质量比模型参数量更稀缺。
3.3 模型格局与残酷的性能现状
2025年6月26日,Arc研究所在《Cell》发表评述文章,正式发起首届Virtual Cell Challenge(VCC),被视为"细胞生物学的图灵测试"。赛事数据最终定格为:5,121个注册、4,325支队伍、114个国家、13,781次提交、338支队伍进入决赛。任务设定极具穿透力:在人类胚胎干细胞系H1上用CRISPRi抑制300个基因、生成约30万细胞的金标准数据,训练/验证/测试集分别为150/50/100个扰动,核心考察跨细胞类型的少样本泛化。
结果提出了一个全行业都必须面对的判断:
排名/奖项 | 团队 | 技术路线 | 核心启示
总分第一($100,000) BioMap百图生科(BM_xTVC) | xTrimoSCPerturb基础模型+统计特征+生物学先验 | 多模态基础模型+先验融合有效,但纯AI不够
总分第二($50,000) XLearning Lab(天府锦城实验室彭玺团队) | — | 中国学术团队跻身全球前列
总分第三($25,000) Outlier(芝加哥大学等) | Wilcoxon检验、伪批量、距离度量校准——经典统计为核心 | 统计方法仍在头部
通用奖($100,000) Altos Labs(Cleopatra/go-with-the-flow) | 流匹配生成模型+约700万精选私有细胞 | 数据策划质量击败参数规模
赛事中途暴露了更根本的问题:部分队伍通过优化"预测平均表达"压低MAE指标,Arc被迫临时增设通用奖(Generalist Prize)。Hani Goodarzi在NeurIPS 2025总结中的表述值得全文引用:"纯端到端神经网络尚未跑赢混合模型。我们还没有到达'简单堆参数就能变好'的阶段,需要更聪明地整合生物学先验。"夺冠的百图生科官方评论口径一致:"纯AI方法未能稳定优于统计基线。"
外部学术证据同样冷峻:Ahlmann-Eltze等人在《Nature Methods》发表的外部基准(DOI 10.1038/s41592-025-02772-6)显示,scGPT、scFoundation、GEARS等五个主流单细胞基础模型,在单基因与双基因扰动预测上未能稳定击败一个"不做任何改变"(no-change)的线性基线;scPerturBench(27种方法、29个数据集)的结论相同——通过细胞上下文嵌入利用先验知识的领域归纳偏置,持续战胜参数量。
产业侧的性能进展则提供了希望的一面:Xaira于2026年初发布的X-Cell(49亿参数)在Tahoe-100M药物扰动预测上取得Pearson 0.31,显著优于Arc STATE模型的0.22,核心指标最高提升5倍。但必须诚实地指出:0.31的皮尔逊相关系数,距离"可用作决策依据"的0.7–0.8区间仍有相当距离。最好的模型也只解释了约三分之一的相关性。
▲ 代表玩家累计融资与扰动预测性能现状
本节结论:虚拟细胞的技术栈(数据、模型、基准、赛事)在24个月内完成了从零到一的搭建,速度与AlphaFold时期相当;但模型能力停留在"能排序、不能定量"的阶段——排序能力足以支撑靶点优先级与实验筛选(价值1的产品形态),定量能力不足以支撑毒性终判与临床试验替代(价值4的产品形态)。这一性能-价值错配,是判断当前任何一家AIVC公司商业模式可行性的第一性标尺。
4独特价值:AIVC解决AIDD无法解决的问题
4.1 理解疾病,而非理解蛋白
传统AIDD的知识表示是"疾病→靶点→分子"的线性链,靶点即一个基因。虚拟细胞的知识表示是"疾病→网络→细胞状态→轨迹→干预节点",寻找的是主调控因子(Master Regulator)、网络枢纽(Network Hub)与临界转变点(Critical Transition Point)——即真正驱动疾病状态转移的关键节点,而不是表达量变化最大的基因。这两者的差异不是精度差异,而是类别差异:一个基因可以在疾病中高表达却毫无因果作用,也可以在稳态中低表达却是状态转移的总开关。Cellarity的底层方法论正是前者向后者的迁移:不问"抑制哪个靶点",而问"把细胞从疾病状态推回健康状态需要什么"。
4.2 AI First Biology:预测实验,压缩实验
虚拟细胞最直接的价值形态是实验预测:以计算筛选替代部分湿实验。量化证据已经出现——Cellarity团队2025年11月发表于《Science》的主动学习框架(active learning framework)显示,其基于转录组与深度学习的化合物筛选算法,在两项血液学发现项目中将表型命中率(phenotypic hit rate)提升了13–17倍,结合"实验室在环"(lab-in-the-loop)签名修正再提升2倍。这不是PPT里的愿景数字,是同行评议的、已在自研管线中复用的筛选效率增益。用户框架中"100万个扰动,AI筛掉99%,实验验证1%"的描述,与该数据在同一数量级上互相印证。
4.3 数字孪生细胞:从人群药到个体药
GigaTIME提供了数字孪生路线迄今最有说服力的真实世界验证。微软研究院联合Providence Genomics与华盛顿大学开发的该框架,用4,000万个配对细胞训练H&E病理切片到21通道多重免疫荧光(mIF)的跨模态翻译,随后应用于Providence医疗系统51家医院、14,256名癌症患者的常规病理切片,生成约29.9万张虚拟mIF图像,覆盖24种癌型、306个亚型,在没有增加任何实验成本的前提下识别出1,234个显著的蛋白-临床标志物关联;在TCGA的10,200名独立患者上外部复现,癌亚型层面Spearman相关系数0.88。2026年1月该工作发表于《Cell》(doi: 10.1016/j.cell.2025.11.016),模型开源。
GigaTIME的深层含义在于:它证明"虚拟化"不仅能省实验的钱,还能激活存量数据资产——全球医院病理科积压数十年的H&E切片,在虚拟mIF能力出现之前是沉没数据,现在是肿瘤免疫微环境的可挖掘金矿。数字孪生细胞的第一个规模化商业场景,可能不是"为每个患者建模",而是"把历史样本变成数据"。
4.4 从静态快照到动态电影
时间维度是AIVC与既往所有生物信息学工具的分水岭。传统转录组分析输出的是一群细胞在某一时刻的快照(Snapshot),虚拟细胞建模的是状态转移的概率场:给定状态与扰动,推演未来轨迹。这直接对应三个高价值场景——细胞治疗中预测CAR-T的耗竭与体内持久性、 iPSC分化路径设计、以及耐药演化的前瞻干预。时间维度的加入使"药物设计"的语义发生迁移:不再是设计一个结合口袋的钥匙,而是设计一条状态转移路径。这正是"生物状态优化(Biological State Optimization)"的确切含义。
本节小结:虚拟细胞的独特价值不是"更好的AIDD",而是覆盖了AIDD结构性失明的四类问题——疾病网络因果、实验结果预测、个体化细胞建模、动态演化推演。每一类问题都有至少一个经过同行评议的量化证据支撑(Cellarity 13–17倍命中率、GigaTIME 1,234个关联与0.88外部复现度),这使AIVC区别于多数"AI+X"叙事的地方在于:价值主张已经有临床前证据,正在等临床证据。
5应用方向与商业化验证
5.1 六大应用方向的成熟度分层
应用方向 | 机制 | 成熟度 | 证据与代表
靶点发现(Master Regulator识别) 从状态转移中找因果节点 | P0,已验证 | Cellarity经平台发现的DCN1靶点进入I期
药物响应预测 化合物→细胞状态映射 | P0,临床前可售 | X-Cell/STATE/Tahoe-x1,Pearson 0.22–0.31
表型筛选(Phenotypic Screening) 转录组+AI设计化合物筛选 | P0,13–17倍效率增益 | Cellarity《Science》2025
联合用药设计 模拟Drug A+B+C协同/拮抗 | P1,数据起步 | ComboSciPlex等组合扰动数据集(63,378细胞、25种双药条件)
CRISPR方案设计 基因编辑→表型预测 | P1,受59%沉默扰动制约 | VCC 2025即为该任务的国际基准
细胞治疗与精准医疗 分化/耗竭/持久性预测;患者虚拟细胞 | P2,长期方向 | 耀速科技(3D细胞+AI)、国内多家布局
成熟度分层的含义直接指向商业化:靶点发现与药物响应预测是当前唯一能收钱的两个方向,前者以管线授权(licensing)变现,后者以SaaS/数据服务变现;联合用药与CRISPR设计处于"能演示、难收费"的阶段;细胞治疗与患者级数字孪生是2030年后的期权。
5.2 三个商业化验证案例
案例一:Cellarity——"细胞状态校正"药物的临床验证。 Flagship Pioneering 2019年孵化,累计融资2.74亿美元(含2024年1.21亿美元C轮),自有4,500万单细胞转录组库。其平台从骨髓纤维化患者的单细胞测序图谱出发,发现DCN1——一个此前从未被探索的球蛋白开关相关靶点,由此设计出first-in-class口服DCN1抑制剂CLY-124,用于镰刀型贫血。临床前数据优于羟基脲、接近基因疗法水平的胎儿血红蛋白诱导,且无细胞毒性。CLY-124已进入I期概念验证研究,28天数据预计2026年Q4读出——这是全球第一个由"细胞状态"范式发现并推进至临床的分子,其数据读出将是整个AIVC赛道的成色试金石。管线纵深还包括骨髓纤维化(JAK2V617F选择性靶向,2026年Q4提名开发候选物)以及与诺和诺德合作的MASH项目。另值一提:其ToxPredictor框架针对药物性肝损伤(DILI,每年给每家大型药企造成约3.5亿美元损失)的预测能力,直接对应了2.1节中约30%的毒性失败原因。
案例二:Xaira Therapeutics——资本定义的范式公司。 2024年由ARCH Venture Partners与Foresite Labs牵头成立,集结斯坦福学者与罗氏、辉瑞前高管,首轮融资10亿美元。2026年春节后发布49亿参数虚拟细胞模型X-Cell,在Tahoe-100M上Pearson 0.31(STATE为0.22),并用不到一年时间完成了对行业标杆性能的超越。Xaira的存在证明两件事:顶级美元基金已经用真金白银为"虚拟细胞是AI制药第二阶段"投票;且这条赛道的资金门槛(10亿美元级)已经把竞争从初创游戏升维为巨头游戏。
案例三:Tahoe Therapeutics——数据即商业模式的极端实验。 前身Vevo Therapeutics,2022年12月种子轮1,200万美元、2025年8月3,000万美元,累计仅4,200万美元,估值1.2亿美元。其策略是以开源Tahoe-100M换取行业公共品地位与生态绑定,再以Mosaic平台的私有数据生成能力寻求独家战略合作(计划锁定一家大型药企或AI公司)。2026年初与Alloy Therapeutics成立ADC合资企业,2025年10月发布30亿参数模型Tahoe-x1,2026年6月发布轻量化模型Rhaister,并研发打通"数据生成→模型预测→智能体验证"闭环的自主研究智能体Tara。Tahoe证明了小资本在赛道中的生存路径:不做药、不做通用模型,做稀缺数据的生成与变现。
三个案例并置,可以读出商业化验证的共同时间结构:2025年是数据与模型年(Tahoe-100M、Tahoe-x1、X-Cell、VCC),2026年进入临床与真实世界年(CLY-124 I期数据、GigaTIME人群验证、TRIALSCOPE试验模拟),2027年起进入"数据读出定生死"的阶段。与典型AI制药叙事不同的是,AIVC赛道的第一个生死判据不是分子能否成药,而是扰动预测能力能否在更复杂的基准(组合扰动、跨细胞类型零样本)上保持量级提升——如果2026年VCC上最优Pearson仍停留在0.3量级,平台型与数据型公司的估值都将面临系统性下修;如果跃升至0.5量级以上,临床前工具类收入的放量会先于任何临床数据到来。
5.3 四种商业模式的结构比较
商业模式 | 变现方式 | 代表 | 资本门槛 | 关键风险
管线型(AI制药本体) 自研管线授权/权益分成 | Cellarity、Xaira | $1B级 | 临床失败一票否决
数据型 高通量扰动数据生成与独家合作 | Tahoe | ~$50M | 被药企自建实验室替代
平台型(OS) 模型API/订阅/共同开发 | 百图生科、GenBio AI | $500M级 | 模型性能未达决策级
垂直服务型 临床前药效评价、CRO+AI | GENESIGHT、西湖欧米 | 低 | 天花板受限
6全球竞争格局:美国定义范式,中国扎进应用
6.1 美国阵营:范式与标准的定义者
美国阵营的梯队结构清晰:标准层是Arc Institute(虚拟细胞挑战赛+图谱+STATE模型,一家非营利机构同时定义了数据、指标与基线,事实上成为行业标准化组织);资本层是Xaira($1B)与Cellarity($274M);数据层是Tahoe与Altos Labs;巨头层是微软(GigaPath→GigaTIME→TRIALSCOPE的三层技术栈已覆盖"病理基础模型→虚拟空间蛋白组学→试验模拟",2026年4月更在《Cell》发表评述,主张生成式模型是肿瘤学的下一个关键能力)与NVIDIA($50M投资Recursion、赞助VCC,卡位算力层)。
6.2 中国阵营:深度参与标准竞争,应用路径发散
中国在2025年VCC上完成了一次标志性胜利——百图生科xTrimoSCPerturb从114国4,325支队伍中夺得总分第一(其xTrimo V4全模态生命科学基础模型参数量达2,680亿),天府锦城实验室彭玺团队获亚军,广西医科大学联队进入全球前5%。产业侧,2026年4月以来国内发生近10起融资,红杉、君联资本、BV百度风投、国信创投入场:
中国玩家 | 技术底座 | 差异化路径 | 融资状态
百图生科(百度系) xTrimo V4,2,680亿参数,七大模态 | 通用平台型,"给药企造操作系统" | 持续投入,VCC冠军背书
百曜科技(GeneCompass) 中科院1.2亿细胞跨物种模型 | 模型开源+产业转化 | 2025年10月数千万天使轮,2026年6月BV入股
无界进化(晶泰系) 晶泰前AI算法负责人创立 | 虚拟细胞模型OCOO-T,三大扰动基准SOTA | 2026年6月数千万天使轮
腾讯(生命科学实验室) CD-GPT(2024)、UniPert-G2CP(2026年8月登《Cell》) | 统一扰动建模框架+投资晶泰 | 巨头自研
GenBio AI(宋乐,前百图生科首席AI科学家) AIDO.Cell-100M | 通用细胞基础模型 | 海外创业
耀速科技(Xellar) 3D细胞+高内涵成像+AI | 器官芯片×虚拟细胞交叉 | 已完成融资
西湖欧米(郭天南团队) 蛋白质组学驱动 | 多组学整合建模 | 已完成融资
GENESIGHT — | 避开拥挤的靶点/分子设计,聚焦临床前药效评价 | 2025年8月成立,种子轮数千万
华源智因/Vitaura/INFevo/DeepCell 各异 | iPSC细胞治疗/底盘细胞/分子交互底层 | 早期
6.3 格局判断
竞争格局呈现三个不对称。第一是资本不对称:Xaira一家等于中国全赛道总融资的数倍,美元资本对范式类资产的下注强度远超人民币资本,后者明显偏向应用型与CRO服务型项目。第二是标准不对称:Arc Institute同时掌握数据(Atlas)、基准(VCC)与基线模型(STATE),全球团队(包括中国冠军)都在其定义的赛道上比赛——百图生科的胜利证明中国团队有标准竞争能力,但标准制定权仍在美方。第三是路径不对称:中国玩家在器官芯片(耀速)、临床前评价(GENESIGHT)、底盘细胞(INFevo)等应用层的布局密度高于美国,这与 Oliver 此前跟踪的"中国AI制药去OS化"判断一致:美国做操作系统,中国找落地场景——优势是现金流近,风险是若基础模型层被少数玩家锁定,应用层的议价能力会随时间衰减。
人才网络数据为"百度系是中国虚拟细胞黄埔军校"这一判断提供了具体注脚:百图生科前首席AI科学家宋乐创立GenBio AI并发布AIDO.Cell-100M;华源智因CTO王艺璇此前供职于百图生科;VCC夺冠模型xTrimoSCPerturb的底层能力源自刘维团队七年多模态数据整合路线;而以GeneCompass起家的百曜科技则由中科院团队主导、获BV百度风投入股——百度在"下场做模型、输送行业人才、投入真金白银"三个维度全部占位,是观察中国虚拟细胞技术扩散路径的最佳样本。晶泰体系同样在复制这一裂变逻辑(其创新中心AI算法负责人赵亚龙创立无界进化,OCOO-T模型在三大扰动基准上达到行业最优)。对二级市场跟踪者的含义:中国虚拟细胞的人才谱系高度集中于两三个源头机构,源头的任何技术路线修正(例如从纯基础模型转向混合架构),会在6–12个月内传导至整个创业群体的叙事重心。
7与AI Drug Discovery的协同闭环
7.1 七环节闭环:虚拟细胞覆盖全流程
用户框架中提出的协同闭环判断,可细化为如下研发流程映射:
研发环节 | AIDD贡献 | AIVC贡献 | 协同形态
疾病建模 — | 状态空间建模、轨迹分析 | AIVC主导
靶点发现 蛋白结构可用性筛选 | Master Regulator/网络枢纽识别 | AIVC提出候选,AIDD验证可药性
分子设计 生成模型、分子优化 | — | AIDD主导
先导优化 QSAR、性质预测 | 细胞层响应反馈(转录组水平药效) | 双向迭代
毒性预测 ADMET、hERG | 细胞层脱靶、组织层毒性(ToxPredictor类) | 互补
耐药预测 — | 耐药演化轨迹模拟 | AIVC独有
联合用药 — | 协同/拮抗模拟 | AIVC独有
闭环的关键在于双向性:AIVC为AIDD提供"分子进入细胞后会发生什么"的反馈信号,使先导优化从"性质驱动"升级为"性质+细胞响应"双驱动;AIDD为AIVC提供扰动工具箱与可药性约束,防止虚拟细胞推荐生物学上正确但化学上不可成的干预。Cellarity的DCN1案例是闭环已跑通的最强证据:从疾病细胞状态分析出发发现靶点(AIVC环节),再由化学平台设计出first-in-class抑制剂(AIDD环节),最终进入临床。
7.2 协同的经济账
市场规模数据为协同效应提供了量化背景:全球AI药物发现市场2024年约18.6亿美元,预计以29.9%的CAGR增长至2034年约252.2亿美元(Data Insights Market口径);较保守的The Business Research Company口径为2025年23.3亿美元、2030年74.2亿美元(CAGR 26.2%)。更宏观的药物发现整体市场2035年将达约1,587亿美元(Precedence Research)。值得注意的是,18家大型药企的专利分析显示86%的靶点化合物集中在少数被充分研究的机制上——行业的靶点枯竭是结构性的,而虚拟细胞对网络暗物质(未被研究的基因、非编码区域、状态依赖性靶点)的挖掘能力,恰好对准了这一增长瓶颈。AIVC对AIDD市场的作用不是切分存量,而是扩大可及靶点宇宙的增量。
7.3 "操作系统"判断的技术依据
用户框架将AIVC定位为AIDD的上层操作系统(OS),本报告认为该判断在技术上成立,但需加一个时间条件。成立依据:虚拟细胞消费的是AIDD产出的分子(以SMILES/结构输入),输出的是AIDD所需的一切细胞层信号(药效、毒性、耐药、联药),接口标准化程度随Tahoe-100M等基准数据集的普及而提高——这正是OS的"承上启下"结构。时间条件的含义是:在模型Pearson从0.31爬向0.6+之前,OS只能加载"排序类"应用(筛选、优先级排序),加载不了"决策类"应用(终判、替代实验)。 百图生科"给药的人造一套操作系统"的定位表述,与NVIDIA在AI制药中"算力OS"的角色类似——操作系统卡位战的胜负,将决定未来十年药企与AI公司的价值分配比例。
8冷思考:三个不能回避的问题
问题一:性能缺口与数据噪声的同源性。 当前最好的模型只解释约1/3的扰动相关性(Pearson 0.31),而数据端有59%的基因扰动本无转录组信号(Replogle 2022)。两个数字指向同一个结构性约束:单细胞RNA-seq固有的dropout、批次效应与弱扰动信号,使得"更多参数"无效——VCC冠军与《Nature Methods》基准均确认混合架构与先验整合优于端到端扩展。对投资者的含义:评估AIVC公司时,模型参数量是负向指标,私有高信噪比数据规模与湿实验闭环是正向指标。 2026年VCC将引入组合扰动、跨细胞类型零样本泛化与多组学任务,届时性能天花板有望上移,但2027年前不应期待"决策级"模型。
问题二:细胞不是患者。 虚拟细胞在最优情况下模拟的是"一种细胞对一次扰动在单一时间点的转录组响应",而患者是"多细胞类型×多月用药×合并用药×免疫历史×遗传背景"的复合系统。Standard Model的分析一针见血:这不是规模问题,是品类问题——Perturb-seq能在一个实验中生成数千个干净标记的扰动-响应对,而患者治疗数据是每人一条长程、右删失、混杂的轨迹。由此推论:AIVC的兑现顺序必然是"临床前工具→临床前决策→试验设计优化→患者级应用",任何跳过临床前验证直接讲患者数字孪生故事的公司,其时间表应至少外推五年。 微软GigaPATH→GigaTIME→TRIALSCOPE的三层递进,是这一兑现顺序的正确示范。
问题三:数据护城河的脆弱性与法律风险。 Tahoe前身为Vevo Therapeutics,2025年4月因法律诉讼被迫更名——细节虽未完全公开,但足以说明数据权属、平台命名与合作排他性已进入诉讼级争议。公共数据(Atlas 6亿细胞)的完全开放与私有数据的高定价并存,意味着数据护城河的可持续性取决于"生成速度的复利",而非存量本身。中国赛道另有独有问题:几乎全部玩家处于天使轮/种子轮,若2026–2027年行业出现第一起标志性临床失败(如CLY-124数据不及预期),资本退潮的速度可能与其涌入速度同样惊人——虚拟细胞当前的融资热度领先技术成熟度约一个hype cycle,这正是互联网泡沫研究框架下"基础设施先行、应用后置"的经典结构。
8.4 投资尽调启示:正向指标与负向指标清单
综合前文全部证据,评估任何一家AIVC公司时,以下清单可作为结构化尽调框架。正向指标(P0级):一是有湿实验闭环——公司是否拥有自建高通量实验室,且模型预测结果能否被快速回测修正(Cellarity的lab-in-the-loop、Tahoe的Mosaic均属此类,这是对冲"模型只解释1/3相关性"这一技术现实的最有效机制);二是私有高信噪比数据规模——不看总细胞数,看"带扰动标签、带剂量梯度、带时间序列"的数据占比;三是有明确的排序类付费场景——靶点优先级排序、化合物筛选这类"AI出候选、人做终判"的产品形态与当前模型能力匹配,收费逻辑成立。正向指标(P1级):进入临床试验的自研管线(提供范式验证的期权价值);标准制定参与度(在VCC等国际基准上的排名是模型能力最便宜的第三方背书)。负向指标(P0级):一是以参数量为第一卖点——VCC与《Nature Methods》双重证据表明参数量与扰动预测性能相关性弱,把2,680亿参数当护城河讲给投资人的团队,要么不懂行业,要么在偷换概念;二是跳过临床前直接讲患者级数字孪生故事——时间表至少掺水五年;三是纯依赖公共数据的"套壳"模式——6亿细胞的公共图谱意味着公共数据人人可得,在公共数据上做微调的模型没有护城河。负向指标(P1级):单一指标刷榜(VCC的MAE被操纵事件说明,任何只报单一基准分数的团队都值得警惕)。
该清单隐含的投资时点判断:赛道整体处于"技术可行性已验证、商业化可行性未验证"的窗口期。可比较的历史参照系是2015–2017年的AI影像——同为核心基础设施先行、同有标杆赛事与资本热潮,区分最终赢家的变量也是同一个:是否找到了临床工作流中愿意付费的具体环节。对AIVC而言,这个环节大概率是临床前筛选与靶点优先级排序,而非其叙事中最性感的患者数字孪生。
9结论
AI虚拟细胞是AI制药进入第二阶段的范式升级,其需求原点是临床转化9.6%的成功率中占大头的疗效与毒性失败——这些失败发生在细胞层动态,而分子中心AI对此结构性失明。2024–2026年间,该赛道完成了从概念(Cell评述文)到基础设施(6亿细胞图谱、1亿细胞扰动数据集)到标准(VCC赛事)到资本(10亿美元级融资)到临床验证(Cellarity CLY-124进入I期、GigaTIME万人级真实世界验证)的全栈搭建,速度罕见。
但同一时期积累的负面证据同样重要:纯端到端深度学习未能在挑战赛中击败统计基线与混合模型,最优模型的扰动预测相关性仅为0.31,59%的基因扰动缺乏可测量的转录组信号。这些证据共同指向一个清醒的判断:虚拟细胞当前是优秀的排序工具与靶点假设生成器,尚不是决策级模拟器。
对AIDD而言,AIVC不是竞争者而是操作系统:它消费分子、输出细胞响应,覆盖靶点发现、先导优化、毒性、耐药与联合用药五个AIDD无法自我闭环的环节。竞争优势的归属将不取决于谁能生成更多候选分子,而取决于谁掌握高信噪比的私有数据、湿实验闭环与标准制定权。中国玩家已在标准竞争(VCC冠军)与应用场景(器官芯片、临床前评价、底盘细胞)两端完成卡位,短板在资本强度与基础模型层的长期投入。未来12–24个月的两个观察哨:Cellarity CLY-124的I期28天数据(2026年Q4),与2026年VCC引入组合扰动后的性能上限——前者检验商业模式,后者检验技术天花板。最终目标不是找到一颗更好的药,而是精准重塑疾病细胞的命运,让生命系统回归健康稳态——这句话今天仍是愿景,但它已是一份有临床数据、有基准赛事、有十亿美金资本为之背书的愿景。
10References
[1] Huang K, et al. How AI Virtual Cells Will Revolutionize Biology[J]. Cell, 2024. https://www.cell.com/
[2] Arc Institute. Virtual Cell Challenge[EB/OL]. https://virtualcellchallenge.org/, 2025.
[3] Arc Institute. The Virtual Cell Challenge: A Cell "Turing Test" Comment[EB/OL]. Cell, 2025-06-26. https://www.cell.com/cell/fulltext/S0092-8674(25)00626-8
[4] Tahoe Therapeutics. Tahoe-100M: A Giga-Scale Single-Cell Perturbation Atlas[EB/OL]. https://huggingface.co/datasets/tahoebio/Tahoe-100M, 2025-02.
[5] Arc Institute. Arc Virtual Cell Atlas[EB/OL]. https://arcinstitute.org/tools/virtualcellatlas, 2025.
[6] Ahlmann-Eltze C, Huber W, Anders S. Deep learning-based predictions of gene perturbation effects do not yet outperform simple linear baselines[J]. Nature Methods, 2025. DOI: 10.1038/s41592-025-02772-6.
[7] Replogle J M, Saunders R A, Pogson A N, et al. Mapping information-rich genotype-phenotype landscapes with genome-scale Perturb-seq[J]. Cell, 2022, 185(14): 2559-2575.
[8] Valanarasu J M J, Xu H, Usuyama N, et al. Multimodal AI generates virtual population for tumor microenvironment modeling[J]. Cell, 2026, 189(2): 386-400. DOI: 10.1016/j.cell.2025.11.016.
[9] Szalata A, Doshi P B, Kolchenko S, et al. Active learning framework leveraging transcriptomics identifies modulators of disease phenotypes[J]. Science, 2025-11-27.
[10] BIO, BioMedTracker, Amplion. Clinical Development Success Rates 2006–2015[R/OL]. https://synapse.zhihuiya.com/, 2016.
[11] Cellarity. Cellarity Provides Strategic Priorities and Outlook for 2026[EB/OL]. https://cellarity.com/, 2026-01.
[12] 动脉网. 10亿美金开局,今年这个赛道几乎都融到钱了[EB/OL]. https://www.vcbeathealth.com/article/61393, 2026-08-20.
[13] 医药魔方. 对话百图生科刘维:给做药的人,造一套操作系统[EB/OL]. https://bydrug.pharmcube.com/, 2026-07.
[14] Providence. Novel AI framework anticipated to unlock tumor secrets[EB/OL]. https://blog.providence.org/, 2025-12-09.
[15] Microsoft Research. The Next Frontier of Oncology: Generative Models Perspective[EB/OL]. Cell, 2026-04.
[16] Data Insights Market. AI Drug Discovery Market Report[R/OL]. https://www.datainsightsmarket.com/reports/ai-drug-discovery-1440683, 2025.