每年有90%的药物在临床试验中失败。大部分原因不是靶点选错了,而是——在培养皿里有效的分子,到了人体中完全变了样。如果能在计算机里先模拟一遍,会怎样?
虚拟细胞(Virtual Cell)——在计算机中构建一个细胞的数字副本,能模拟基因、药物、环境扰动对细胞状态的影响——这个听起来像科幻的概念,正在成为生物学最前沿的战场。
2021年至今,Arc Institute(6.5亿美元)、Altos Labs(30亿美元)、Xaira Therapeutics(10亿美元+)相继成立,CZI和NVIDIA宣布联合投入数十亿美元。2025年首届Virtual Cell Challenge在NeurIPS举办。2026年4月,Syn3A 4D全细胞模型在Cell发表,细胞周期模拟误差小于2分钟。一、什么是虚拟细胞?
想象你是一位细胞生物学家。你敲除一个基因,等48小时,然后测序,发现200个基因表达发生了变化。但问题是:哪些变化是直接由敲除引起的?哪些是间接的?哪些是代偿性的?
传统实验无法回答这个问题。你只能做更多的实验:敲除→测序→分析→假设→再敲除。一个典型的药物开发项目从靶点发现到临床批准,平均耗时10-15年,花费10-26亿美元。约90%的药物在临床试验中失败,其中大部分是因为在实验室模型中表现良好的药物,在人体中无效或有毒副作用。
虚拟细胞(Virtual Cell)试图解决这个问题。它的核心承诺是:在计算机中构建一个细胞的数字副本,能够模拟基因、药物、环境扰动对细胞状态的影响,从而使研究人员可以在"湿实验"之前进行"干实验"筛选。
但这不仅仅是一个"生物仿真器"。虚拟细胞的目标是:1. 预测:给定一个扰动(药物、基因敲除、环境变化),细胞状态会如何变化?2. 解释:这种变化是通过什么分子机制产生的?3. 生成:如何设计一个扰动,使细胞从"疾病状态"转变为"健康状态"?两条技术路线
在虚拟细胞的发展史上,始终存在两条并行的技术路线:
特征机制驱动(白盒)数据驱动(灰盒/黑盒)方法论物理/化学方程(ODE/PDE/SSA)深度学习(Transformer/VAE/扩散模型)先验知识需要生化反应速率、分子结构等从大数据中自动学习可解释性高——每个参数有物理意义低——需借助可解释性工具数据需求需要精确的生化参数需要海量组学数据扩展性难——手动建模每个分子相对容易——可端到端训练代表VCell, Vivarium, Syn3A 4DscGPT, Geneformer, State, Evo 2局限参数化困难,无法覆盖全基因组可能学到的只是相关性而非因果性
两条路线正在融合。机制驱动的模型提供可解释的因果骨架,数据驱动的模型提供大规模参数学习和填补盲区的能力。2024年Cell综述提出的人工智能虚拟细胞(AI Virtual Cell, AIVC)概念,正是这种融合的蓝图。核心难点:多尺度 × 多模态 × 动态性
(1)多尺度(Multi-scale)
一个细胞中的分子过程跨越6个数量级的空间尺度和12个数量级的时间尺度:• 原子/分子尺度:Å(10⁻¹⁰ m),飞秒级(10⁻¹⁵ s),化学键形成/断裂• 蛋白质/核酸:nm(10⁻⁹ m),微秒-毫秒级(10⁻⁶~10⁻³ s),构象变化、酶催化• 分子复合物:10-100 nm,毫秒-秒级,核糖体组装、信号复合物• 亚细胞结构:0.1-1 μm,秒-分钟级,线粒体融合、囊泡运输• 细胞:1-100 μm,分钟-小时级,细胞周期、分裂• 组织:mm-cm,小时-天级,细胞迁移、组织形成
没有任何一种数学方法能同时覆盖所有尺度。ODE适合代谢网络,SSA适合基因表达,PDE适合扩散,Brownian动力学适合分子拥挤。全细胞建模的核心挑战之一就是混合算法的协同。
(2)多模态(Multi-modal)
细胞系统包含多个信息层,每个层的数据都有不同的技术特征:
模态数据类型通量信噪比单细胞水平基因组(DNA)离散序列全基因组高可行(scWGS)表观组(ATAC/甲基化)峰信号/甲基化率全基因组中可行(scATAC-seq)转录组(RNA)计数20,000+基因中-高成熟(scRNA-seq)蛋白组丰度5,000~10,000蛋白中有限(scProteomics)PTM修饰位点丰度100+修饰类型低极有限代谢组代谢物浓度数百~数千中有限成像像素/体素高通量中可行(显微成像)
关键盲区:当前虚拟细胞研究几乎完全以转录组为中心。蛋白组覆盖不足,PTM几乎完全缺失。
(3)动态性(Dynamics)
细胞不是静态的。基因表达在振荡,信号通路在切换,细胞在移动和分裂。但大多数单细胞数据是快照——每个细胞在一个时间点被破坏测序,无法追踪同一个细胞随时间的变化。
RNA速度(RNA velocity)通过剪接和未剪接mRNA的比例推断短期方向(La Manno et al., Nature 2018),最优传输(Optimal Transport)通过比较不同时间点的细胞群体分布推断长期轨迹(Schiebinger et al., Cell 2019),但这些都是推断而非观测。真正的细胞动力学建模仍然是开放问题。为什么现在?虚拟细胞在2024-2026年爆发的驱动力
驱动力一:单细胞组学数据的指数增长。2016年,第一个大规模单细胞RNA测序数据集只有几千个细胞。到2024年,CZI CELLxGENE数据库已经收录了超过5,000万个人类细胞数据。Arc Institute的Virtual Cell Atlas达到了6亿+细胞。Tahoe Therapeutics的Tahoe-100M数据集包含了1亿个药物处理后的单细胞转录组。数据是AI模型的燃料,现在燃料足够多了。
驱动力二:基础模型架构的成熟。GPT/Transformer架构在NLP和CV领域证明了规模定律——模型越大、数据越多,性能越好。单细胞生物学家敏锐地意识到:细胞和基因也是"语言"——DNA是4字母的序列,RNA表达是20,000维的向量,细胞类型是离散的标签。Transformer恰好擅长处理这种结构化序列数据。
驱动力三:算力可用性。NVIDIA H100 GPU的普及使得训练40B参数的模型(Evo 2)成为可能。CZI专门建立了非营利生命科学领域最大的计算系统之一,用于训练虚拟细胞模型。
驱动力四:商业和资本驱动。药物研发的90%临床失败率意味着巨大的市场空间。如果虚拟细胞能将药物发现效率提升10%,每年节省的研发费用超过100亿美元。Arc Institute($650M)、CZI(数十亿)、Altos Labs($3B)、Xaira($1B)等大量资本涌入。二、数学基础:细胞建模的核心方程确定性与随机性
细胞是大量分子的集合。当一个化学物种的数量很大(>10³-10⁴)时,随机波动平均化,可以用确定性方程描述。当分子数量很少(<10²,如转录因子、mRNA)时,随机波动本身成为系统行为的一部分,必须用随机方程描述。
经验法则:在代谢网络中(代谢物浓度通常为μM级别,对应~10⁶分子/细胞),确定性模型足够。在基因表达中(mRNA拷贝数通常为1-100),随机模型是必须的。确定性动力学:常微分方程(ODE)
对于一个包含n个化学物种、m个反应的系统,运动方程是:dx/dt = S·v(x, p),其中S是化学计量矩阵(stoichiometric matrix),v是反应速率向量。质量作用定律是最基本的反应速率形式:对于反应A+B→C,v=k·[A]·[B]。Michaelis-Menten酶动力学是更常见的近似:v=Vmax·[S]/(Km+[S])。
应用场景:代谢网络、信号转导通路、细胞周期调控。随机动力学:化学主方程与Gillespie算法
当分子数量有限时,系统的状态由分子拷贝数的概率分布描述。化学主方程(CME):∂P(n,t)/∂t = Σ[a_j(n-S_j)P(n-S_j,t)-a_j(n)P(n,t)]。CME是高维PDE,只在极少数情况下可以解析求解。
Gillespie随机模拟算法(SSA)(Gillespie, J. Phys. Chem. 1977)提供了精确的数值采样方法:1. 计算所有反应的趋势函数a_j = h_j·c_j2. 计算总趋势a_0 = Σa_j3. 生成指数分布的时间步长τ = -ln(r₁)/a₀4. 选择发生哪个反应5. 更新分子拷贝数,推进时间t→t+τ,重复
应用场景:基因表达(转录/翻译/降解)、小分子信号通路、细胞命运决定。空间建模:反应扩散方程
当分子的空间分布不均匀时,必须考虑扩散。反应扩散PDE:∂c/∂t = D∇²c + R(c)。有限体积法是VCell中用于求解反应扩散PDE的核心数值方法:将空间离散化为网格,每个网格是"体积元",浓度在网格内均匀,扩散由相邻网格之间的通量来描述。
VCell的具体实现(Loew & Schaff, Trends Biotechnol. 2001):支持1D/2D/3D几何,可从显微镜图像直接导入,使用自适应细化网格,支持膜通量、侧向扩散和电生理。约束建模:通量平衡分析(FBA)
对于大规模代谢网络(>1,000个反应),即使有完整的动力学参数,ODE模拟也面临参数化灾难。通量平衡分析(FBA)通过稳态假设(dx/dt=0),将问题转化为线性规划:max cᵀv,满足S·v=0,v_lb≤v≤v_ub。FBA不预测具体浓度,而是预测代谢通量的分布——即在给定营养条件下,细胞会如何分配代谢资源。混合方法:多算法协同
以Syn3A 4D模型为例(Thornburg et al., 2026):
子系统算法原因代谢网络ODE + FBA代谢物浓度高,确定性可接受基因转录SSA(Gillespie)mRNA拷贝数低(1-50),随机性显著翻译SSA蛋白拷贝数可变DNA复制确定性+事件驱动复制叉前进速率已知三维扩散Brownian动力学需要空间精度膜生长确定性脂质总量大
不同算法运行在不同的时间尺度(从μs到hr),需要高效的事件调度和状态同步。VCell使用混合确定性/随机求解器,Vivarium使用模块化"Process"架构。现代AI工具的数学基础
Transformer自注意力(scGPT, Geneformer的核心):Attention(Q,K,V)=softmax(QKᵀ/√d_k)V。在单细胞模型中,每个基因是一个token,基因表达值是token的嵌入,注意力机制捕捉基因之间的相互作用关系——这是一个隐含的基因调控网络学习过程。
变分自编码器(VAE)(scVI, scANVI, totalVI的核心):L_ELBO = E[log p(x|z)] - KL(q(z|x)||p(z))。VAE将高维的转录组数据(20,000+维)压缩到低维潜在空间(~10-100维),同时保留生物信息。
scVI的具体形式(Lopez et al., Nature Methods 2018):scVI假设观测到的基因表达计数x_ng(细胞n中基因g的UMI计数)服从零膨胀负二项分布(ZINB):x_ng ~ ZINB(μ_ng, θ_g, π_ng)。这个分布假设相比于标准VAE的高斯假设,更符合单细胞RNA-seq数据的实际统计特性(过度离散、零膨胀)。
扩散模型(CausCell, LCD的核心):扩散模型定义了一个从数据到噪声的前向过程以及从噪声到数据的反向过程。在CausCell中,扩散模型被扩展为条件扩散——生成过程由因果解耦的潜在变量z和条件y控制,使得生成的反事实细胞具有生物学因果一致性。
最优传输(Optimal Transport, OT)(CellOT, 细胞轨迹推断的核心):最优传输寻找从源分布μ到目标分布ν的最小成本映射。Bunne等人将OT扩展到神经最优传输(CellOT)(Bunne et al., Nature Methods 2023),使用神经网络参数化传输映射,使其能够泛化到未见过的扰动条件。
流匹配(Flow Matching):流匹配是生成模型的最新范式,它避免了扩散模型中逐步去噪的计算开销。在细胞动力学建模中,流匹配可以直接学习从初始状态到终态的概率流,无需逐步模拟(Richter et al., Comms. Biology 2026, DOI: 10.1038/s42003-026-09758-w)。
神经ODE(Neural ODE):dh/dt = f_θ(h(t), t)。神经ODE将细胞状态演化建模为连续时间动力系统,特别适合处理不均匀采样的时间点数据(Chen et al., NeurIPS 2018)。各数学框架的对比总结
框架方程类型空间随机性适用场景计算成本ODE确定性,连续无无代谢网络,高浓度低CME/SSA随机,离散无完整基因表达,低拷贝数中-高PDE确定性,连续有无反应扩散,钙信号中FBA稳态,线性无无大规模代谢网络极低Transformer数据驱动无隐式单细胞多模态整合高VAE概率生成无隐式维度压缩,批次校正中扩散模型概率生成无可加噪反事实生成,扰动预测高最优传输分布匹配可选无轨迹推断,跨模态对齐中神经ODE连续动力学无可扩展时间序列建模中流匹配概率流无无细胞状态转换中
三、历史脉络:从E-Cell到AIVC的30年1990s:先驱时代
1996年—E-Cell项目:日本庆应义塾大学(Keio University)湘南藤泽校区,Tomita教授带领一群学生,开始了以Mycoplasma genitalium(当时已知最小基因组生物,580 kb,~470个基因)为目标的虚拟细胞重建项目。这就是E-Cell项目的起源(Tomita et al., Bioinformatics 1999)。E-Cell的核心理念是:将细胞建模为一组反应规则,系统自动将规则转化为微分方程,然后数值积分。到1997年8月,E-Cell已经成功模拟了一个包含127个基因的虚拟细胞——这个细胞可以从葡萄糖生产能量,进行转录、翻译和磷脂合成。虽然这个模型极其简化(没有空间、没有随机性、大部分参数是猜测),但它证明了在计算机中构建一个细胞在原则上是可行的。
1999年—VCell平台:几乎同时,在美国康涅狄格大学健康中心(UConn Health),Leslie Loew教授团队开始了Virtual Cell(VCell)的开发(Loew & Schaff, Trends Biotechnol. 2001)。VCell和E-Cell的设计哲学不同:E-Cell追求全细胞覆盖(即使粗略),VCell追求精确的空间建模——从显微镜图像中导入真实细胞几何形状,在3D空间中进行反应扩散PDE模拟。VCell的核心创新:(1)生物学界面——用户可以画出细胞几何(膜、细胞质、细胞核),指定反应发生在哪里,软件自动生成数学方程;(2)数据库架构——模型和结果存储在中央数据库中,可共享、可复用;(3)从图像到模拟——直接从显微镜图像提取几何。VCell至今仍是空间细胞建模的黄金标准。2026年5月发布的VCell 8.0增加了SpringSaLaD粒子模拟器,实现了介观尺度(mesoscale)的分子拥挤模拟。2000s:工具时代
2003年—SBML标准:系统生物学标记语言(SBML)由Caltech的Hucka团队提出(Hucka et al., Nature Biotechnology 2003, PMID: 12611808),为生化网络模型提供了标准化的XML交换格式。后续版本不断演化(SBML Level 2: Hucka et al., BMC Syst. Biol. 2010),使得模型可以在VCell、COPASI、E-Cell等不同工具之间自由交换,成为虚拟细胞领域的"USB标准"。
2006年—COPASI:COPASI(Complex PAthway SImulator)由UConn和Virginia Tech联合开发(Hoops et al., Bioinformatics 2006),专注于生化网络的模拟与分析。COPASI提供了:确定性ODE模拟、随机SSA模拟(多种Gillespie变体)、稳态分析、通量分析、敏感性分析、参数估计、优化。COPASI没有空间能力,但对非空间生化网络的模拟分析能力业界领先。它至今仍在活跃更新(2024年7月最新版4.44)。2010s:全细胞模型时代
2012年—第一个真正的全细胞模型:Stanford大学Covert实验室发表了Mycoplasma genitalium全细胞模型(Karr et al., Cell 2012)。这是一个里程碑式的成果:覆盖了M. genitalium的所有已知基因功能,整合了28个子模型(代谢、转录、翻译、DNA复制、细胞周期等),使用7种不同的算法(ODE, SSA, FBA, 事件驱动等),能够预测基因缺失对细胞生长速率的影响。关键数字:模型代码约1,000个子程序,参数约1,900个,模拟一个细胞周期约10小时(单核,2012年硬件),预测准确率(基因必需性预测)约80%。这个模型证明了整合多尺度、多算法建模是可行的,尽管计算成本极高。
2015年(开发起始)/2022年(发表)—Vivarium:Covert实验室的Eran Agmon开发了Vivarium框架(Agmon et al., Bioinformatics 2022),将全细胞建模从"单一手工模型"升级为"模块化可组合框架"。Vivarium的核心理念:每个"Process"是一个独立的子模型(代谢、转录、信号等),Process通过"Store"交换状态,引擎自动处理时间同步和调度。这使得不同团队可以独立开发子模型,然后像搭积木一样组合。Vivarium后来被用于Covert实验室的vEcoli(E. coli全细胞模型)和WCM(Mycoplasma genitalium全细胞模型)。
2016年—最小基因组JCVI-syn3.0:J. Craig Venter研究所(JCVI)发表了合成生物学领域的里程碑成果(Hutchison et al., Science 2016):从M. mycoides的~1,000个基因出发,通过反复设计-构建-测试循环,削减到473个基因,确定了生命的最小基因集。这个细胞被命名为JCVI-syn3.0,但存在分裂异常(形态不规则、细胞变大)。
2019年—JCVI-syn3A修复分裂缺陷:为了解决syn3.0的分裂问题,JCVI团队在syn3.0的基础上加回了19个基因(含ftsZ、sepF等细胞分裂关键基因),得到JCVI-syn3A(Pelletier et al., 2021),基因组扩增至543 kbp,含493个基因(452个蛋白编码基因+38个RNA基因)。syn3A恢复了正常的球形形态和稳定分裂能力。syn3A的最小性使其成为全细胞建模的理想目标——只有493个基因,意味着理论上可以逐个参数化所有基因功能。2020s:AI革命
2021年—转折点:2021年发生了几个关键事件:1. Arc Institute成立:Silvana Konermann(Stanford)、Patrick Hsu(UC Berkeley)、Patrick Collison(Stripe CEO)三人联合创办,初始捐赠$650M+,目标是"将生物学变成一门可预测的科学"。虚拟细胞是其核心使命之一。2. CZI宣布虚拟细胞战略:Priscilla Chan和Mark Zuckerberg创办的Chan Zuckerberg Initiative将虚拟细胞作为科学投资的核心方向。3. scGPT预训练首次成功:Bo Wang团队(University of Toronto)首次在百万级单细胞数据上成功预训练Transformer模型。
2023-2024年—单细胞基础模型爆发:
模型年份机构架构训练数据发表Geneformer2023Gladstone Institutes6/12层Transformer30M细胞Nature (DOI: 10.1038/s41586-023-06139-9)scGPT2024University of Toronto12层GPT, 53M参数33M+细胞Nature Methods (DOI: 10.1038/s41592-024-02201-0)scFoundation2024清华大学/百图生科~100M参数50M+细胞Nature Methods (DOI: 10.1038/s41592-024-02305-7)UCE2024CZ BiohubTransformer多物种Nature (DOI: 10.1038/s41586-024-08391-z)scPRINT2025CZI2M-100M参数50M+细胞CZI Virtual Cells Platform
2024年12月—Cell里程碑综述:Bunne, Roohani, Rosen等50+位作者(来自Stanford, Harvard, Google Research, Microsoft Research, CZI, Genentech, EPFL等)在Cell上发表了"How to build the virtual cell with artificial intelligence: Priorities and opportunities"(DOI: 10.1016/j.cell.2024.11.015),正式提出了AI Virtual Cell(AIVC)概念。这篇综述定义了AIVC的核心架构:(1)统一表征(Unified Representation):多模态数据共享的潜在空间;(2)虚拟仪器(Virtual Instruments):操纵/解码/预测的神经网络模块;(3)多尺度集成:从分子到组织的跨层次建模。
2025年—实用化元年:2025年发生了多个里程碑事件:2025年2月,Arc Institute发布Evo 2(40B参数,9.3T碱基,1M上下文窗口,Nature 2026, DOI: 10.1038/s41586-026-10176-5);2025年6月,Arc Institute发布State模型——首个大规模虚拟细胞模型(1.67亿观测细胞+1亿扰动细胞,70种细胞系);2025年6月,首届Virtual Cell Challenge启动(Arc Institute举办,类似CASP的年度竞赛);2025年8月,微软亚洲研究院+同济大学发布CausCell(Nature Communications, DOI: 10.1038/s41467-025-62008-1);2025年10月,CZI×NVIDIA宣布合作加速虚拟细胞模型开发;2025年12月,首届Virtual Cell Challenge结果公布。
2026年—物理模拟回归:2026年4月,Illinois大学和JCVI的联合团队在Cell上发表了Syn3A 4D全细胞模型(Thornburg et al., 2026, DOI: 10.1016/j.cell.2026.02.009)——这不是一个AI模型,而是一个基于物理/化学方程的全细胞模拟,但模拟精度达到了令人震惊的水平:细胞周期误差<2分钟。这一成果提醒了学界:AI不是万能药,基于物理的建模仍然不可或缺。历史脉络总结
1996 ── E-Cell(庆应义塾大学,127基因虚拟细胞)1999 ── VCell(UConn,空间反应扩散建模)2003 ── SBML标准(模型交换格式)2006 ── COPASI(生化网络仿真标准)2012 ── M. genitalium全细胞模型(Covert实验室,Cell)2016 ── JCVI-syn3.0最小基因组(Science)2019 ── JCVI-syn3A修复分裂缺陷2021 ── Arc Institute成立 + CZI虚拟细胞战略2023 ── Geneformer(Nature 2023)2024 ── scGPT / scFoundation(Nature Methods)2024.12 ── Cell综述:AIVC概念正式提出2025.02 ── Evo 2(40B参数基因组模型)2025.06 ── State模型(Arc Institute)2025.08 ── CausCell(因果+扩散,Nature Comms)2025.12 ── 首届Virtual Cell Challenge结束2026.04 ── Syn3A 4D全细胞模拟(Cell)
趋势:从"手工写方程"到"AI学规律"再到"AI+物理融合"——虚拟细胞正在经历辩证的螺旋式发展。
四、机制驱动:全细胞物理建模(白盒)JCVI-syn3A 4D全细胞模型:最小生命的完整数字副本
2026年4月发表在Cell上的JCVI-syn3A 4D全细胞模型(Thornburg et al., 2026)是机制驱动路线的巅峰之作。它首次在四维(3D空间+时间)中完整模拟了一个活细胞的整个生命周期。
为什么选syn3A? JCVI-syn3A是一个合成生物学产物——其基因组被削减到仅剩493个基因,是已知能独立存活的最小基因组。它只有一条环形染色体,没有细胞核,没有内膜系统,没有运动能力。它唯一的任务就是:生长、复制DNA、分裂。这种最小性使得全细胞建模变得可行:493个基因意味着约493个蛋白、约2000个反应——这是一个可以被"手工"参数化的规模。
模型的4大子系统:模型将细胞功能划分为4个耦合的子系统,每个子系统使用最合适的算法:
子系统建模对象分子数算法关键参数遗传信息处理DNA复制、转录、翻译、mRNA降解493个基因SSA(Gillespie)转录/翻译速率、降解速率代谢网络糖酵解、核苷酸合成、脂质合成、能量代谢~400个代谢物ODE + FBA酶动力学参数核糖体生物合成核糖体组装、rRNA合成21种核糖体蛋白确定性+事件驱动组装速率、亚基比例细胞生长与分裂膜生长、染色体分离、收缩环形成膜脂质确定性+空间约束脂质插入速率、生长方向
关键创新:混合算法协同。每个子系统的时间尺度不同:代谢反应毫秒级,分子浓度高(μM级别),用ODE描述;转录事件秒~分钟级,单个mRNA拷贝数1-50,用SSA描述;DNA复制分钟级,复制叉前进速率约500 bp/s,确定性处理;细胞生长小时级,膜面积连续增长,确定性处理。模型使用Lattice Microbes软件作为核心模拟引擎(Roberts, Stone & Luthey-Schulten, J. Comput. Chem. 2013;多GPU加速见Hallock et al., Parallel Comput. 2014),该软件专门设计用于在GPU上加速空间随机模拟。
三维空间中的分子拥挤:syn3A细胞非常小(直径约0.5 μm),内部极度拥挤。蛋白浓度可达约300 mg/mL,是典型大肠杆菌的2倍。这种拥挤效应显著影响扩散速率和反应效率。模型在三维网格中显式模拟了每个分子的位置,考虑了排除体积效应、空间不均匀性(染色体占据核区,核糖体分布在细胞质)、膜结合蛋白的二维扩散。
验证结果:
指标模拟值实验值误差细胞周期时长~100 min~100 min<2 min细胞体积增长指数增长指数增长定性一致染色体复制时间~40 min~40 min一致蛋白数量分布对数正态对数正态定量一致代谢物浓度ODE稳态质谱测量~20%误差
2000次重复模拟中,细胞周期时长的变异系数(CV)与实验测量一致,说明模型不仅捕捉了平均值,还捕捉了随机波动。
局限性:模型并非原子级精度,采用了"平均场"近似。此外:约2000个参数需要实验校准,不包含信号转导(syn3A没有已知的信号通路),不包含PTM(syn3A的蛋白组中PTM位点极少),模拟一个细胞周期需要约8小时(GPU加速)。Vivarium:模块化全细胞建模框架
如果说Syn3A 4D模型是"定制化"的巅峰,那么Vivarium就是"工业化"的尝试。Vivarium由Eran Agmon在Covert实验室开发,其核心理念是模块化、可组合、可复用。
Vivarium的核心只有三个概念:(1)Process:一个独立的子模型,每个Process有自己的状态变量、参数和动力学方程;(2)Store:共享状态空间,所有Process通过Store读写共享变量(如代谢物浓度、蛋白丰度);(3)Engine:调度器,决定Process的执行顺序和时间步长。
Covert实验室的原始M. genitalium全细胞模型(Karr et al., 2012)是耦合紧密的庞大代码库。Vivarium团队首先将其重构为模块化版本,随后进一步开发了E. coli的全细胞模型vEcoli,使得每个子模型可以独立开发、测试和更新,新子模型可以即插即用,不同团队可以并行开发。
Vivarium的局限:模块化带来了灵活性,但也引入了性能开销。Process之间的状态同步需要序列化/反序列化,在高频通信场景中成为瓶颈。此外,Vivarium本身不提供空间建模能力——需要与其他工具(如VCell或Lattice Microbes)集成。VCell 8.0:空间建模的黄金标准
VCell项目自1999年启动以来,一直在持续迭代。2026年5月发布的VCell 8.0是其历史上最大的一次更新。新功能包括:1. SpringSaLaD集成:介观尺度粒子模拟器,将分子表示为"球-弹簧"模型,模拟蛋白质的柔性结构2. Virtual FRAP:荧光漂白恢复模拟,直接从模拟结果生成假想的FRAP实验数据3. 动边界模拟:支持移动边界PDE求解,模拟形状变化中的化学反应4. 基于规则的建模:与BioNetGen的深度集成,允许用户用规则描述具有组合复杂性的信号网络
VCell是唯一同时支持以下所有功能的平台:确定性ODE模拟、随机SSA模拟、空间PDE模拟(1D/2D/3D,任意几何)、混合确定性/随机模拟、粒子模拟(SpringSaLaD)、基于规则建模(BioNetGen)。机制驱动路线的优劣总结
优势:(1)可解释性:每个参数有物理意义,可以追问"为什么是这个结果";(2)因果性:模型直接模拟因果机制,不需要从相关性推断;(3)数据效率:不需要海量数据,关键是参数精度;(4)可验证:每个子模型可以独立进行实验验证。
劣势:(1)参数化灾难:每个反应需要速率常数,大多数在文献中不存在;(2)扩展性差:从493个基因到20,000个基因,难度指数级增长;(3)覆盖不全:信号转导、PTM、细胞间通信等"软"过程难以建模;(4)计算成本高:Syn3A单次模拟8小时,人类细胞可能需要数年。五、数据驱动I:单细胞基础模型(灰盒)什么是单细胞基础模型?
基础模型的概念源自NLP:一个在大规模数据上预训练的通用模型,可以通过微调适应各种下游任务。GPT-4是语言的基础模型,scGPT是单细胞的基础模型。
单细胞基础模型(scFM)的核心假设是:在数百万个细胞的转录组上预训练一个Transformer,模型会学到通用的"细胞语言"——基因之间的调控关系、细胞状态的表示、对扰动的响应模式。然后,这个知识可以被迁移到特定任务上。
scFM的通用工作流:预训练阶段(大规模scRNA-seq数据→自监督学习→基础模型权重),然后微调阶段(目标任务数据→模型微调→特定任务:细胞类型注释/扰动预测/基因网络推断)。scGPT:第一个单细胞GPT
基本信息(Cui et al., Nature Methods 2024, DOI: 10.1038/s41592-024-02201-0):机构:University of Toronto(Bo Wang Lab);架构:12层GPT Transformer,嵌入维度512,8头注意力,53M参数;训练数据:33M+人类细胞(CELLxGENE数据库);开源:https://github.com/bowang-lab/scGPT。
输入表示:scGPT的输入设计非常巧妙。每个基因被表示为三个嵌入的和:Input = Gene_Token_Embedding + Expression_Value_Embedding + Condition_Token_Embedding。Gene_Token:每个基因有一个唯一的token ID;Expression_Value:表达值被分箱为50个等宽区间,每个区间有一个嵌入;Condition_Token:可选的条件信息(如批次、扰动、细胞类型)。
注意力掩码设计:scGPT使用专门设计的双向注意力掩码(specialized bidirectional attention mask)。原始论文明确指出:"Unlike words in a sentence, the order of genes within a cell is interchangeable, and there is no equivalent concept of 'next gene' to predict. This makes it challenging to apply the causal masking formulation from GPT models directly in single-cell domain."因此scGPT的注意力掩码支持gene-prompt和cell-prompt两种生成模式,是非因果的灵活设计。
下游任务表现:
任务数据集指标scGPT基线最佳细胞类型注释多组织F1 score0.920.85 (scVI)批次校正PBMC 10XiLISI0.950.82 (Harmony)多模态整合CITE-seq蛋白相关性0.670.54 (Seurat)扰动预测Norman et al.R²0.630.58 (CPA)
Geneformer:基于秩排序的编码
基本信息(Theodoris et al., Nature 2023, DOI: 10.1038/s41586-023-06139-9):机构:Gladstone Institutes;架构:6/12层Performer(线性Transformer变体),嵌入维度256;训练数据:30M细胞(Genecorpus-30M);设计特色:秩排序编码(Rank-Value Encoding)。
秩排序编码:Geneformer不直接使用表达值,而是将每个细胞中的基因按表达量从高到低排序,然后取前2048个基因作为输入。每个基因的位置(rank)就是它的"值"。这种设计的优势:归一化免疫(不同测序批次、不同测序深度的数据,排序后可比)、异常值鲁棒(极高的表达值不会主导模型)、计算效率高(只需要处理2048个基因而非约20,000个)。但代价是丢失了绝对的表达量信息——两个细胞中同一个基因的rank相同但绝对表达量相差10倍,模型无法区分。
应用亮点:剂量敏感性预测、基因网络推断、染色质动力学。scFoundation(xTrimo):更大规模
基本信息(Hao et al., Nature Methods 2024, DOI: 10.1038/s41592-024-02305-7):机构:清华大学/BioMap(百图生科);架构:约100M参数,非对称Transformer;训练数据:50M+人类细胞;开源:https://github.com/biomap-research/scFoundation。
非对称架构:scFoundation的编码器和解码器不对称。编码器使用更深的Transformer层,解码器使用更浅的层。这种设计假设"编码(理解细胞状态)比解码(生成表达值)更难"。
基因嵌入:scFoundation的一个独特贡献是,它可以用学到的基因嵌入驱动图基方法(如GEARS)的基因网络——将基因嵌入作为节点特征输入图神经网络,在扰动预测任务上取得了最佳性能。scPRINT与基础模型全景
scPRINT(2025, CZI Virtual Cells Platform):架构Transformer,2M-100M参数多版本,训练数据50M+人类和小鼠细胞,特色为零样本基因网络推断,在GENIE3基准上超越所有此前方法。
UCE(Universal Cell Embeddings)(Rosen et al., 2024, Nature DOI: 10.1038/s41586-024-08391-z):训练数据跨物种(人类+小鼠+斑马鱼等),特色为细胞嵌入的对齐,使得不同物种的同类细胞映射到嵌入空间的相近区域。
六模型对比表:
特征scGPTGeneformerscFoundationscPRINTUCEscVI年份202420232024202520242018架构GPTPerformerAsymmetric TFTransformerTFVAE参数53M~30M~100M2M-100M~30M~5M训练数据33M细胞30M细胞50M+细胞50M+细胞多物种~M级输入编码分箱值秩排序原始值原始值概率采样原始值预训练目标掩码预测MLM掩码预测去噪对比学习ELBO零样本扰动有限有限中等有限有限N/A细粒度GRN✓✓✓✓✗✗开源✓✓✓✓✓✓
关键争议:基础模型真的比简单基线更好吗?
2024-2025年,几篇系统的基准测试论文对scFM提出了严肃质疑。
Kedzierska et al.(2025)在Genome Biology(DOI: 10.1186/s13059-025-03574-x)的零样本评估中发现:当在严格的零样本设置下(即训练数据和测试数据来自不同的实验、不同的细胞类型、不同的测序平台)评估scGPT和Geneformer时,简单的线性模型(PCA+线性回归)在多个任务上表现相当或更好。具体来说:在细胞类型分类任务上,scGPT的F1从0.92(分布内)下降到0.45(分布外),简单线性模型在分布外场景下达到了0.43;在扰动预测任务上,scGPT的R²从0.63下降到0.12,而线性模型为0.15。
Ahlmann-Eltze et al.(2025, 预印本2024)在CRISPR扰动预测的基准测试中发现:最先进的深度学习方法(包括GEARS、scGPT、Geneformer)没有系统性超越一个简单的线性模型,该模型假设"扰动效应=目标基因的基线表达×扰动特异性系数"。
为什么深度学习模型会失败?1. 信噪比问题:单细胞RNA-seq数据噪声极高。通常在10,000个检测到的基因中,只有10-100个基因受到扰动的显著影响(效应量>20%)。模型需要从强噪声中提取微弱信号,这本身就是极具挑战性的任务。2. 数据稀缺:扰动组合空间是指数级的。一个有20,000个基因的细胞,单基因扰动就有20,000种,双基因扰动有约2亿种。目前的扰动数据集最多覆盖了几百种扰动,远远不够。3. 批次效应:单细胞数据中,批次效应往往比生物学信号大得多。模型可能学到的是"如何区分批次"而非"如何区分细胞状态"。4. 评估指标问题:R²和Spearman相关度在扰动预测中可能不是合适的指标——如果大多数基因不受影响,模型只需预测"不变"就能获得高R²。
领域的回应:scGPT的作者在后续回应中承认了零样本泛化的挑战,但指出:微调后scGPT仍然优于线性模型;在数据量充足的任务上(如细胞类型注释),scGPT显著更好;基础模型的价值在于表示学习——即使是微调,也需要一个好的起点。
最新的State模型(Arc Institute, 2025, bioRxiv v2, DOI: 10.1101/2025.06.26.661135)声称是"第一个在扰动预测中持续超越线性方法的模型",在Tahoe-100M数据集上,扰动区分能力提升了>30%,DEG识别准确率显著提升。六、数据驱动II:AI虚拟细胞(AIVC)蓝图Cell 2024综述:AIVC的完整架构
2024年12月Cell上发表的Perspective(Bunne et al., 2024, DOI: 10.1016/j.cell.2024.11.015)提出了AIVC的完整蓝图。这不是一个具体的模型,而是一个框架、一个愿景、一份路线图。
AIVC的核心组件:
(1)统一表征(Unified Representation, UR):UR是AIVC的"大脑"。它是一个多模态、多尺度的潜在空间,将来自不同技术(scRNA-seq、scATAC-seq、CITE-seq、成像等)的细胞状态数据映射到同一个向量空间中。UR的关键特性:跨模态对齐(转录组和蛋白组数据映射到同一空间)、跨尺度融合(分子水平、细胞水平、组织水平的信息同时编码)、扰动感知(空间中的方向对应生物扰动)、时间感知(空间中的位置对应发育/疾病时间点)。
(2)虚拟仪器(Virtual Instruments, VI):VI是AIVC的"手和眼"——用于操纵、解码和预测UR的神经网络模块。三种主要VI类型:
VI类型功能输入输出类比Manipulator VI模拟细胞状态变化初始UR+扰动描述目标UR"细胞状态编辑器"Decoder VI从UR生成观测数据UR基因表达/蛋白丰度/图像"测序仪模拟器"Predictor VI预测新条件下的细胞行为UR+条件表型/功能指标"细胞命运预言机"
多尺度集成:AIVC的一个关键设计是跨尺度层次结构:分子尺度→细胞尺度→组织尺度→器官尺度,每个尺度的模型可以独立训练,但共享UR作为"接口"。这使得模型可以跨尺度推理——例如,一个分子扰动可以预测到细胞状态变化,再预测到组织功能变化。
训练策略:三阶段训练——预训练(大量未标记多模态数据,自监督学习)、对齐训练(使用配对数据进行跨模态对齐)、微调(特定任务监督微调)。
Evo 2:基因组基础模型
Evo 2不是AIVC本身,而是AIVC的"基因组层"——在AIVC架构中,它属于分子尺度的基础模型。
基本信息(Brixi et al., Nature 2026, DOI: 10.1038/s41586-026-10176-5):机构:Arc Institute, Stanford, NVIDIA, UC Berkeley, UCSF;架构:StripedHyena 2——混合注意力+门控卷积;参数:7B和40B两个版本;训练数据:9.3万亿核苷酸,128,000+物种,跨所有生命域;上下文窗口:1,000,000个碱基对(单核苷酸分辨率);训练算力:2,000+NVIDIA H100 GPU,训练数月;开源:https://github.com/ArcInstitute/evo2。
架构创新:为什么不用纯Transformer? Evo 2的核心架构是StripedHyena 2,其设计理念是:Transformer的自注意力机制在长序列上的计算复杂度是O(L²),对于1M长度的序列完全不可行。StripedHyena 2使用门控卷积(Hyena算子)与注意力混合架构,将复杂度降低到O(L log L)。具体来说:注意力层处理局部模式(1,000 bp),Hyena卷积层处理全局依赖(1M bp),两者的"条纹状"交替排列。这种架构使得Evo 2可以在单核苷酸分辨率上处理百万级长度的序列——这是此前所有基因组模型都做不到的。
关键能力:(1)变异效应预测:零样本预测BRCA1等临床重要基因的突变致病性,无需任务特定微调;(2)基因组生成:生成完整的线粒体、细菌和真核生物基因组序列;(3)跨物种泛化:在训练中未见过的物种上也能准确预测;(4)非编码区理解:预测调控元件的功能影响。State模型:Arc的第一个虚拟细胞
State是Arc Institute在2025年6月发布的首个虚拟细胞模型(Adduri et al., bioRxiv 2025, DOI: 10.1101/2025.06.26.661135)。
基本信息:训练数据:1.67亿观测细胞+1亿扰动细胞,70种人类细胞系;架构:双模块设计(SE+ST);最大数据集:Tahoe-100M(1亿细胞,1,100种小分子处理);开源:非商业用途。
双模块架构:
State Embedding(SE):功能是将转录组数据映射到平滑的向量空间。训练:1.67亿未标记细胞,对比学习。输出:每个细胞的328维嵌入向量。特性:同类型细胞在嵌入空间中聚集,不受技术差异影响。
State Transition(ST):功能是预测扰动如何改变细胞状态。架构:双向Transformer,对细胞集合(而非单个细胞)进行自注意力操作。训练:1亿+扰动细胞,学习控制→扰动的分布变化。输出:扰动后的细胞嵌入分布。
工作流程:(1)输入控制细胞群转录组;(2)SE编码→细胞嵌入向量;(3)ST获取扰动描述(药物/基因/细胞因子);(4)ST预测嵌入空间的位移;(5)解码回基因表达空间。
关键创新:ST的Transformer对细胞集合进行操作,而不是单个细胞。这使得它可以在集合级别捕捉异质性——不是预测"平均效应",而是预测"分布变化"。这是对传统方法(如CPA)的重要改进,传统方法假设所有细胞对扰动的响应是相同的。
性能:在Tahoe-100M数据集上:扰动区分能力比现有最佳方法提升>30%;真正差异表达基因(DEG)识别准确率显著提升;在跨细胞类型泛化任务上,首次系统性超越线性基线——这是该领域的一个关键里程碑,因为此前(2024-2025年)的所有深度学习方法在跨细胞类型泛化时均未一致超越线性模型。最优传输与细胞动力学
AIVC的另一个重要数学基础是最优传输(Optimal Transport, OT)及其在细胞动力学建模中的应用。问题:给定时间点t₁的细胞群体分布μ_t₁和时间点t₂的分布μ_t₂,如何推断中间时间点的细胞状态和发育轨迹?
CellOT方法(Bunne et al., Nature Methods 2023, DOI: 10.1038/s41592-023-01969-x):CellOT学习一个参数化映射T_θ,将μ_t₁传输到μ_t₂,使得传输成本最小。
Flow Matching方法(Richter et al., Comms. Biology 2026):Flow Matching不再学习"跳跃"映射,而是学习连续的向量场v_θ(x,t),定义从t₁到t₂的概率流。Flow Matching的优势:可以生成中间时间点的细胞状态,可以处理细胞分裂和死亡,计算效率高(单步生成,无需迭代)。
在AIVC中的角色:OT和Flow Matching是AIVC中Manipulator VI的核心数学工具——给定一个初始细胞状态和一个目标扰动,计算"最可能"的细胞状态转换路径。七、因果视角:从相关到因果的跨越为什么因果关系对虚拟细胞至关重要?
当前所有单细胞基础模型(scGPT、Geneformer、scFoundation)都基于相关性学习——模型学习的是"当基因X表达变化时,基因Y的表达通常如何变化"。但相关性不等于因果性。
一个例子:假设我们观察到,在疾病细胞中,基因A和基因B的表达都上调了。scGPT可能学到"基因A上调→基因B上调"。但真相可能是:基因C是疾病的驱动因子,驱动了A和B共同上调(混淆因子);基因A上调是补偿性反应,B上调才是致病原因;A和B的上调完全独立,只是恰好同时发生。
对于药物发现,因果性才是关键。我们需要知道:如果我们敲除/激活基因X,细胞状态会如何变化?这才是"虚拟细胞"的核心价值——做实验之前预测干预的结果。CausCell:因果解耦+扩散生成
基本信息(Gao, Dong, Liu et al., Nature Communications 2025, DOI: 10.1038/s41467-025-62008-1, PMID: 40701997):机构:同济大学+微软亚洲研究院;架构:结构因果模型(SCM)+扩散模型;任务:单细胞表征的因果解耦与反事实生成;开源:https://github.com/bm2-lab/CausCell。
核心创新:因果解耦。CausCell假设每个细胞的观测数据x由两类潜在变量生成:(1)因果变量(Causal factors)z_c:具有生物学因果意义的概念(如细胞类型、处理条件、疾病状态);(2)混杂变量(Confounding factors)z_u:与技术噪声、批次效应等相关的非因果变量。两类变量之间的因果关系由结构因果模型(SCM)描述:z_c = f_c(Pa(z_c), ε_c), z_u = f_u(Pa(z_u), ε_u)。
CausCell定义了一个有向无环图(DAG)来描述概念之间的因果关系。例如,在药物扰动实验中,因果结构可以是:药物处理→细胞类型→基因表达,同时药物处理→细胞状态←细胞类型。在这个DAG中,"药物处理"是根节点(外生变量),"细胞类型"和"药物处理"共同影响"细胞状态","基因表达"是观测变量(叶子节点)。
扩散模型作为生成器:CausCell使用扩散模型作为生成骨干,但条件扩散——生成过程由因果解耦的潜在变量z控制。反事实生成能力:CausCell最强大的能力是反事实生成——回答"如果...会怎样"的问题。给定一个真实细胞(x, y),CausCell可以:(1)编码:推断z_c和z_u;(2)干预:修改z_c中的特定因素(如将"未处理"改为"药物处理");(3)解码:生成反事实的x*。
性能评价:在多个单细胞数据集上,CausCell在以下任务中超越了现有方法:解耦表征质量(用Mutual Information Gap和DCI指标衡量)、反事实生成的生物学真实性(差异表达基因的富集分析)、小样本场景下的泛化能力(从10%训练数据中学习,仍能保持80%+性能)。
生物学发现:在衰老相关基因分析中,CausCell揭示了此前未被报道的因果调控关系——某些基因的表达变化并非衰老的直接原因,而是代偿性响应。scCausalVI:因果感知的生成模型
基本信息(An et al., Cell Systems 2025, DOI: 10.1016/j.cels.2025.101443, PMID: 41197632):机构:Broad Institute, Harvard;架构:深度结构因果网络(Deep Structural Causal Network);核心能力:解耦内在细胞状态与处理效应。
问题:在单细胞扰动实验中,观测到的基因表达变化是"处理效应"和"细胞内在异质性"的混合。scCausalVI的目标是将两者分离开。
方法:scCausalVI使用一个因果图来建模:S(内在细胞状态,不受处理影响)→T(处理变量)→E(处理效应,S和T的交互作用)→X(观测到的基因表达)。模型通过VAE框架学习:(1)内在状态S的编码器(不依赖于处理条件);(2)处理效应E的编码器(依赖于处理条件);(3)解码器X=f(S,E)+噪声。
关键结果:(1)能够识别"响应细胞"和"非响应细胞"——同一处理下,不同细胞可能响应不同;(2)跨数据集泛化:在训练集未见过的细胞类型上预测处理效应;(3)为虚拟细胞提供了"个体化"视角——不是所有细胞对同一处理的响应相同。LCD:潜在因果扩散
基本信息(2025, 预印本):架构:将基因表达建模为随机微分方程(SDE)系统;核心理念:基因调控网络可以表示为耦合的SDE。
LCD将d个基因的表达建模为d维SDE:dx(t)=f(x(t))dt+σdW(t)。漂移函数f的Jacobian矩阵J_ij=∂f_i/∂x_j编码了因果调控关系——如果J_ij≠0,则基因j调控基因i。LCD通过一个神经网络参数化f_θ,并同时学习f_θ和预测扰动的效应。
与AIVC的关系:LCD提供了一种"白盒"方法来建模细胞动力学——它不是学习"输入-输出"映射,而是学习控制细胞行为的物理法则(微分方程)。这比黑盒Transformer更可解释,但需要更多的结构假设。因果建模的开放挑战
尽管CausCell、scCausalVI和LCD代表了从"相关"到"因果"的重要迈步,但因果建模在虚拟细胞中仍面临根本性挑战:1. 因果发现的不确定性:从观测数据中推断因果结构是NP-hard问题2. 因果变量的定义:什么是"细胞类型"的因果?什么是"疾病状态"的因果?这些概念在生物学中有多种定义方式3. 干预的粒度:CausCell的"干预"是概念层面的,但真正的生物干预是分子层面的4. 验证困难:反事实生成的结果无法直接验证八、扰动预测挑战:基准测试与争议
扰动预测是虚拟细胞的核心任务。其形式化定义如下:给定控制细胞群C={x_i}和扰动描述p,预测扰动后的细胞群P={x'_j}。挑战包括:跨细胞类型泛化、跨扰动泛化、组合扰动。三大基准测试
(1)scPerturBench(Wei et al., Nature Methods 2025, DOI: 10.1038/s41592-025-02980-0):这是目前最全面的单细胞扰动预测基准测试,由同济大学刘琦团队完成。规模:27种方法(scGPT、scFoundation、Geneformer、GEARS、CPA、CellOT、scGen等),29个数据集(涵盖CRISPR、化学药物、细胞因子等扰动类型),6种互补的评估指标。
关键发现:
任务类型最佳方法简单线性基线结论跨细胞类型预测PerturbNet线性回归差异不显著跨扰动预测GEARS+知识图谱线性回归知识图谱有帮助组合扰动预测CPA线性组合深度方法略优新细胞类型零样本scFoundation线性回归两者相当新药物零样本chemCPA线性回归迁移学习有帮助基因网络推断scPRINTGENIE3基础模型最优
核心结论:没有一种方法在所有场景下都最优。简单线性模型在跨细胞类型泛化场景中表现惊人地好,而深度学习方法在数据量充足的场景中(如同一细胞类型内的预测)表现更好。
方法选择指南(来自scPerturBench):如果只有少量数据,选择线性模型;如果有大量数据且需要跨细胞类型泛化,选择PerturbNet或State;如果需要组合扰动预测,选择CPA或GEARS;如果需要基因网络推断,选择scPRINT。
(2)Ahlmann-Eltze et al.(Nature Methods 2025, DOI: 10.1038/s41592-025-02772-6):这项研究引起了最大的争议。作者测试了GEARS、Geneformer、scGPT等深度学习方法,在CRISPR扰动预测任务上,与一个简单线性模型对比。线性模型公式:ŷ_{g,pert}=β_{0,g}+β_{1,g}·I(pert=target)。结果:这个简单的线性模型在所有测试场景中与深度学习方法表现相当或更好。结论:"Deep-learning-based gene perturbation effect prediction does not yet outperform simple linear baselines."(基于深度学习的基因扰动效应预测尚未超越简单线性基线。)
(3)Open Problems Perturbation Prediction(OP³, NeurIPS 2023竞赛):由CZI和多个机构组织的竞赛,使用146种化合物处理人类血细胞的单细胞数据集。关键结果:获胜方法混合了多种技术(集成学习、迁移学习、数据增强);纯深度学习方法未能超越传统方法;竞赛暴露了评估指标的不足——大多数团队在"平均效应"上表现好,但在"效应异质性"上表现差。Virtual Cell Challenge 2025:首届竞赛结果
Arc Institute于2025年6月发起了首届Virtual Cell Challenge,于2025年12月NeurIPS 2025上公布结果。任务:预测人类干细胞(H1细胞系)中基因扰动对转录组的影响。参与规模:来自全球的50+支团队进入决赛。
获奖结果:
奖项团队方法奖金Generalist PrizeAltos LabsCleo Flow Matching生成模型$100,000第一名BM_xTVC改进的scFoundation+蛋白嵌入+公共扰动数据$50,000第二名Team OutlierTransPert(统计方法,仅用伪批量数据)$25,000
Generalist Prize获得者:Altos Labs:Altos Labs的Cleo Flow Matching模型的核心特点:使用流匹配(Flow Matching)生成细胞响应分布的完整概率密度,而非仅预测平均值;预训练在约700万高质量单细胞上,覆盖多种公共数据源;在全部7个评估指标上表现均衡,而非在单一指标上优化。
关键启示:1. 混合方法 > 纯端到端深度网络:获胜方法结合了多种技术(预训练基础模型+知识图谱+统计建模)2. 纯AI仍不充分:即使是最佳模型,在某些指标上仍然未能超越简单基线3. 评估标准仍在争论中:什么才是"好"的虚拟细胞预测?这个问题还没有共识为什么深度模型难以超越简单基线?
原因1:信噪比问题。单细胞RNA-seq数据中,技术噪声往往大于生物学信号。一个典型的扰动实验中:检测到的基因约10,000,受扰动显著影响的基因10-100(0.1%-1%),效应量(fold change)大部分<2倍,技术变异系数30-80%。在这种信噪比下,线性模型的高偏差(high bias)反而成为优势——它不会过度拟合噪声。
原因2:数据稀缺与组合爆炸。扰动组合空间是组合爆炸的。20,000个基因→20,000种单基因扰动→约2亿种双基因组合。目前的扰动数据集覆盖了最多几百种扰动,远远不够。
原因3:批次效应主导。不同实验室、不同测序平台、不同批次的单细胞数据之间,批次效应往往比扰动效应大10倍。模型可能学到的是"如何区分批次"而非"如何预测扰动"。
原因4:评估指标不匹配。当前主要使用R²和Spearman相关度。但这些指标有问题:如果99%的基因不受影响,模型只需预测"不变"就能获得R²>0.9;这个指标不能反映模型是否捕捉到了真正重要的生物学信号(如关键通路的激活/抑制)。争议背后的共识
尽管有争议,但领域正在形成一些共识:1. 基础模型的有价值产出是"表示"而非"预测":scGPT的细胞嵌入、Geneformer的基因嵌入,在微调后确实有用2. 扰动预测需要专门的架构:State模型证明了,一个专门为扰动预测设计的架构(set-level Transformer+双模块)可以超越通用基础模型和线性基线3. 数据 > 模型:Tahoe-100M数据集(1亿细胞)的发布,对模型性能的提升大于任何架构创新4. 评估标准需要改进:Cell-Eval(State的评估框架)和PerturBench(Altos Labs)都是领域标准化的积极尝试
九、产业生态与资本格局主要玩家全景
虚拟细胞领域已经形成了一个由学术界、非营利机构、大型科技公司和生物技术公司组成的生态系统。
组织类型资金/背景核心技术发布时间Arc Institute非营利研究机构$650M+捐赠Evo 2, State, Virtual Cell Challenge2021年成立CZI慈善基金会数十亿美元Billion Cells Project, VCP, CELLxGENE2021年宣布Altos Labs生物技术公司$3B+Cleo Flow Matching, PerturBench2021年成立Xaira Therapeutics生物技术公司$1B+X-Cell, scGPT团队2024年成立Tahoe Therapeutics生物技术公司未公开Tahoe-100M数据集2022年成立Microsoft Research科技公司N/ACausCell, scGeneScope2025NVIDIA科技公司N/AEvo 2训练基础设施, Clara模型2025年合作DeepMind (Google)科技公司N/A虚拟细胞为Hassabis重点方向2024年宣布Insitro生物技术公司$743M药物发现平台2018年成立Recursion生物技术公司上市高通量细胞成像2013年成立
Arc Institute:虚拟细胞的核心推动者
概况:2021年由Silvana Konermann(Stanford)、Patrick Hsu(UC Berkeley)、Patrick Collison(Stripe CEO)三人联合创立,初始捐赠$650M以上。非营利模式。
核心资产:(1)Arc Virtual Cell Atlas:最大的开放单细胞数据库之一,6亿+细胞。使用scBaseCount代理框架自动采集、清洗和再处理公共单细胞数据。(2)Evo 2(2025年2月):40B参数基因组基础模型,9.3T碱基,128,000+物种,1M上下文窗口。发表在Nature 2026。(3)State(2025年6月):首个大规模虚拟细胞模型,1.67亿观测细胞+1亿扰动细胞,70种细胞系。首个在扰动预测中系统性超越线性基线的深度模型。(4)Virtual Cell Challenge(2025-2026):年度竞赛,类似CASP对蛋白质结构预测的推动作用。2025年首届在NeurIPS举办,2026年挑战赛将于8月启动。(5)MULTI-evolve:AI引导的蛋白质工程框架。
团队:约50人核心研究团队,与Stanford、UC Berkeley、UCSF紧密合作。CZI × NVIDIA联盟
Chan Zuckerberg Initiative(CZI):2015年由Priscilla Chan和Mark Zuckerberg创立。2025年10月:与NVIDIA宣布合作,加速虚拟细胞模型开发。Billion Cells Project:与10x Genomics和Ultima Genomics合作,生成10亿级单细胞数据。虚拟细胞平台(VCP):开源平台,托管模型、数据和基准测试。CZ CELLxGENE:最大的开放单细胞数据仓库(5,000万+细胞)。战略承诺:未来十年数亿美元投入虚拟细胞。
NVIDIA:提供Evo 2训练的DGX Cloud基础设施(2,000+H100 GPU);提供Clara开源模型(MONAI成像模型、CodonFM RNA模型);与CZI合作构建VCP的底层计算基础设施。Altos Labs:$3B的细胞青春使命
概况:2021年成立,获得了$3B以上的融资(来自Jeff Bezos等)。总部在Bay Area,在San Diego、Cambridge(UK)和日本设有研究所。使命是"恢复细胞活力"。
虚拟细胞相关资产:PerturBench:开源基准测试框架,发表于NeurIPS 2025,标准化了扰动预测模型的评估;Cleo Flow Matching:在Virtual Cell Challenge 2025中获得Generalist Prize;scGeneScope:与Microsoft Research合作,探索"重新训练和测试"范式。
团队:CEO为Hans Bishop(前Gilead高管),AI团队由Simone Bianco等领导。与Cambridge大学、Stanford有密切合作。Xaira Therapeutics:$1B的虚拟细胞药物发现
概况:2024年4月成立,$1B+初始融资(ARCH Venture Partners领投,为ARCH历史上最大初始投资)。CEO为Marc Tessier-Lavigne(前Stanford校长、Genentech CSO),联合创始人为David Baker(2024年诺贝尔化学奖得主)。
关键事件:2025年4月:任命Bo Wang(scGPT发明者)为SVP和Head of Biomedical AI(后升任Chief AI Scientist);2025年6月:发布X-Atlas/Orion,基因组范围Perturb-seq数据集,约800万单细胞;2026年:发布X-Cell虚拟细胞模型。
策略:Xaira是"全栈"AI药物发现——从蛋白质设计(David Baker的技术)到虚拟细胞(Bo Wang的技术)到湿实验验证,构成闭环。X-Cell模型是其核心基础架构之一。其他重要玩家
Tahoe Therapeutics(2022年成立):2025年2月发布Tahoe-100M数据集——1亿单细胞,1,100种小分子处理,50种癌细胞系。这是目前最大的单细胞扰动数据集。2026年1月:与Arc Institute和CZ Biohub合作,额外生成1.2亿数据点。
DeepMind:Demis Hassabis在2024年诺贝尔奖采访中多次提及"虚拟细胞"是DeepMind的重要方向,但尚未发布具体产品。
Microsoft Research Asia:CausCell(Nature Communications 2025)、scGeneScope(与Altos Labs合作),在因果AI+生物学交叉领域有深厚积累。
北京大学(周沛劼团队):虚拟细胞数学理论:最优传输(WFR-FM, ICLR 2026)、随机动力学(ICLR 2025 Oral);stVCR:时空动态细胞发育重建(Nature Methods 2026)。资本流向与行业趋势
投资趋势:2021年Arc Institute成立($650M),2021年Altos Labs成立($3B),2024年Xaira Therapeutics成立($1B+),2025年CZI Billion Cells Project(未公开,数十亿级),2025年CZI×NVIDIA合作(未公开),2026年Tahoe-100M数据集(开源免费)。
关键趋势:1. 从"模型竞争"到"数据竞争":Tahoe-100M的发布表明,数据质量/规模可能比模型架构更重要2. 从"单打独斗"到"平台合作":CZI的VCP、Arc的Virtual Cell Challenge、Altos的PerturBench都是"平台化"策略3. 从"非营利"到"商业化":早期主要是非营利(Arc、CZI),但Xaira和Altos的商业模式正在推动虚拟细胞从研究工具向药物发现平台转变4. 从"转录组中心"到"多模态":CZI的Billion Cells Project明确包含蛋白组和成像数据,Evo 2加入了基因组层,但PTM仍然缺失
十、实操指南:如何开始"玩"虚拟细胞环境准备
最小硬件要求:VCell(图形界面):任何现代PC,无需GPU;scGPT微调:16GB+ RAM,推荐1张NVIDIA GPU(8GB+ VRAM);State扰动预测:32GB+ RAM,推荐GPU;CausCell因果分析:16GB+ RAM,推荐GPU;Syn3A 4D模拟(Lattice Microbes):需要NVIDIA GPU+CUDA,对个人用户不现实。实践一:VCell入门——15分钟搭建第一个反应扩散模型
目标:在不编写任何代码的情况下,在VCell中建立一个简单的钙信号反应扩散模型。
步骤:1. 访问 https://vcell.org → "Launch VCell"(Web版,无需安装)2. 创建新模型:File → New → Biological Model3. 定义几何:使用内置的"球体"几何(模拟一个细胞),或上传显微镜图像4. 添加物种:添加 Ca²⁺(细胞质中),指定初始浓度和扩散系数5. 添加反应:Ca²⁺ → 缓冲蛋白(质量作用动力学,指定速率常数)6. 添加刺激:在膜上添加 Ca²⁺ 流入通量(模拟钙通道开放)7. 运行模拟:选择 PDE 求解器,设置时间步长,运行8. 可视化:查看 Ca²⁺ 浓度随时间和空间的分布变化
VCell的能力边界:VCell适合反应扩散机理建模,但不适合全基因组预测。如果你想知道"敲除基因X后整个转录组会怎样",VCell不是正确的工具。实践二:scGPT微调
目标:使用预训练的scGPT模型,在AnnData格式的单细胞数据集上微调,预测基因扰动效应。
准备数据:需要AnnData格式的单细胞数据集,包含.X(基因表达计数矩阵)、.obs["cell_type"](细胞类型注释)、.obs["perturbation"](扰动标签)。
关键步骤:加载和预处理数据→加载预训练模型→为微调准备数据(scGPT使用"基因token+表达值+条件token"作为输入)→微调(以扰动预测为目标)→预测→评估。
注意事项:官方scGPT预训练权重可在HuggingFace下载;对于小数据集,使用LoRA(低秩适应)微调,冻结大部分参数;零样本模式也可用(不微调,直接推理),但效果有限。实践三:State扰动预测
目标:使用Arc Institute发布的State模型,预测药物对癌细胞的转录组影响。
两步流程:第一步:SE编码——将转录组数据编码为细胞嵌入(328维)。第二步:ST预测——给定扰动,预测嵌入空间中的位移,然后用SE的解码器将嵌入解码回基因表达空间。
关键参数:SE嵌入维度:328;ST使用set-level自注意力(batch中每个set 256细胞);训练数据:Tahoe-100M+Replogle-Nadig+Parse-PMBC。实践四:CausCell因果分析
目标:从单细胞数据中提取因果结构,生成反事实细胞状态。
工作流:(1)定义因果结构(DAG),例如:药物→细胞状态→基因表达;(2)训练CausCell模型;(3)反事实生成:给定一个处理过的细胞,问"如果没处理会怎样"。各实践的资源需求与难度
实践难度GPU内存时间输出VCell入门★☆☆不需要4GB15 min反应扩散模拟scGPT微调★★☆推荐16GB1-3 hr扰动预测模型State推理★★☆推荐32GB30 min细胞状态预测CausCell分析★★★推荐16GB2-4 hr因果结构+反事实LoRA定制★★★需要16GB2-6 hr定制基础模型
十一、你的独特切入角度:PTM在虚拟细胞中的缺失维度当前虚拟细胞建模的巨大盲区
回顾整个虚拟细胞领域,一个惊人的事实是:几乎所有的虚拟细胞模型都完全以转录组为中心。
scGPT、Geneformer、scFoundation、scPRINT、UCE:全部基于scRNA-seq数据。State:全部基于scRNA-seq数据。CausCell:全部基于scRNA-seq数据。Evo 2:基因组序列,但只到DNA层面。Syn3A 4D:没有PTM(syn3A的PTM极其有限)。
这意味着什么? 转录组告诉你"细胞在准备生产什么蛋白",但不告诉你蛋白的实际活性状态。一个蛋白的活性在90%的情况下由PTM调控——磷酸化激活/失活、泛素化标记降解、乙酰化改变定位、甲基化调控结合——这些都发生在转录组层面之下。
具体数据(来自DeepMVP, Nature Methods 2025, DOI: 10.1038/s41592-025-02797-x):• 人类蛋白质组中,约95%的蛋白经历至少一种PTM• 已知的PTM类型超过400种(磷酸化、乙酰化、泛素化、甲基化、糖基化、SUMO化等)• 单细胞中,转录组-蛋白组相关性仅为0.4-0.6(即mRNA丰度只能解释16-36%的蛋白丰度变化)• PTM状态与mRNA丰度的相关性更低,因为PTM是快速、可逆的调控机制,与转录调控时间尺度完全不同为什么PTM被忽略?
原因一:单细胞PTM数据几乎不存在。单细胞转录组:成熟,通量高(一次实验10,000-100,000细胞);单细胞蛋白组:仍处于早期,通量低(一次实验1,000细胞,1,000蛋白);单细胞PTM组:几乎不存在。目前没有成熟的技术可以在单细胞水平上大规模检测PTM。
原因二:转录组是"最便宜"的起点。10x Genomics的scRNA-seq每个细胞成本$0.01-0.05;质谱单细胞蛋白组每个细胞成本$10-100;PTM特异性富集需要额外的抗体/化学步骤,成本更高。
原因三:领域的"路径依赖"。第一个成功的单细胞基础模型(Geneformer, 2023)基于scRNA-seq,后续模型都沿着这条路径走——因为数据可用、评估标准已建立。没人愿意"第一个"做PTM集成,因为数据稀缺、标准缺失。PTM融入虚拟细胞的技术路径
路径A:PTM感知蛋白语言模型嵌入。现有进展:PTM-Mamba(Peng et al., 2024 bioRxiv)、DeepMVP(Wen et al., Nature Methods 2025)、MTPrompt-PTM(Han et al., Biomolecules 2025)。可以做什么:将PTM感知蛋白嵌入作为额外模态输入到AIVC的UR中。例如:对于每个基因,用PTM-Mamba生成一个PTM感知嵌入向量,与scGPT的基因嵌入拼接。
路径B:因果图上的PTM节点。在CausCell或scCausalVI的因果图中,显式添加PTM节点:磷酸化事件→蛋白活性→细胞表型,中间由激酶连接。这意味着PTM不是"噪声",而是因果链条中的关键中间节点。
路径C:基于规则的信号模型(BioNetGen/VCell)。对于已知的信号通路,可以使用BioNetGen的基于规则建模来精确描述PTM调控的逻辑。例如:规则"EGFR(Y1068)~P+GRB2(SH2)<=>EGFR(Y1068)!P.GRB2(SH2)"表示磷酸化的EGFR的Y1068位点与GRB2的SH2结构域结合。这与VCell的BioNetGen集成兼容,适合构建"信号→转录"的PTM桥梁。
路径D:CUT&Tag数据的整合——你团队的核心优势。CUT&Tag技术可以在单细胞水平上检测组蛋白修饰(H3K4me3、H3K27me3、H3K27ac等)。这些是表观遗传层面的PTM,与转录调控直接相关。你团队在CUT&Tag抗体开发和HCT抗体方面的expertise可以创造独特价值:(1)生成稀缺数据:用高质量的PTM特异性抗体,生成单细胞水平的PTM数据;(2)抗体作为探针:抗体本身是PTM检测的"传感器",抗体的质量和特异性直接决定了PTM数据的质量;(3)验证闭环:抗体筛选数据可以作为虚拟细胞预测的"湿实验验证"。你可以做什么?
短期(6-12个月):(1)建立PTM数据管道:用你的抗体平台,在2-3个细胞系中生成磷酸化/乙酰化/泛素化的单细胞级数据(即使只是~100蛋白/细胞,也是开创性的);(2)PTM嵌入生成:与PTM预测工具(PTM-Mamba、DeepMVP)合作,将你的抗体数据转化为可用于scGPT微调的嵌入;(3)小规模概念验证:在VCell中建立一个包含PTM开关的信号通路模型,展示PTM对细胞状态预测的影响。
中期(12-24个月):(1)PTM感知的虚拟细胞模块:在State或CausCell框架中加入PTM层,开发一个"PTM增强版"虚拟细胞;(2)PTM扰动数据集:使用你的抗体平台,生成"药物处理→PTM变化→转录组变化"的配对数据集,这是目前领域最稀缺的数据类型;(3)CUT&Tag多模态整合:将CUT&Tag的组蛋白修饰数据与scRNA-seq数据整合,构建"表观转录组"虚拟细胞。
为什么这是一个"小蓝海"? 虚拟细胞领域目前极度竞争(scGPT、State、Evo 2等),但全部集中在转录组;PTM是公认的重要但被忽视的维度;抗体技术是你的核心壁垒——大多数ML团队没有抗体平台;领域正在从"单模态"向"多模态"演进,PTM是下一个天然的多模态目标。
十二、未来方向与开放问题统一表征的最大挑战
AIVC的核心是"统一表征(UR)",但构建UR面临三个根本性挑战:
挑战1:模态之间的维度不匹配。转录组:20,000维连续向量(基因表达);蛋白组:10,000维连续向量(蛋白丰度);表观组:非结构化,峰信号或染色质状态;成像:高维像素/体素数据;PTM:稀疏位点注释。目前的主流方法是"跨模态对齐"——用配对数据(同一细胞的RNA+蛋白)训练,但这依赖于配对数据的可用性。
挑战2:缺失模态的处理。在大多数应用中,你只有部分模态的数据。UR需要能够处理"模态缺失"——给定部分模态,推断完整的细胞状态。这类似于"模态翻译",但目前的工具性能有限。
挑战3:跨物种对齐。理想的虚拟细胞应该能在不同物种之间泛化。UCE(Universal Cell Embeddings)已经在跨物种细胞嵌入对齐方面取得了进展,但仍然是开放问题。从静态到动态
当前的大多数虚拟细胞模型都是静态的——给定一个细胞状态,预测另一个状态,但不建模中间过程。向动态建模的演进路径:静态预测(scGPT)→伪时间(Monocle)→RNA速度(scVelo)→最优传输(CellOT)→连续动力学(Neural ODE/Flow Matching)。连续动力学的终极目标是:给定细胞在时间t₀的状态,模拟它在t₀+Δt的完整状态轨迹,包括细胞分裂、分化和死亡。
关键进展:Qiu et al.(Cell 2024, DOI: 10.1016/j.cell.2024.10.011):全息时空建模(Spatiotemporal modeling of molecular holograms);Zhou et al.(ICLR 2025 Oral):随机动力学+非平衡最优传输;stVCR(Peng et al., Nature Methods 2026):时空动态细胞发育重建。从虚拟细胞到虚拟组织
"虚拟细胞"之后的下一个逻辑步骤是"虚拟组织"——模拟多个细胞之间的相互作用(细胞-细胞通信、组织微环境、免疫-肿瘤相互作用)。关键技术:空间转录组学(Spatial Transcriptomics)作为数据基础;细胞-细胞通信模型(CellChat, SpaGraphCCI, Nicheformer);多细胞Agent建模。
现状:空间转录组学正在快速发展(10x Visium, MERFISH, Slide-seq, Xenium),但大多数细胞-细胞通信模型仍基于配体-受体表达相关性,而非真正的动力学模拟。从"虚拟细胞"到"虚拟组织"的跨越可能需要5-10年。标准化基准的迭代
Virtual Cell Challenge的CASP效应:CASP(Critical Assessment of Structure Prediction)对蛋白质结构预测的推动作用不可估量——它通过标准化的盲测,将AlphaFold推向了革命。Virtual Cell Challenge的目标是扮演同样的角色。
2025年首届挑战赛的启示:模型尚未达到"可用"水平(某些指标上仍不如简单基线),但领域共识正在形成:评估标准、数据格式、基准数据集。2026年挑战赛(2026年8月-11月)将引入新任务。
评估标准需要解决的核心问题:如何衡量"生物学意义"上的预测准确度,而非统计相关度?如何评估"效应异质性"(不同细胞对同一扰动的不同响应)?如何评估模型在"分布外"场景下的可靠性?模型可解释性
当前发现:稀疏自编码器(SAE)分析(Kendiukhov, 2026, arXiv: 2603.02952)发现,scGPT和Geneformer的注意力机制主要捕获的是共表达(co-expression)而非真正的调控逻辑。具体的:注意力权重高→两个基因在训练数据中经常共表达;因果消融(去除注意力头中的"调控相关"头)→对预测性能无影响;简单基因水平基线(如"基因A和B在同一通路中")与注意力得分高度相关。
这意味着:当前基础模型可能没有学到真正的因果调控机制,而是学到了统计学上的"相关性模式"。这与"深度模型不优于线性基线"的发现是一致的。
前进方向:将因果约束引入预训练目标(如CausCell的做法);使用可解释性工具(SAE、Shapley值、Integrated Gradients)系统评估模型学到的生物学知识;建立"模型在生物学上知道什么"的标准化评估框架。计算资源需求
虚拟细胞模型的计算需求是巨大的:
模型训练算力训练时间单次推理scGPT (53M)8 A1002-3天秒级Geneformer (30M)8 A1003-5天秒级scFoundation (100M)16 A1001周秒级State (ST+SE)64+ H100数周分钟级Evo 2 (40B)2,000+ H100数月分钟-小时级Syn3A 4D1 GPU8小时/模拟N/A
趋势:模型的规模在快速增加,但推理效率也在提升。量化、剪枝、蒸馏等技术正在被引入生物模型。对个人用户:使用预训练模型进行微调/推理是可行的(单GPU)。从头训练一个基础模型需要数十万到数百万美元的算力。你的PTM虚拟细胞:一个具体的路线图
结合你的背景(抗体研发、PTM、蛋白质组学),以下是"如果你真的想做出东西"的建议路线图:
第一步:找到你的"最小可行数据"(3-6个月)。选择一个具体的PTM(如磷酸化或乙酰化),在一个细胞系中,用你的抗体平台生成:控制状态下的PTM数据、1-2种药物扰动后的PTM数据、同步的scRNA-seq数据(配对或不配对均可)。关键:你不需要大规模数据。即使是10,000个细胞×500个蛋白/PTM的数据,也是目前领域没有的稀缺资源。
第二步:建立"PTM→转录组"的桥接模型(6-12个月)。使用CellOT或简单的神经网络,学习从PTM状态到转录组变化的映射。这个模型本身就是一个"迷你虚拟细胞"——给定PTM扰动,预测转录组响应。
第三步:集成到现有框架(12-18个月)。将PTM嵌入作为额外模态输入到scGPT或State中,开发一个"PTM增强版"虚拟细胞。这是真正的创新——目前没有人做过。
第四步:验证闭环(18-24个月)。用你的抗体平台验证虚拟细胞的预测——模型预测"药物X会改变蛋白Y的磷酸化状态",你设计实验去验证。这是"lab-in-the-loop"——虚拟细胞的终极验证方式。总结
本报告从基础概念出发,追溯了虚拟细胞30年的历史,深入解析了机制驱动和数据驱动两条技术路线,探讨了因果建模、扰动预测基准和产业生态,提供了实操指南,并给出了针对PTM背景的独特切入角度。
一句话总结:虚拟细胞正在从"构想"走向"实用",但转录组中心的路径选择留下了巨大的PTM空白——而这正是你可以填补的。做别人不做的事,而不是重复别人已做的事。
本文数据截至2026年8月,仅供学习参考,不构成任何投资建议。