生物医学研究日益受到重复性、碎片化工作流程的制约,这些瓶颈拖慢了科学发现。我们提出Biomni,一种通用型生物医学人工智能智能体,能够自主执行多样化的研究任务。为绘制生物医学动作空间,Biomni的动作发现智能体从25个领域的数千种出版物中挖掘工具、数据库和方案,构建统一的智能体环境。其通用架构将大语言模型推理与检索增强规划和基于代码的执行集成在一起,无需预定义模板即可动态组合工作流程。系统性基准测试显示,在未针对特定任务调优的情况下,Biomni在多样化任务上表现出强泛化能力——因果基因优先排序、药物重定位、罕见疾病诊断、微生物组分析和分子克隆。真实世界案例研究展示了Biomni解读多模态数据集、优化蛋白质稳定性、编排湿实验室仪器以及生成可实验验证的方案。Biomni展望了人工智能增强人类科学家并加速发现的未来。
生物医学研究是现代科学与医学的关键支柱,推动着疾病机制、诊断和治疗方法方面的发现(1–4)。然而,随着大规模实验、数据、工具和文献的增长,由于碎片化、复杂的工作流程使高效整合专业化工具、详尽文献综述、精密实验设计和严格统计学建模日益困难,研究进展正不断放缓(5,6)。大量有价值的生物医学数据未得到充分利用(7),许多复杂分析未能开展,许多与既往知识和文献的联系未被建立,并非因为这些工作缺乏价值,而是对专家级研究人员的需求远超供给。数据丰富与有限人力资源之间的不匹配,凸显了迫切需要通过能够有效扩展专业知识、简化工作流程并释放生物医学研究全部潜力的方法加以解决。
人工智能(AI)智能体通过自动化重复性任务、提升生产力以及拓展过去难以实现的能力,深刻重塑了软件工程(8)、法律(9)、材料科学(10)和医疗保健(11)等领域。AI智能体的发展也为重塑生物医学研究的某些方面提供了机遇(12)。我们设想此类智能体跨子领域处理多样化的生物医学研究任务,从而增强人类生物学家的专业技能。凭借高效管理数千并发任务的能力,AI智能体能够提升人类生产力并加快生物医学发现的步伐。
以往以及同期的生物医学AI智能体大多是为狭窄任务而构建的专家系统(13–20),限制了它们在生物医学不同领域间的泛化能力。Virtual Lab为SARS-CoV-2纳米抗体设计编排多智能体LLM工作流程(14);BioDiscoveryAgent在预定义筛选范围内运行闭环基因扰动选择(15);CellAgent自主配置并执行scRNA-seq分析流程(17);scBaseCount利用智能体持续整理并扩展单细胞数据仓库(21)——这些系统虽功能强大,但局限于单细胞组学。近期工作已将智能体扩展到其他模态与任务(22):SpatialAgent将多智能体推理应用于空间转录组学,实现空间感知推理与假设探索(23),同时在自进化、强化学习驱动和自动化假设生成架构方面的并行进展展现出良好前景(24),然而这些系统每个仍局限于特定任务的动作空间(25)。
使AI智能体能够处理广泛的生物医学任务带来了重大技术挑战——最突出的是,需要将高级推理(26)与执行高度专业化生物医学动作的能力紧密结合(27)。尽管基于LLM的推理已取得重大进展(28),此类LLM需要访问一个明确定义生物医学动作空间的环境,该空间天然具备多样性、领域专属性和复杂性。此外,真正有能力的系统还需要一种原生与该生物医学环境交互的智能体架构,能在无需依赖预定义工作流程的情况下选择和执行多样化任务。
在此,我们提出Biomni,一种通用型的生物医学AI智能体,专为辅助并部分自动化跨广泛子领域的生物医学研究而构建。Biomni能提出假设、执行复杂的生物信息学分析并设计严谨的实验方案。为实现这一能力,我们首先通过系统分析从文献库中精选的、跨越25个不同子领域的2500篇生物医学研究论文,构建了一个统一而全面的生物医学动作空间。在此基础上,我们开发了一种由LLM驱动的动作发现智能体,能够阅读论文并提取驱动生物医学发现的关键任务、工具和数据库。这些要素随后被选定并集成到Biomni-E1,即定义智能体交互所用生物医学动作空间的基础环境。Biomni-E1包含150个专业化生物医学工具、105个软件包和59个数据库。我们随后设计了Biomni-A1,一种通用型智能体架构,能够灵活使用Biomni E1提供的工具和数据集来执行广泛的生物医学任务。针对用户查询,智能体首先使用检索系统识别所需的最相关工具、数据库和软件;然后应用基于LLM的推理和领域专业知识,生成详细的逐步推进的计划。每个步骤以可执行代码表达,使生物医学动作能够精确且灵活地组合——考虑到该领域对高度专业化工具与数据资源的依赖,这是一个不可或缺的特性。这一集成系统使Biomni能够高效地为挑战性的、大规模的生物医学问题生成解决方案,同时也能泛化到此前未曾接触的生物医学研究新领域。
严格的基准测试表明,Biomni在现有生物医学质量保证基准上表现出色,在开发过程中从未遇到的挑战性现实场景中展现出强泛化能力。我们通过五个案例研究展示Biomni的实际能力:(1)分析可穿戴设备传感器数据;(2)对单细胞RNA-seq和ATAC-seq等大规模原始数据集进行全面生物信息学分析;(3)设计实验室方案以辅助湿实验研究人员;(4)优化蛋白质序列以提升热稳定性;(5)编排机器人湿实验室仪器。通过Biomni,我们引入了一种可扩展的通用型生物医学AI智能体,指向AI智能体与人类研究人员协作以加速从基础研究到转化的生物医学发现的未来。
图1. Biomni中统一的生物医学动作空间与智能体环境概述。(A)系统构建统一生物医学动作空间的工作流程。使用AI驱动的发现智能体,从25个生物医学子领域的2500篇bioRxiv近期论文中提取开展生物医学研究必需的动作。人类专家对提取的动作进行了严格验证与筛选,最终整合了105个生物医学软件包、150个专业化生物工具(包括湿实验协议、AI驱动的预测模型与领域知识),以及59个综合性生物医学数据库。(B)跨越多个生物医学子领域(包括遗传学、基因组学、合成生物学、细胞生物学、生理学、微生物学、药理学、生物工程、生物物理学、分子生物学和病理学)的统一生物医学动作空间示意。图中展示了集成至Biomni环境的代表性工具与数据库,突显其通用能力。(C)演示Biomni推理与动作组合过程的示例工作流程,用于自主回答复杂生物学问题。Biomni基于用户查询检索相关工具,形成结构化推理计划,并组合可执行代码开展全面的生物信息学分析,根据观察结果迭代优化推理过程,直至得出最终精确答案。
图2. Biomni在通用基准、专家级任务和强化学习方面的表现。(A)在Biomni-Eval1上的性能表现,包含10类生物医学研究的443个查询:CRISPR递送、因果基因检测、变异优先级排序、数据库与DNA序列查询、患者基因检测、罕见病诊断和筛选设计。数据点为3次独立运行的平均值,报告443个查询的平均准确率。(B)在多个人工智能前沿LLM基础模型上"人类最后的考试"(HLE-Bio)的准确率,比较了仅LLM基线和Biomni-A1智能体架构与Biomni-E1智能体环境的表现。(C)单细胞RNA-seq注释准确率和执行时间,与人类专家比较,达到相当专家准确率且分析时间缩短。(D)罕见病诊断准确率和执行时间,Biomni匹配专家准确率同时大幅缩短完成时间。(E)GWAS因果基因检测准确率和执行时间,展示出专家级性能且执行速度显著加快。(F)Biomni智能体架构与强化学习训练流程概述。(G)强化学习前后的平均任务性能,展示8B和32B规模的Biomni-R0模型取得显著提升。Biomni-R0由Qwen3开源权重模型微调而来,首先由前沿模型Claude-Sonnet-4进行蒸馏(即教师模型),然后执行进一步强化学习以专门化于生物医学任务(见材料与方法)。调优后其表现超越教师前沿模型。(H)各专精生物医学任务层面的性能比较,阐明强化学习在各类任务上带来了一致的改进。
图3. Biomni自主执行复杂的多模态生物医学分析以生成假设。(A至D)COVID-19第二阶段可穿戴设备研究及其分析流程概述。(A)通过Fitbit设备在COVID-19大流行期间从1027名参与者采集高分辨率心率与计步数据,数据经处理以建立个体生理基线并检测疾病相关偏差。(B)使用Biomni软件对全队列应用的10步分析流程。(C)Biomni生成的核心图件,包括COVID-19阳性期人群水平心率与计步分布(左)和个体昼夜节律模式热图(右)。(D)Biomni识别出关键生理相关性,证实存在相互关联的机制。(E至H)Biomni自主分析了约33.6万个细胞核液滴的单细胞多组学数据,在人胚胎关节发育(肩、髋、膝)过程中整合了单核RNA测序(snRNA-seq)与单核ATAC测序(snATAC-seq)。(F)展示Biomni多组学基因调控网络10步分析流程的详细工作流程图。(G)Biomni生成的两个关键图件:左图显示按发育阶段的调控因子活性热图,颜色强度表示活性水平;右图显示按细胞类型的RUNX2调节子活性箱线图,展示不同细胞群体间的表达变异。
图4. Biomni设计湿实验实验方案。(A)在10个真实克隆场景上的开放式克隆基准测试。我们与基础LLM、受训者级人类和专家级人类科学家进行比较。发现Biomni与专家级科学家具有相似的准确率,且高于受训者水平,同时所用时间大幅减少。(B)用户向Biomni请求将靶向人B2M基因的sgRNA克隆至lentiCRISPR v2 Blast质粒的示例。(C)Biomni自动化的分步工作流程,包括质粒分析、sgRNA设计、寡核苷酸合成、Golden Gate组装、细菌转化、菌落筛选和最终质粒图谱构建。(D)Biomni生成的详细克隆方案,包含逐步说明和全面质粒图谱,支持实验室科学家自主执行实验。(E)通过筛选平板上的成功菌落生长验证Biomni的克隆方案,随后对挑取菌落进行Sanger测序,确认sgRNA插入完美比对,展示Biomni在精确可靠实验设计方面的强大能力。
图5. AI引导的蛋白质优化与自动化实验执行。(A)计算蛋白质进化流程。Biomni整合结构预测(AlphaFold-2)、热稳定性评估(ThermoMPNN)和文献挖掘(UniProt/PubMed),以迭代优化起始序列("MALK…ASV")并改善其热稳定性。(B)优化轨迹示例。经过三轮迭代,Biomni提出稳定化突变(Q83I、C110F、C66F),产生
的累积预测
改善,对应增强的核心疏水性和芳香稳定化作用,同时保持98%序列一致性。(C)实验方案的AI驱动自动化。Biomni将实验室任务的自然语言描述(例如,"将水从A1-A3孔转移至B1-B3孔,每次转移
")转化为完全可执行的PyLabRobot代码。(D)该代码在Hamilton STAR平台上进行转化与验证,实现端到端的数字到物理实验执行。Biomni概述
由于生物医学动作空间本身复杂而庞大,构建统一的生物医学动作空间面临挑战。我们采用AI驱动的方法系统性地解决这一问题(图1A)。我们利用bioRxiv定义的25个学科类别,从中各选取最新的100篇出版物。一个动作发现LLM智能体按顺序处理每篇论文,提取复现或开展所述研究所必需的任务、工具、数据库和软件。这一全面的资源集合构成了执行大量生物学研究任务所必需的核心动作。
随后我们整合构建了Biomni-E1,一个让生物医学AI智能体执行广泛动作的环境(图1B)。已识别的工具由人类专家与相应测试用例进行严格验证。这些工具(补充表S1至S18)专门因具备非平凡特性而被选中,涵盖了复杂代码、领域知识或专业AI模型。考虑到生物软件固有的灵活性——它们并不总能简化为静态函数——我们构建了一个预装105种广泛使用的生物软件包的执行环境(补充表S24至S31),支持Python、R和CLI。在数据库集成方面,我们将资源分为两个不同的类别:第一类是通过Web API访问的大型关系数据库(例如PDB、OpenTarget、ClinVar)(补充表S19和S20)。我们并未创建大量独立的检索工具,而是为每个数据库实现了统一函数,每个函数接受自然语言查询,并在内部使用LLM解析数据库模式,动态生成可执行查询。对于没有网络接口的数据集,我们将其下载到数据湖中,并在本地预处理为结构化平面文件,以便与智能体无缝集成,Biomni-E1共计包含59个数据库(补充表S21至S23)。
为构建一个能处理多样化生物医学任务的通用智能体,我们需要一种专门的智能体架构——一个无需为每个个体任务硬编码工作流程的架构。由此我们开发了Biomni-A1,它包含几项在整个生物医学研究格局中运行至关重要的核心创新。首先,我们引入一种基于LLM的资源选择机制,专用于应对生物医学环境的复杂性和专业性,根据用户目标动态检索量身定制的资源子集(补充图S1展示了检索步骤的消融实验)。其次,认识到生物医学任务通常需要丰富的过程逻辑,Biomni-A1将代码用作通用动作接口——使其能够组合和执行涉及循环、并行化和条件逻辑的复杂工作流程。该方法还使智能体能够交替调用不符合预定义函数签名的软件、工具、数据库和原始数据操作,支持异构资源的灵活动态集成。第三,该智能体采用自适应规划策略:它基于生物医学知识制定初始计划,并在整个执行过程中反复细化计划,实现响应式、上下文感知的行为。这些创新共同使Biomni-A1能够泛化到此前未见的任务与领域,动态组合动作,并与软件、数据和工具进行接口交互(图1C)。
我们随后通过与人类专家对比,评估这些提升是否能转化为现实的端到端生物医学研究工作流程。我们在三个代表性任务上评估了Biomni:单细胞RNA-seq注释、罕见疾病诊断和GWAS因果基因检测,并与人类专家表现进行直接比较(图2,C至E;见材料与方法以及数据、代码和材料可用性声明了解提示与回复)。参与专家评审的人员均要求在相关领域具有至少五年经验,包含来自学术机构的博士后研究人员和教职人员。提示由作者设计。在单细胞注释中(图2C),Biomni达到45.8%的准确率,处于强专家基线(40.5%和50.9%)范围内,同时将每个数据集的平均分析时间从约230 min缩短至75 min。对于罕见疾病诊断(图2D),Biomni在病例中达到60%准确率,匹配5名专家的表现(60%至70%),而分析完成时间约为3 min,相比之下人类专家超过110 min。在GWAS因果基因检测中(图2E),Biomni在各查询中达到80%准确率,再次与专家表现相当,同时将执行时间从约90 min缩短至每个基因座4 min。跨任务来看,Biomni始终匹配专家准确性,同时所需时间大幅减少。Biomni在通用生物医学研究基准上表现优异
为在广泛的生物医学研究问题中建立基线能力,我们首先在涵盖常见生物学任务的标准化基准上评估Biomni(图2)。我们首先在Biomni-Eval1上评估性能,该基准包含跨越10类代表性生物医学研究任务的443个查询(图2A):CRISPR递送、因果基因检测(基于基因、基于本体、基于通路的)、变异优先级排序、数据库查询、DNA序列查询、患者基因检测、罕见疾病诊断和扰动筛选设计。跨这些任务,Biomni达到57%的平均准确率,优于基础LLM(Claude Sonnet 4.5)(30%)、一个治疗药物专用智能体TxAgent(25%)、通用编码智能体Claude Code(43%)以及使用ReAct并配备Biomni-E1的生物信息学软件智能体(44%)。
我们进一步使用"人类最后的考试"(HLE-Bio)评估通用生物医学推理能力(图2B),以测试在无特定任务调优情况下跨不熟悉领域的鲁棒性。在多个前沿LLM基础模型上,Biomni智能体架构相比仅LLM基线带来一致的提升,绝对准确率增益为6至12个百分点,表明观察到的改进并非由某一特定底层模型驱动,而是由Biomni-A1智能体架构和E1环境带来的。补充图S6至S17中提供了额外的轨迹和错误分析。强化学习实现专精生物医学任务的可扩展改进
尽管泛化能力较强,在几个专精任务上的性能仍低于专家水平,定性分析显示模型并未一致地发挥Biomni-E1环境的全部能力(补充图S8),这促使我们采用强化学习方法以提升特定任务的性能。图2,F至H展示了Biomni-R0,一个经过强化学习(RL)训练的开源模型,通过与Biomni-E1环境直接交互优化端到端任务成功率。使用专家标注的奖励,RL训练大幅提高了任务平均表现:Biomni-R0-8B从0.32提升至0.59,Biomni-R0-32B从0.35提升至0.67(图2G)。Biomni-R0-8B超越了更大闭源模型Claude 4 Sonnet(0.56)的表现,扩展至32B额外带来10%的绝对增益。图2H中的任务层面结果显示,在CRISPR筛选设计、因果基因检测、变异优先级排序、数据库查询和罕见疾病诊断上均有一致的改进,表明强化学习为系统性地提升专精生物医学智能体任务性能提供了一种实用机制。在缩短时间的同时以专家水平执行生物医学研究任务
在基准上确立了强表现之后,我们邀请科学家直接将Biomni应用于自己的研究问题。由于生物医学研究涵盖广泛任务,我们选择了5个用例进行说明,另外4个用例可参见补充图S2至S5。Biomni从原始可穿戴设备数据执行大规模自主神经和节律生物学分析
为评估Biomni在现实生物医学工作流程中的表现,我们将其应用于两个大型且已有金标准人工分析的可穿戴设备数据集。在一个基准中,我们使用了Alavi等人的COVID-19生理反应队列(29),包含1027名参与者通过原始分钟级Fitbit心率和计步数据,涵盖超过14亿次心率测量和3700万条计步记录,个体平均监测时长为170天。该数据集高度异质性,包含具有不同基线和活动模式个体的长期纵向记录。
仅基于原始心率和计步数据,Biomni自主生成并执行了完整的端到端分析流程(见材料与方法第G部分,以及数据、代码和材料可用性声明)。智能体提取了六个经验证的COVID-19相关生理生物标志物,包括静息心率升高、昼夜节律幅度降低、心率变异性下降、夜间心率升高、日常步数减少和变时反应迟钝。它进一步重建了人群水平的24小时昼夜节律结构,并将生物标志物整合为多维风险评分(0至6分),并生成出版级别的图件。所获生物标志物、效应量及相关性均与原始研究及后续文献高度一致,包括静息心率与昼夜节律幅度之间的负相关(
)、日常步数与心率变异性之间的正相关(
)。这些结果表明,Biomni能够独立地从人群规模可穿戴设备原始数据中复现专家级的自主神经和节律生物学分析。Biomni自动化复杂的多组学分析,解析骨骼谱系的转录调控
为测试Biomni能否推广至复杂的多组学工作流程,我们用它分析了一个近期发表的发育中人骨骼的多组学数据集(30)。该数据集从受孕后5至11周(图3E)的人类胚胎中收集了336162个单核RNA测序(snRNA-seq)和单核ATAC测序(snATAC-seq),并配对空间转录组学数据。尽管原研究侧重于发育轨迹和疾病机制,我们感兴趣的是探索正在形成骨骼细胞类型间的基因调控机制——这是一个通常需要大量生物信息学支持的技术高难度任务。
我们要求Biomni使用详细指令来研究骨骼谱系间的转录调控(见材料与方法第H部分)。Biomni自主规划并执行了十步分析流程:(1)加载和探索所有数据集,(2)准备用于分析的RNA-seq数据,(3)配置pySCENIC检索基序,(4)运行GRNBoost2推断基因调控网络,(5)使用cisTarget修剪网络,(6)使用AUCell计算调节子活性,(7)从ATAC-seq提取可及性数据,(8)利用ATAC-seq可及性过滤预测靶标,(9)分析细胞类型、发育阶段和解剖区域上的活性模式,(10)总结发现并准备报告。该流程输出转录因子-靶基因连接并基于基序富集和染色质可及性相关性过滤调节子(图3F)。
完整流程在约五小时内完成,通过本地抽样和调试处理了实时执行问题(例如变量名不匹配)。在整个运行过程中,Biomni维护所有中间输出——代码、图件和日志——以可复现的笔记本结构组织,便于验证和审查(见数据、代码和材料可用性声明)。智能体总结所有分析并生成了一份描述分析和关键发现的报告(见材料与方法第H部分)。
在最终的基因调控网络(GRN)分析中(图3H),Biomni重现了关键成骨转录因子(如RUNX2和HHIP)之间已知的调控关系,确认了它们如何被一组共享的抗成骨转录因子(包括TWIST1、LMX1B和ALX4)所调控(30)。这些发现与作者关于适当骨形成和颅缝闭合需要平衡调控的报告(30)相一致。此外,Biomni还提名了几个此前人类骨骼GRN研究中未被重点突出的推定调控因子,包括AUTS2、ZFHX3和PBX1,它们在多种骨骼细胞类型中表现出高推定调控活性。该信号得到了来自基序富集和TF足迹分析、一致性AUCell调节子活性、预测靶标的ATAC共可及性以及跨区域和跨阶段可重复性的互补证据支持,其明确的决策标准、阴性对照和按转录因子汇总的证据在新表中进行了总结(图3,F至H,以及讨论部分)。PBX1是一个已被充分证实的骨骼调控因子(31),而ZFHX3/AUTS2仅有有限或间接的骨骼相关报道(在小鼠(32)或斑马鱼(33))中,它们在这里的广泛活性提示其在不同骨骼谱系中的作用被低估。Biomni报道,这些新调控因子在成骨细胞、前成骨细胞和各类软骨细胞群体中特别活跃,提示它们在人类骨骼发育过程中对骨骼细胞命运决定的转录调控中发挥着重要但此前未被认识的作用。最后,图3G和H展示了Biomni的可视化图如何有效捕获了调控因子活性的时间动态以及RUNX2等关键调节子中的细胞类型特异性变异。这一示例展示了Biomni如何让研究人员自主开展复杂的多组学分析,并快速生成可检验的假设,而无需专业的编程技能。Biomni设计经湿实验验证的克隆方案
为评估Biomni支持现实实验设计的能力,我们聚焦于分子生物学的一项核心任务:克隆。该过程是研究和生物技术中无数工作流程的核心,需要复杂推理,从设计高保真引物到选择正确的组装方法并验证构建物。传统通用LLM由于领域知识和工具获取有限,在此类任务上一直表现不佳(34),而Biomni将LLM推理与动态工具执行相结合,使其能够在分子生物学任务上达到专家级表现。
为严格评估此项任务,我们首先与一个基因编辑研究团队合作设计了一个开放式克隆基准测试和专家用户研究(图4A)。我们的基准包含10个有代表性的真实克隆任务,涵盖Golden Gate、Gibson、Gateway和限制性克隆——每个任务均包含单片段和混合池组装的选项。该基准还包含基本验证步骤,例如设计Sanger测序引物和分析酶切消化。我们将这些任务提交给四种实体:一个LLM、Biomni、一名人类受训者(具有克隆经验的斯坦福生物学研究生,S.Z.)和一名人类专家级研究者(具有5年以上克隆经验的斯坦福遗传学博士后研究人员,D.Y.)。每方需要生成完整的端到端方案以及最终克隆质粒图谱。由盲态专家审阅者对输出结果进行评估。Biomni生成的方案和设计与人类专家的准确率和完整度相匹配,这由独立专家对输出进行人工检查所确定。Biomni通常能提供可比拟的细节水平,并能预判相同的边界情况。相比之下,人类受训者的提交物通常不完整或次优,反映了早期研究者的典型经验差距。显著的是,Biomni在远少于专家的时间内自主完成了所有任务。
为进一步在真实场景中验证Biomni,我们为其分配了一项实际的克隆任务:将靶向人B2M基因的sgRNA克隆至lentiCRISPR v2 Blast构建体(图4B)。Biomni通过一个综合工作流(图4C)成功执行了该任务。首先,它使用注释和模式搜索工具分析质粒结构,以识别克隆所必需的关键特征。随后,它使用专业敲除sgRNA设计工具设计了三种靶向B2M的Cas9 sgRNA。对于克隆过程,Biomni生成了具有BsmBI黏性末端的正向和反向寡核苷酸,以实现sgRNA序列的定向插入。它还生成了详细的流程(图4D),涵盖寡核苷酸退火、双链DNA形成以及至靶载体的Golden Gate克隆。Biomni还提供了完整的细菌转化说明,包括热激步骤和抗生素筛选。在质量控制方面,它设计了U6启动子测序引物以验证sgRNA插入,并模拟了Golden Gate组装以生成最终质粒图谱(见材料与方法第I部分)。
我们严格遵循Biomni的方案执行了湿实验(图4E)。第二天平板上出现了菌落;对其中两个进行了培养、小量提取并使用Biomni设计的引物进行测序——两者均显示完美比对。这一案例展示了科学家可以依靠Biomni自主设计复杂的分子生物学实验,其准确率可与人类专家相媲美,但所需时间大幅减少。Biomni编排AI模型用于迭代分子设计
为展示Biomni自主进行分子设计的能力,我们整合了最先进的蛋白质建模工具——包括AlphaFold-2 (2)、ThermoMPNN (35)和生成式设计模型——使研究人员能够通过自然语言单独运用那些强大但基础设施密集的方法。在本案例研究中,我们为Biomni提供了一条蛋白质序列和改善热稳定性的目标。无需编码、GPU配置或专业的计算专业知识,Biomni自主构建并执行了一条优化流程(图5A):它使用AlphaFold-2预测初始三维结构,通过ThermoMPNN评估基线热稳定性,在同源蛋白中搜索稳定化突变,提出结合结构分析和领域知识的候选突变,并在三轮优化循环中对每个变体进行评估。智能体最终鉴定出三个突变Q83I、C66F和C110F,在保持98%序列一致性的同时,累计预测热稳定性改善
(图5B)。每个突变均与已确立的蛋白质工程原理相吻合:Q83I置换增强了疏水核心堆积,而两个半胱氨酸到苯丙氨酸的替换通过
–
堆叠相互作用引入了芳香稳定化作用。通过作为复杂AI模型(这些模型在基础设施和专业知识方面通常要求极高)的直观界面,Biomni使得先进的计算蛋白质工程民主化。Biomni通过自动化方案生成连接计算分析与湿实验执行
生物学研究中的一个持续瓶颈是计算设计与物理实验之间的脱节:来自硅基分析的方案转化为实验室方案需要数天的手动协调才能完成。为解决这一差距,我们将Biomni与开源的实验室自动化Python框架PyLabRobot (36)集成,使研究人员能够直接从自然语言生成并执行生产级液体处理方案。我们在生产环境中的Hamilton STAR系统上验证了这一能力。针对描述液体转移的简单提示,Biomni生成完整的可执行代码,具有正确的甲板配置、错误处理和资源清理(图5C)。对于复杂工作流程,我们在8种化合物、12点系列稀释、三重复的细胞活力剂量反应测定中测试了Biomni。从硬件规格出发,Biomni生成具有智能吸头选择、数学上正确的系列稀释和体积验证的全面方案(见材料与方法第N部分)。这一集成展示了Biomni如何充当实验意图与可执行自动化代码之间的接口,这是连接干实验分析与湿实验执行闭环的重要一步。讨论
Biomni是一个强大的生物医学研究平台,展示了在多样化的子领域间的强泛化能力,为AI智能体作为科学发现中不可或缺的合作者奠定了基础。其在复杂任务上的零样本表现——包括遗传学、基因组学、微生物学、免疫学、药理学和临床医学等领域的任务——突显了其在提升研究生产力和加速发现方面的潜力。
通过自动化通常需要专业知识和编程技能的复杂劳动密集型工作流程,Biomni使研究人员能够将精力转向创造性的假设生成、实验创新和跨学科合作。在生物制药靶点和药物发现背景下,Biomni可能应用于设计工作流程以优先选择靶标、设计扰动筛选或重定位药物。在临床环境中,Biomni可支持基因优先排序和罕见疾病诊断。在消费者健康方面,Biomni支持可穿戴数据和多组学分析的整合,用于健康监测和干预。
尽管如此,仍存在若干局限性。虽然Biomni的统一环境涵盖了广泛的生物医学工具和数据库,所评估的任务仅代表该领域的一个子集,关键领域仍未被探索。此外,在动作发现智能体中,我们优先考虑最新文献的决定使智能体具有时效性,但风险是忽略了尽管已从当前话语中淡出但仍具持久重要性的基础性概念和技术。未来的版本在定义环境时应考虑更大范围的出版物。此外,复杂的多步骤分析,例如scRNA-scATAC多组学工作流程,通常受益于更结构化的提示——这些提示明确指定中间分析步骤。尽管高级提示对许多任务已足够,但需要大量领域知识和隐含分析流程的工作流在关键步骤被指定时,在稳健性和可重复性方面表现更佳,这表明当前AI智能体在可推广性方面存在局限性。此外,尽管Biomni在数据库查询、序列分析和分子克隆等任务中接近人类水平,但在需要细致的临床判断、实验推理或深层生物学思考和综合的领域仍存在困难。目前没有任何系统能涵盖人类生物医学专业知识的全貌。正如我们的基准测试所反映的,Biomni尚未在所有任务类别中达到专家水平表现。在生物医学任务的广阔领域中,表现仍然参差不齐,Biomni尚未全面在各领域都表现强劲。由于可能的生物医学应用空间巨大而稿件空间有限,我们展示了五个涵盖多样生物学领域的代表性用例,以说明Biomni能力范围,而非穷举所有潜在用例。我们预计,随着基础模型的演进和智能体环境的扩展,以及人类专家和受训者部署Biomni以促进或增强其工作,将持续出现改进。
这些局限性指出了未来发展的有前景的方向。通过强化学习训练生物医学推理智能体可使其在规划和执行方面持续自我改进。整合多模态数据——文本、图像和结构化输入——可能进一步深化推理能力。使Biomni能够自主发现并整合新工具和新数据库,以及融入更多具有高效用但可能容易被人类用户遗忘的历史方法,将确保其适应性和长期相关性。最后,我们认识到,在生命科学领域能力日益增强的AI系统引发了重要的生物安全考量。尽管Biomni旨在加速有益的生物医学研究,但能够进行文献综合、方案生成和自动化分析的智能体系统也可能降低滥用生物学知识的门槛。因此,负责任的开发需要仔细评估风险与收益。在本工作中,我们采纳了几个原则来缓解潜在的关注:将系统聚焦于广泛使用的学术数据集和工具,通过开源发布强调透明度,并使我们的开发实践与新兴的社区讨论以及AI-生物安全风险政策框架保持一致。我们相信,开放性、严格评估以及与更广泛的生物安全和政策社区的参与对于确保科学AI智能体的开发方式既能最大化社会效益又能最小化潜在危害至关重要。
展望未来,Biomni及其后续版本可能成为AI驱动的生物医学生态系统中的基础基础设施,与人类专家无缝协作,揭示有关健康和疾病的深刻见解。这种混合伙伴关系可能重塑生物医学研究——自动化假设生成、扩展发现管道,并使医疗创新能够比以往更快地推进。
作者:Kexin Huang, Serena Zhang, Hanchen Wang, Yuanhao Qu, Yingzhou Lu, Ryan Li, Yusuf Roohani, Lin Qiu, Shiyi Cao, Gavin Li, Junze Zhang, Di Yin, Rick Wierenga, Deniz Kavi, Sherry Liu, Tianwei She, Shruti Marwaha, Jennefer N. Carter, Xin Zhou, Matthew T. Wheeler, Jonathan A. Bernstein, Mengdi Wang, Peng He, Jingtian Zhou, Michael P. Snyder, Le Cong, Aviv Regev, Jure Leskovec