2026年6月15日,上海大学医学院卞月珉团队联合中国药科大学药学院孙昊鹏团队等,在《Communications Chemistry》在线发表论文,题为“Target-driven machine learning-enabled virtual screening (TAME-VS) enables prioritization of AKR1C3 inhibitors”,其中上海大学的卞月珉与高欣及中国药科大学的孙昊鹏为共同通讯。研究以醛酮还原酶AKR1C3为模型靶点,检验一种名为TAME-VS的目标驱动机器学习虚拟筛选流程,能否在真实药物发现约束下优先找出更值得合成和验证的抑制剂。
背景
虚拟筛选(Virtual Screening,VS)是创新药物研发早期阶段的重要技术手段,其核心目标是在大规模化合物空间中优先识别具有潜在生物活性的候选分子,从而提高实验筛选效率并降低研发成本。随着公开生物活性数据库持续积累以及机器学习技术快速发展,基于配体的虚拟筛选正逐步由传统结构相似性检索向数据驱动预测转变。这类方法不仅能够提高候选化合物筛选效率,还有望突破既有化学空间限制,发现具有全新结构特征的活性分子。
然而,机器学习辅助虚拟筛选在实际药物研发中的应用仍面临两个关键问题。首先,许多模型虽然能够获得较高的评价指标,但训练集与测试集往往来源于相近的化学骨架,模型性能更多反映的是已知化学空间内的结构插值能力,而非对全新化学骨架的预测能力。因此,模型是否具备跨骨架泛化能力,已成为评价其应用价值的重要标准。其次,在药物发现早期阶段,限制研发效率的往往并非候选化合物数量,而是化合物合成与实验验证资源。对于研发实践而言,更重要的问题并非模型本身的统计学指标,而是在有限实验资源条件下,模型能否提高活性化合物发现效率并优化实验资源配置。
AKR1C3(Aldo-keto reductase family 1 member C3)是醛酮还原酶超家族的重要成员,参与类固醇激素代谢、前列腺素转化以及活性代谢中间体清除等多种生理过程。越来越多研究表明,AKR1C3与肿瘤发生发展、肿瘤细胞耐药及化疗敏感性调控密切相关,抑制AKR1C3被认为是提高肿瘤细胞对化疗药物响应的重要策略之一。与此同时,AKR1C3与AKR1C1、AKR1C2和AKR1C4等家族成员具有较高序列和功能同源性,使活性数据整合、亚型选择性控制以及模型迁移均面临较大挑战。因此,该靶点为评估机器学习虚拟筛选策略的泛化能力与实际应用价值提供了具有代表性的研究对象。
结果
TAME-VS工作流程及整体设计
TAME-VS是一套基于靶点的机器学习虚拟筛选平台,旨在通过自动化数据获取与模型构建降低虚拟筛选的实施门槛。平台从目标蛋白出发,将靶点扩展、生物活性数据获取、机器学习建模和候选化合物优先筛选整合为统一流程。
在本研究中,AKR1C3的UniProt编号P42330作为唯一输入信息。系统首先通过BLAST检索获得与AKR1C3具有较高同源性的蛋白家族成员,随后自动从ChEMBL数据库获取相关活性化合物数据,并依据实验活性信息建立活性与非活性分子集合。完成数据整理后,系统利用分子指纹实现化学结构数字化表达,并分别构建随机森林(RF)和多层感知机(MLP)分类模型。
围绕训练数据构建策略,研究比较了三种不同方案:仅使用AKR1C3活性数据;整合AKR1C3及同源蛋白活性数据;以及在同源增强数据基础上进一步进行人工校正。模型训练完成后,首先利用独立抑制剂系列开展回顾性验证,随后针对新设计化合物进行前瞻性筛选与实验验证,并最终形成实验反馈驱动的迭代优化流程。
图1 TAME-VS整体工作流程示意图
AKR1C3化学知识库构建与预测模型优化
通过同源靶点扩展模块,系统共识别出8个与AKR1C3序列相似度超过40%的同源蛋白。其中AKR1C1、AKR1C2和AKR1C4与AKR1C3的序列相似度分别达到87.9%、87.0%和83.9%。这些高度同源蛋白为后续活性数据扩充提供了重要来源。
基于ChEMBL数据库检索结果,AKR1C3及其同源蛋白共关联数百至上千条化合物活性记录,涵盖IC50、Ki、抑制率等23种实验测定形式。其中IC50记录数量最多,达到1586条,占全部活性数据主体,因此被选定为模型训练核心数据来源。
研究发现,活性与非活性分子之间的效力差异对模型性能具有显著影响。当活性和非活性阈值差距扩大时,模型更容易学习稳定的结构—活性关系。仅利用AKR1C3数据构建模型时,最佳RF和MLP模型ROC-AUC分别达到0.924和0.913;整合同源蛋白数据后,ROC-AUC提高至0.945和0.928;进一步结合人工校正后,ROC-AUC分别达到0.966和0.955。
十折交叉验证结果显示,各模型均具有良好稳定性和可重复性。进一步比较Morgan、AtomPair、MACCS和拓扑指纹后发现,不同分子表示方式之间虽存在一定性能差异,但经多重比较校正后均未表现出统计学显著差异。这表明训练集质量、数据覆盖范围以及活性标签定义方式对模型性能的影响明显高于分子指纹类型本身。
图2 同源靶点扩展结果、生物活性数据分布、不同训练策略下模型性能比较以及十折交叉验证结果
回顾性验证:跨化学骨架泛化能力评估
为了评价模型是否具备跨骨架泛化能力,研究选取了两个发表于2025年的AKR1C3抑制剂系列作为独立验证集。这些化合物在模型训练所使用的ChEMBL35数据库中尚未收录,因此能够有效模拟真实药物发现过程中面对未知化学空间的场景。两个系列分别来源于先导化合物S07-2005和S07-2010,共包含47个活性分子和11个非活性分子。两类化合物在结构骨架、取代模式及结合方式方面均与训练集存在明显差异。
结果显示,仅利用AKR1C3单靶点数据训练得到的模型能够将验证集整体与随机背景化合物区分开来,但难以有效区分验证集内部的活性与非活性分子。相比之下,整合同源蛋白数据构建的模型能够显著提高活性分子的预测得分,并在排序过程中优先识别真实活性分子。进一步分析显示,验证集与训练集之间平均Tanimoto相似度仅为0.137,说明两者在结构层面具有较高差异。同时,活性与非活性化合物在分子量、脂溶性以及极性表面积等理化性质上高度重叠,并不存在能够直接解释活性差异的简单性质分层现象。化学空间分析表明,模型捕获的并非简单结构相似性,而是与AKR1C3结合相关的功能性结构模式,包括氧阴离子位点结合所需的含氧锚定基团以及适配SP2和SP3疏水亚口袋的取代基特征。这些结构规律能够跨越不同化学骨架而保持活性关联性,从而实现对未知抑制剂系列的有效识别。
图3 外部抑制剂回顾性验证结果
前瞻性筛选验证:提高活性分子优先发现效率
研究进一步开展前瞻性筛选验证,以评价模型在真实药物发现流程中的应用价值。研究设计了两类具有不同结构特征的候选化合物。第一类为苯甲酰胺骨架衍生物,来源于先前发现的AKR1C3抑制剂S07-2008;第二类为吡咯羧酰胺骨架衍生物,来源于先导化合物S07-2001。两类骨架分别针对AKR1C3不同结合亚口袋进行优化设计,从而覆盖更广泛的结合模式。
图4 TAME-VS对AKR1C3靶向设计衍生物的优先筛选结果
共计41个新设计化合物进入筛选流程。利用默认策略训练得到的RF和MLP模型分别进行评分后,共有14个化合物被确定为优先合成对象。其中13个化合物IC50低于1 μM,整体活性命中率达到92.8%。RF和MLP模型独立排序所得前10名化合物活性命中率均达到90%。为了获得客观评价基线,研究进一步完成其余27个化合物的合成与测试。全部41个化合物中共有28个IC50低于1 μM,对应随机选择条件下68.3%的基线命中率。这一结果表明,在已经经过药物化学优化的候选化学空间内,TAME-VS仍能够进一步提高优先筛选集合的活性富集能力,实现从68.3%提升至92.8%的命中率,从而显著提高实验资源利用效率。
表1 Scaffold #1骨架衍生物对AKR1C3a,b的抑制活性
表2 Scaffold #2骨架衍生物对AKR1C3a的抑制活性
优选AKR1C3抑制剂的结构与功能验证
在全部候选化合物中,S34-1035和S34-1040表现出最优抑制活性,其AKR1C3 IC50分别达到0.04 μM和0.03 μM。进一步亚型选择性评价显示,两种化合物对AKR1C1、AKR1C2和AKR1C4均未观察到明显抑制作用,在AKR1C家族内部表现出超过2500倍的选择性优势。相比之下,母体化合物S07-2001无论在活性还是选择性方面均明显逊于优化后的候选分子。
分子对接分析显示,两种化合物均能够稳定结合于AKR1C3活性口袋。S34-1035通过羰基与Y55和H117形成关键氢键,腈基与D224形成极性相互作用,芳香环则与Y24和F306形成稳定疏水及π-π堆积作用。S34-1040表现出类似结合模式,并与W227和F306形成额外疏水相互作用。
100 ns分子动力学模拟进一步证实,两种化合物在动态条件下均保持稳定结合状态。模拟结果显示,部分羰基结构具有一定构象灵活性,可与S118形成间歇性氢键,从而增强结合稳定性。
图5 高效AKR1C3抑制剂的实验验证及其化疗增敏作用
AKR1C3抑制剂恢复耐药乳腺癌细胞对阿霉素的敏感性
为评价优选化合物的生物学功能,研究建立了MCF-7/DOX阿霉素耐药乳腺癌细胞模型。结果显示,野生型MCF-7细胞对阿霉素的IC50为67.64 nM,而MCF-7/DOX细胞的IC50超过100 μM,耐药指数超过1478倍。单独使用S34-1035或S34-1040时,即使浓度达到100 μM,对细胞增殖的抑制作用仍较弱,说明两种化合物本身不具有显著细胞毒性。当两种AKR1C3抑制剂与阿霉素联合使用时,细胞增殖受到明显更强的抑制。组合指数分析显示,CI值介于0.145至0.637之间,属于强协同至协同作用范围。克隆形成实验进一步证实,联合处理能够显著抑制耐药细胞长期增殖能力。上述结果说明,AKR1C3抑制剂能够有效增强耐药乳腺癌细胞对阿霉素的敏感性,实现从酶学活性到疾病相关细胞表型的功能验证。
表3 S34-1035、S34-1040和S07-2001对AKR1C各亚型的抑制活性及选择性
表4 阿霉素与S34-1035或S34-1040联合用药的协同效应评价
在线TAME-VS平台实现端到端虚拟筛选
为提高平台可及性,研究进一步开发了TAME-VS在线服务器(https://aidd.shu.edu.cn)。平台提供图形化用户界面,支持从UniProt编号、同源靶点列表或自定义活性数据集三种方式启动分析流程。用户无需安装本地软件即可完成同源靶点扩展、活性化合物获取、模型训练、虚拟筛选以及结果分析等操作。系统默认参数能够复现本文中的筛选策略,同时允许用户调整分子指纹类型、上传用户定制化合物库进行虚拟筛选等。后端采用Celey Worker任务执行系统、RabbitMQ消息传递系统和MinIO对象存储系统,实现大规模虚拟筛选任务的高效执行和管理。
图6 TAME-VS在线平台及图形用户界面
总结
本研究围绕AKR1C3构建并验证了基于靶点的机器学习虚拟筛选平台TAME-VS。通过整合同源蛋白活性信息、建立监督学习模型以及开展回顾性与前瞻性验证,研究证明该体系不仅能够识别训练集中未出现的新型化学骨架,还能够在药物化学优化后的候选空间内进一步提高活性分子的优先发现效率。在前瞻性筛选验证阶段,TAME-VS将优先筛选化合物集合的活性命中率由68.3%提高至92.8%。进一步获得的S34-1035和S34-1040表现出纳摩尔级AKR1C3抑制活性、超过2500倍的亚型选择性,并能够显著增强耐药乳腺癌细胞对阿霉素的敏感性,显示出良好的进一步开发潜力。相关结果表明,在合理的数据组织策略和持续实验反馈机制支持下,机器学习模型能够有效提高早期命中化合物发现效率,为创新药物研发中的决策优化提供有价值的技术支撑。
参考链接:
https://doi.org/10.1038/s42004-026-02092-6
--------- End ---------
感兴趣的读者,可以添加小邦微信加入读者实名讨论微信群。添加时请主动注明姓名-企业-职位/岗位或姓名-学校-职务/研究方向。