环肽分子因其稳定性、膜通透性和高亲和力等独特优势, 已成为多肽药物市场的重要组成部分, 在新药研发领域展现出广泛的应用潜力. 近年来, 为满足新药研发中高通量筛选的需求, 并针对环肽药物中多样的成环方式、修饰策略和非天然氨基酸引入等特点, 一系列新型合成方法被开发出来. 同时, 适用于环肽体系的计算方法也日趋完善, 显著提升了环肽药物的开发效率并拓展了化学空间. 本文系统综述了: (1) 具有代表性的环肽合成方法研究进展; (2) 新兴的计算设计方法, 包括不同结构单元和成环方式的稳定构象预测与从头生成方法、构象系综预测方法以及环肽成药性质相关数据集和预测工具的发展情况; (3) 结合计算与实验工具研发环肽药物分子的典型案例, 如单稳定构象环肽和透膜环肽的设计等. 最后, 本文展望了机器学习技术在环肽药物发现中可能的应用前景.
2001~2025年, 美国食品药品监督管理局(FDA)批准上市了26款环肽药物, 集中于激素治疗和靶向治疗领域. 表1和图1列出了2020年以来, 获批环肽药物的批准时间、结构和功能信息。
目前已经获批的环肽药物, 在结构上呈现以下特征: (1) 成环方式: 主要采用酰胺键(包括小分子连接剂(linker)介导的酰胺键)和二硫键成环; (2) 氨基酸修饰: 普遍存在N-甲基化、羟基化等修饰, 完全由天然氨基酸组成的环肽药物较为罕见; (3) 来源特征: 已有的环肽药物多数为天然产物或其类似物, 通过理性设计得到的分子占比较少. 在天然环肽药物分子中, 往往还会包含非标准氨基酸. 例如, 研究表明, 短杆菌肽S作为一种天然的抗菌环十肽, 其结构中的D-苯丙氨酸对抗菌能力具有关键作用.
现有环肽药物的研发经验表明, 从天然产物出发, 进行修饰或者引入非标准氨基酸, 可以有效提升分子的稳定性和活性. 得益于合成技术的发展, 许多所需的修饰、突变可以被灵活、有效地实现. 不过, 单纯通过大规模实验筛选的方法进行分子优化和设计, 效率较低且成本较高. 研究人员长期致力于环肽分子的从头设计, 希望得到优于天然产物的新型药物分子. 计算方法可以极大地帮助提升环肽药物的开发效率, 同时有效地拓展环肽药物设计的化学空间.
2 环肽分子合成方法的进展
在实验中, 如何获取结构丰富多样的候选环肽分子是药物开发过程中的关键问题. 通常, 环肽分子可通过线性肽前体的环化反应得到. 该过程的挑战在于: 线性肽前体在成环之前要经过一个熵减的预环化构象, 不利于环肽的形成; 同时, 线性肽前体还可能发生分子间反应, 形成低聚物和聚合物等副产物, 在高浓度反应条件下, 这一问题更加明显.
过去几十年来, 科学家们发展了多种策略来进行环肽合成. 根据成环特点, 可以分为以下4种合成策略: (1) 首尾成环: N端氨基与C端羧基之间形成酰胺键闭环; (2) 侧链成环: 通过两个侧链共价连接, 如半胱氨酸残基之间形成二硫键, 或赖氨酸和谷氨酸之间的酰胺键连接成环; (3) 尾部-侧链成环: C端羧基与链间含有亲核基团的残基侧链(如赖氨酸的ε-NH2)发生酯化或酰胺化反应; (4) 头部-侧链成环: N端氨基与肽链中含有电负性的侧链(如谷氨酸、天冬氨酸的羧基)形成酰胺键. 其中, 首尾成环和侧链成环是应用最为广泛的策略. 除利用多肽自身的残基连接成环外, 研究者们还开发了一系列基于小分子linker的选择性化学连接策略, 以实现更优性质环肽分子的合成. 此外, 可以实现大批量分子库构建的环肽合成平台, 由于满足了高通量药物筛选的需求, 也成为近年来合成研究的重要方向. 本节简要介绍经典的首尾成环和侧链成环合成方法, 以及一些具有代表性、普适性、新颖的化学连接成环、环肽合成平台方法. 更完整的环肽合成方法开发总结, 可参考已有的相关综述。
2.1 经典的首尾成环和侧链成环方法
经典的固相树脂合成多肽方法在经过优化后, 可以直接用于头尾环化反应. 根据所采用的连接策略, 可以分为以下3种方式: (1) 通过C末端的主链N原子将肽链固定在树脂上, 经过后续的脱保护、环化、切割等流程得到环肽; (2) 通过氨基酸侧链残基(例如赖氨酸、谷氨酸等)将肽链固定在树脂上, 经过后续流程得到环肽; (3) 通过C末端将肽链固定在树脂上, 然后利用N端氨基的亲核进攻引发环化反应, 同时使环肽从树脂上断裂, 切割得到环肽产物(图2). 该方法将线性前体固定在载体上, 在不使用大量溶剂的情况下实现了“伪稀释”, 可以最大限度地减少线性肽的寡聚化. 不过, 直接偶联方法的大环化效率高度依赖于序列, 需要根据体系仔细优化反应条件. 一些研究尝试结合基于固相合成方法进行策略优化, 以提升反应效率. 例如, Li团队[33]报道了利用二氨基烟酸作为连接子进行固相合成环肽的工作. 该方法利用亚硝酸异戊酯活化连接有线性肽前体的树脂, 然后N端氨基亲核进攻形成环肽, 实现了6~39个氨基酸残基环肽的高产率合成, 展示了良好的应用前景. Kobayashi等[34]将固相合成方法和酶促反应结合, 利用青霉素结合蛋白型硫酯酶, 对树脂切割后获得的二醇酯线性肽进行高转化率(>90%)的头-尾环化, 实现了对15个氨基酸以下中小环肽的高产率合成.
侧链成环反应中, 最主要的反应模式是半胱氨酸参与, 形成二硫键或者硫醚结构. 二硫键成环模式中, 通常是两个半胱氨酸反应, 形成天然条件下稳定的二硫键. 这一反应操作简便, 但往往难以引入新功能基团, 且二硫键易被还原; 另外, 对于含有多个半胱氨酸残基的体系, 易出现二硫键错配的情况. 硫醚成环模式中, 半胱氨酸的硫醇侧链被利用, 与溴乙酰基/马来酰亚胺等亲电性的结构反应, 形成硫醚键(图3a, b), 产物相对稳定的同时, 还可以引入非天然氨基酸结构, 实现透膜性等分子性质的调控. 例如, 在Merz等提出的结合合成和筛选方法设计具有口服生物利用度的小分子环肽流程中, 合成部分的核心反应为线性肽的末端硫醇基团与双亲电试剂反应, 形成硫醚键实现环化(图3c). 利用该流程, 可以开发出高稳定性、口服适用、结构多样的环肽分子, 在针对酶、受体或者离子通道等靶点时展现出良好的应用潜力.
2.2 选择性化学连接策略
除多肽分子自身成键、完成环化外, 研究者们还开发出了一系列利用小分子linker介导的化学反应连接残基、合成环肽的策略. 化学连接具有高选择性, 因此无需保护氨基酸侧链, 为合成带来了极大的便利. 1994年, Kent团队报道了自然化学连接(NCL)方法. 之后, 该方法被广泛应用于蛋白、环肽的化学合成中. NCL方法的基本原理为: 在水溶液中, 具有N端半胱氨酸残基的线性多肽, 将另一端功能化为C端硫酯后, 在中性pH下发生连接反应, 形成环肽. 2006年, Bode等提出了α-酮酸羟胺(KAHA)连接法; 该方法使用C端具有α-酮酸的肽片段和N端具有羟胺或羟胺衍生物的肽片段, 发生化学选择性连接, 并在连接位点产生天然酰胺键, 不需要添加任何试剂或催化剂, 反应条件温和. 此外, 该反应在酸性条件下还可以增加蛋白质片段的溶解度, 并阻止敏感官能团的水解. 2010年, Li课题组开发出丝氨酸苏氨酸连接(STL)方法. 在该反应中, N端含有丝氨酸或苏氨酸的肽片段与C端为水杨醛酯肽的片段发生化学选择性连接, 形成唑烷, 随后发生O到N酰基转移, 再经过酸处理, 在连接位点产生天然酰胺键. STL方法利用自然界中丰度较高的丝氨酸和苏氨酸反应, 无需修饰肽N端, 并且与多种肽C端残基相容. 除上述方法外, 施陶丁格连接(Staudinger ligation)、铜催化炔烃-叠氮(CuAAC)反应[44]等方法也被广泛应用于环肽合成中(图4).
化学连接策略不仅使合成更加便利, 还展现了许多独特的优势. 引入小分子linker, 一方面可以增加新功能基团, 实现稳定性修饰等目标. 例如, Baran团队开发了一种利用未受保护的线性肽的N端氨基和C端醛的肽环化方法: 在高度稀释的水相中, 多肽首先自发形成不稳定的分子内亚胺; 然后, 亚胺和小分子亲核试剂反应, 在环化位点引入不同的新结构, 如α-氨基腈、仲胺、杂环等. 另一方面, 小分子linker有助于合成结构更复杂的环肽, 扩展合成空间. Voss等使用低毒性的Bi作为配位剂, 通过三价铋盐和肽段中的3个半胱氨酸残基配位, 形成双环结构, 大幅提高了多肽的穿膜能力. 此外, 一些性质优异的小分子linker可以作为骨架平台, 实现系列环肽的通用合成. Harran团队以高反应活性的八氟环戊烯(OFCP)为骨架, 可以在不使用金属催化剂的条件下, 与多个肽段中的亲核残基发生反应, 形成稳定的氟化螺杂环结构. 利用该策略, 能够实现系列高透膜性的环肽合成, 且产物能够有效模拟蛋白复合物中的局部界面结构; 在产物基础上, 还可以进一步衍生化, 通过引入更多亲核试剂、插入分子等策略, 合成糖肽、双环等多样化结构.
2.3 环肽分子库的合成策略
为实现更大数目、高通量的环肽合成, 以适应药物筛选的需求, 系列构建分子库的策略也被应用于环肽体系中. 传统的噬菌体展示方法, 通过加入含有硫脲结构单元的linker, 可以连接半胱氨酸残基, 形成单环/多环化的结构. mRNA展示技术也可以用于环肽库的构建[50], 相比噬菌体展示, mRNA展示过程不需要在细胞内进行, 可以更方便地引入非天然氨基酸
除上述传统方法外, 近年来还发展出了DNA编码化合物库(MP-DEL)的方法, 用于构建环肽分子库[55]. 该方法的原理为: 利用DNA的碱基互补原则, 将不同的化学构建单元定位到目标模板上, 从而在空间上靠近, 并发生高效的化学反应, 最终形成环肽. 2004年, Liu团队[56]通过Wittig反应关环, 实现了MP-DEL的DNA模板合成, 验证了该思路的可行性. 2018年, 他们[57]利用该方法构建了含256000个分子的环肽库, 并成功筛选出了对Src激酶、IDE等靶标具有高亲和力的环肽分子. Ensemble Therapeutics公司与BMS公司合作, 开发了基于CuAAC环化反应得到的环肽分子库, 筛选出可用于肿瘤治疗的XIAP抑制剂[58].
MP-DEL适用于需要高化学选择性的合成反应, 由于构建模板与带有反应基团的寡核苷酸较为繁琐, 只适合构建中等规模(103~106级)的环肽库, 难以拓展到超大规模库. Scheuermann等对MP-DEL进行了改进, 采用“拆分-混合-编码”策略, 每步反应后将编码序列连接到DNA上, 无需空间定位模板, 使其可以适用于构建超大规模DEL库(百万至万亿级), 进一步提升了该方法的应用价值.
3 计算机辅助的环肽药物设计方法
和一般意义上的计算机辅助药物设计(CADD)思路一致, 结构信息对环肽药物设计至关重要, 是理解相互作用、优化成药性质的基础. 针对环肽体系成环方式多样、结构单元丰富等特点, 近年来涌现出许多适用于不同类型环肽的结构预测和生成工具(图5). 按照模型原理, 这些方法大致可以分为基于物理的方法和基于知识的方法. 对环肽体系来说, 除了单一的稳定结构, 具有多个稳定构象, 甚至没有稳定构象的环肽, 对于药物开发也有特殊意义. 例如, 一些研究认为, 环肽的多种稳定构象是其具有良好穿膜能力的原因, 可以作为药物设计的重要思路. 因此, 还可以将这些计算工具划分为稳定结构的预测和生成方法, 以及构象系综的预测和生成方法. 此外, 考虑到在实验端, 环肽的结构和性质数据较少; 而对基于知识的方法(如深度学习模型)开发依赖于大量数据, 近期也有许多工作开始建立包含环肽实验和计算结果的数据库, 并使用这些数据进行分子性质预测工具的开发. 针对上述研究问题, 本部分将介绍各领域近期的进展.
3.1 环肽稳定结构的预测和生成
计算预测环肽结构的方法主要应用于两类任务: 游离态的环肽单体结构预测和基于靶标的环肽构象预测. 作为研究多肽和蛋白质的重要计算工具, 分子动力学(MD)模拟在上述任务中有广泛应用. 选取合适的分子力场和采样方法, MD模拟可以对环肽单体及蛋白-环肽复合物给出高精度的结构预测. Geng等[62]以晶体结构作为基准, 考察了4种力场(AMBER99sb-ildn, OPLS-AA/L, RSFF1, RSFF2)对环肽分子的结构预测能力. 结果表明, 基于卷曲库(coil library)统计结果进行参数化的RSFF2力场可以得到最准确的结果; 在含有20个环肽的测试集上, 成功预测了17个体系的晶体结构. Chen等[63]在研究中也发现, 使用高温MD模拟的增强采样方法, 可以准确预测蛋白-环肽复合物的结构(配体对比晶体结构的均方根偏差(RMSD) < 1.5 Å). 经典的增强采样方法, 如副本交换分子动力学(REMD)[64]、元动力学[65], 也可以用于环肽体系, 加速构象采样过程. Lin等[66]的研究表明, 结合偏置项交换的元动力学模拟(BE-META)、基于二面角的主成分分析和基于密度峰的聚类分析方法, 可以实现对环肽体系构象分布的准确描述[67].
特别地, 对于一些能垒较高的构象转变过程, MD模拟在描述其构象行为方面具有独特优势. 例如, 相比于线性多肽, 顺式脯氨酸肽键在环肽中高频率出现, 并对环肽的结构稳定具有重要作用[68~71]. 由于肽键顺反异构的能垒较高(18~22 kcal/mol), 传统的MD模拟方法很难采样到顺反异构的过程. Dai等[72]使用RSFF2C力场结合高温MD模拟的采样方法, 准确预测了在23个含有顺式脯氨酸肽键的环肽中, 19个体系的结构; 作为对比, 基于打分函数的Rosetta预测方法, 仅成功预测了2个体系的晶体结构.
尽管MD模拟的精度可靠, 但其计算成本较高. 常用的REMD, 模拟得到收敛结果的计算时间往往是常规模拟的数十倍. 另外, 常见的分子力场一般只针对标准氨基酸优化力场参数, 对于含有修饰的环肽分子体系, 需要额外补充修饰部分结构的力场参数, 进一步提升了MD模拟方法的计算成本. 例如, 环孢素A (cyclosporin A, CsA)含有7个N-甲基化氨基酸, 由于甲基化部分结构的力场参数缺失, 无法直接进行MD模拟; Yamane等[73]在研究中, 通过参考CHARMM力场拓扑文件和电荷信息, 加入CMAP项修正势能面, 拓展非天然氨基酸参数等改进, 准确模拟重现了CsA的动态构象变化和膜渗透机制. 这种方法基于特定体系, 缺乏泛化能力, 在普适性上存在局限性.
为适应CADD高通量筛选的需求, 一系列基于物理的打分函数也被开发, 用于快速预测环肽的稳定构象. Baker课题组[74]开发的Rosetta软件, 是一个经典的预测工具套件. 该软件内置的simple_cyclic_peptide模块可以根据输入环肽序列(支持D型氨基酸作为输入), 使用genKIC关环算法快速生成构象; 搭配其开发的系列打分函数(Rosetta energy function)[75], 可实现对环肽单体稳定结构的预测. 在已知靶标的情况下, 分子对接方法是预测环肽配体与靶点结合构象的常用工具, 其核心也是评估相互作用的打分函数. 经典的对接方法, 包括AutoDock CrankPep[76]、HADDOCK[77]等, 适用于此类场景. 对适用于环肽单体和基于靶点的环肽配体结构预测任务的打分函数, 可参考王凡灏等[78]进行的系统性总结.
为更高效地设计新型环肽配体, 一些融合打分函数的环肽设计方法相继被开发出来. 例如, Santini等[79]开发的cPEPmatch方法, 基于输入的蛋白质复合物结构, 提取PPI信息, 和内置的环肽结构数据库比对, 进行片段匹配、打分建模、残基突变、能量优化, 最终输出预测的环肽配体. Wang等[80]开发的CYC_BUILDER方法, 利用从天然蛋白结构中提取的三肽片段库进行环肽配体组装建模. 其工作流程中, 热点残基识别、亲和力打分、构象优化等步骤均使用了Rosetta打分函数. Zhang等[81]提出的CycDockAssem策略, 使用短肽片段组装环肽骨架后, 同样利用了Rosetta工具设计序列, 输出设计的环肽结合剂. 利用该方法, 研究者成功设计了能以微摩尔级别亲和力与肿瘤坏死因子α (TNFα)结合, 且显著抑制下游基因表达的环肽抑制剂. 尽管应用场景多样, 如何优化得到精度更高的打分函数, 是该领域长期关注的共有问题. 在实际的研发工作中, 往往需要研究者权衡精度和效率, 选择合适的预测工具.
随着机器学习技术的发展, 研究者们利用大量的蛋白结构和序列数据开发了一系列深度学习模型. 对于结构预测任务, 最具代表性的工具包括DeepMind团队开发的AlphaFold系列[82,83]和Baker课题组[84]开发的RoseTTAFold. 尽管上述工具的原始模型在蛋白、多肽的结构预测任务上取得了巨大成功, 但由于模型仅以序列作为输入, 预测过程缺乏对于结构环化的几何限制, 在进行环肽结构预测时仍然存在局限.
有一系列的研究工作尝试对上述模型进行优化, 使其可以用于环肽结构的预测. 早期的一些研究通过调整模型中的位置编码模块, 使其从线性的位置编码, 变为可以反映环肽结构限制的相对位置编码(relative positional encoding with cyclic offset). 例如, Rettie等[85]通过修改位置编码, 调整AlphaFold-2得到了AfCycDesign模型, 实现了环肽结构的准确预测; 在80个从PDB中搜集到的环肽测试集上, 准确预测了58个体系的结构(对比晶体结构的RMSD < 1.5 Å, 预测结果置信度pLDDT > 0.7). Duan团队[86]利用类似思路, 在修改位置编码的同时增加了检测二硫键连接的组合算法, 使得模型可以识别头尾环化/二硫键环化两种环化模式; 基于AlphaFold-2和AlphaFold_Multimer[87]训练得到的模型HighFold, 在包含63个环肽的单体测试集上, 其表现优于AfCycDeisgn (RMSD均值分别为1.478和1.737 Å), 在含有17个环肽-蛋白复合物的测试集上表现也优于AlphaFold_multimer(环肽RMSD均值分别为0.359和1.866 Å).
经过上述改动, 模型可以用于环肽分子的结构预测, 但仅支持标准氨基酸. 另一些研究尝试拓展了预定义的结构单元, 使模型可以用于含有非天然氨基酸的环肽结构预测. 例如, Duan团队[88]在AlphaFold_Multimer模型的基础上, 引入原子层面的特征提取模块, 并在该模块上拓展了氨基酸基团的预定义, 训练得到的HighFold-2模型, 可以适用于含有额外21种非天然氨基酸的环肽结构预测. Li等[89]开发的RareFold模型, 基于AlphaFold-2的核心架构EvoFormer, 拓展定义了局部结构的token, 并调整了含非天然氨基酸序列的多序列比对(MSA)流程, 实现了对29种非天然氨基酸的兼容. Cao等[90]、Xie等[91]和Mao等[92]还分别从AlphaFold-3/Boltz-1 (AF3的克隆模型)/RoseTTAFold-All-Atom[93]出发, 微调得到了HighFold-3/CyclicBoltz-1和NCPepFold, 实现了对含非天然氨基酸的环肽结构预测. 此外, 对于由非天然氨基酸结构基元组成的大环分子, 研究人员还提出了一种新的建模思路: 预定义包含α/β/γ-氨基酸等在内的22种基本结构单元, 使用深度学习势能函数AIMNet[94]预测每个结构单元的低能量构象; 在此基础上, 根据输入的序列, 进行低能量结构单元的组合、优化, 最终输出预测的构象. 利用该思路, 研究者合成了18个预测结构稳定的大环分子, 其中15个体系的X射线衍射(XRD)/核磁共振(NMR)谱图测定结构与设计模型高度吻合(RMSD < 0.8 Å)[95].
另外, 深度学习模型的准确性依赖于从训练集的结构和序列信息中学习到的预测结构时涉及的关键相互作用. 已有模型往往基于线性肽的数据库进行训练, 是否准确捕捉了环肽的结构特征仍需评估. 因此, 一些工作也探究了利用环肽结构数据微调模型的可行性. Cao等[96]利用Rosetta计算工具, 预先生成了包含21类非天然氨基酸单元的2750个环肽构象, 再利用该数据集微调AlphaFold, 训练得到MeDCycFold模型, 实现了对含有甲基化和D型氨基酸的环肽结构预测. 考虑到Rosetta生成环肽构象的准确性, 使用如MD模拟等方法获取更高质量结构数据作为训练集, 也许可以进一步提升模型的预测精度.
作为结构预测的逆向任务, 蛋白序列设计一般的思路为: 利用计算工具(如RFdiffsuion[97])先生成骨架, 再搭配序列生成工具(如ProteinMPNN[98])生成骨架对应的氨基酸序列. 针对上述流程, 研究者们也进行了前述类似的系列优化, 以适用于环肽的序列设计. Rettie等[99]调整了RFdiffusion模型, 引入环状相对位置编码, 以适用于大环骨架的生成. Xu等[100]利用环肽数据集微调了ProteinMPNN模型, 并将其和结构预测模块HighFold集成构建了HighMPNN模型, 实现了环肽序列的直接设计; 经过改动, 在包含20个环肽的测试集上, HighMPNN的平均序列恢复率为66.29%, 远高于原始的ProteinMPNN模型(37.66%). Li等[101]在EvoBind-2模型的开发工作中, 提出了新的环肽配体设计流程: 以靶点序列作为输入, 利用修改后的AlphaFold-2和AlphaFold_Multimer模型, 搭配进化算法, 迭代优化配体序列, 最终同时输出预测的序列和结构; 利用该方法, 针对核糖核酸酶靶点, 设计出了长度为14个氨基酸的环肽, 其结合亲和力为0.26 nM, 相比野生型线性肽(35 nM)提升了137倍. Zhou等[102]以全原子扩散模型作为基础, 利用分子图显式表示成环约束, 开发了CPSDE模型, 实现了包括头尾环化/侧链环化/头-侧链环化/尾-侧链环化多种环化方式的环肽序列设计.
3.2 环肽构象系综的预测和生成
相比稳定结构预测, 获取蛋白/多肽体系在平衡状态下的构象系综, 可以帮助研究者准确地分析体系的热力学/动力学性质, 如构象转变路径、结合自由能等, 更有效地辅助药物研发相关工作. 考虑到多态构象对于环肽药物发挥作用的特殊意义, 环肽构象系综的预测和生成也是近年来重要的研究方向.
目前, 对于环肽分子在溶液中的构象分布, 可以通过NMR等实验手段进行表征. 不过, 由于环肽分子的柔性(需要采样的构象数目多), 以及实验方法的成本, 想要通过实验准确测定环肽分子的构象系综仍然具有挑战. 显式溶剂的MD模拟, 从计算上提供了描述环肽在溶液中构象系综分布的有效手段. 对比已有的NMR结果, Miao等[103]考察了不同力场(RSFF2, RSFF2C, AMBER03, AMBER14SB, AMBER19SB, OPLS-AA/M, AMBER14SBonlysc)搭配不同的水模型, 对实验测定的环肽构象分布的还原能力. 结果表明, 在12个测试的环肽体系上, RSFF2 + TIP3P/RSFF2C_TIP3P/AMBER14SB + TIP3P三种参数搭配的效果最好, 可以准确重建10个体系的结构信息.
随着深度学习模型在蛋白静态结构预测任务上大放异彩, 研究者们也开始将目光转移到如何使用深度学习模型直接生成蛋白/多肽的构象系综, 获取动态信息的同时, 克服MD模拟方法的高计算成本瓶颈. 一些早期的探究发现, 尽管AlphaFold的主要功能是预测蛋白的静态结构, 通过调整预测过程中关键的MSA步骤, 可以实现蛋白多态构象的预测[104~106]. 例如, Rubenstein等[107]研究表明, 调整MSA过程中的对齐序列数量(max_seq)和聚类序列数量(extra_seq)参数, 结合多次平行预测, 可以得到蛋白不同状态的构象集合(如Abl1激酶在溶液中的3种构象), 还可以反映点突变造成的构象偏好变化(如粒细胞-巨噬细胞集落刺激因子GMCSF中的突变效应). Noé团队[108]开发了Boltzmann生成器, 用于直接生成给定的蛋白构象分布; 在含有892个原子的BPTI蛋白体系上测试, 可以生成与1 ms MD模拟能量分布高度重合的构象集合. 随后, 他们[109]又构建了由总长度超过200 ms的海量MD模拟数据组成的训练集, 微调基于AlphaFold数据预训练的扩散模型, 得到了具有泛化能力的蛋白构象分布生成模型BioEmu. Liu团队[110]从机器学习的技术角度, 开发了Distributional Graphormer (DiG)的扩散模型架构, 从实验和MD模拟数据中学习分布特征, 实现了对SARS-Cov-2病毒中RBD蛋白的构象分布预测, 其预测结果覆盖了70%毫秒级别MD模拟探索到的构象空间. 此外, 还有一些研究从生成对抗网络等思路出发, 也探索了生成模型可能的构建策略[111,112]. 目前, 该领域还处于蓬勃发展阶段, 亟待解决的问题包括: 相比静态的结构预测, 构象系综的预测和生成对于结构数据的需求更大; 在数据有限的情况下, 模型的泛化能力难以保障; 由于数据获取和训练成本的限制, 大部分模型为粗粒化精度(只生成骨架构象), 拓展到全原子精度还存在挑战等.
环肽体系的尺度相比蛋白小很多, 在相同的计算成本下, 利用MD模拟可以采集到更丰富的结构数据, 有助于提升模型的泛化能力. 因此, 一些工作探究了MD模拟数据驱动的环肽构象系综预测和生成模型的开发(图6). Lin团队[113,114]在研究中构建了705个环五肽单元, 进行MD模拟并收集统计了其构象系综的population数据; 利用该数据集, 分别训练了线性回归模型和图神经网络模型, 实现了给定环五肽/环六肽序列输入, 准确预测了其对应构象系综的population. Zeng等[115]在研究中, 模拟了250条长度范围在5~10的环肽体系, 利用收敛轨迹结合概率密度估计的方法, 获取了每一个构象的构象自由能标签; 以结构信息和能量标签作为数据集, 训练得到了环肽构象自由能函数CPconf_score, 可以快速地对给定构象集合输入, 预测其能量分布. 在稳定结构预测的任务上, CPconf_score可以给出高度还原MD模拟结果的预测, 准确预测了测试集上50个环肽体系中42个体系的晶体结构, 兼顾了MD模拟的精度和机器学习模型的预测效率. 表2对本文所涉及的算法进行了简要介绍.
3.3 环肽数据库的建立和分子性质预测工具的开发
尽管数据相比蛋白体系更加稀缺, 随着该领域研究的开展, 许多环肽相关信息的数据库也逐渐开始建立. 目前, 环肽信息相关的数据库大体可以分为两类: 一类是以结构信息为主的数据库, 这一类数据库的建立, 往往是因为结构预测和设计工具开发时, 在训练和测试等环节需要比对一些已有的实验结构. 例如, cPEPmatch方法设计环肽配体依赖于比对已知的PPI信息和环肽结构, 因此在模型构建时, 整理建立了一个包含有432个蛋白-多肽复合物的结构数据库; NCPepFold方法在测试其对含N甲基化和D型氨基酸的环肽结构预测能力时, 收集了142个环肽单体结构和96个蛋白-环肽复合物结构. 这些数据集通常结构数目不超过500个, 对于类似任务的方法开发和基准测试有参考价值.
另一类数据库主要以功能为导向, 根据环肽的性质, 如膜透过性、生物活性等, 收录对应的分子结构和性质信息. 例如, CycPeptMPDB数据库收集了7334个环肽透膜性的数据[122]; CREMP数据库归纳了36198个大环肽的结构和3258个透膜性数据[123]; DBAASP数据库包含了有抗菌和细胞毒素活性的597个非核糖体环肽和1413个核糖体环肽信息[124]; CyclicPepedia收录了8744个人工合成和天然环肽的结构、理化性质等信息[125]. 这一类数据库的数据较单一的结构数据库数目更大, 信息更丰富, 可以有效地帮助环肽分子性质预测工具的开发. 譬如, 借助CycPepMPDB数据库, Li等[126]利用机器学习模型和数据增强的方法, 充分提取了原子/氨基酸/环肽层面的特征信息, 训练了环肽透膜性预测器CycyPepMP, 模型测试的平均绝对误差和相关系数分别为0.355和0.833, 在透膜性预测的准确性上达到了性能最优.
4 环肽药物设计开发
由于环状构象约束, 环肽相较于线形肽具有有限的构象灵活性和局部二级结构基序, 在靶向PPIs中往往因其高亲和力和特异性而备受关注[127,128]. 一些研究表明, 环肽通过实现一定程度的结构预组织, 即在溶液中保持特定构象的能力, 能够使其在结合时不会产生较大的熵损失, 实现高亲和力的结合[72,129~131]. 此外, 设计环肽药物时, 除需要考虑对靶点的结合亲和力, 还需要考虑设计分子的透膜能力、可口服性等性质. 以透膜性为例, 研究者往往需要利用环肽多构象的性质, 设计在极性/非极性溶剂环境下均具有稳定构象的分子, 以增强其穿膜能力[132]. 此时, 分子既要具有局部稳定构象, 也要能在多个局部稳定构象间快速转换, 对设计提出了更高的要求. 结合上述环肽特性, 本部分将介绍部分药物设计和研究的典型实例.
4.1 单稳定构象的环肽药物设计和研究
Lin等[130]通过对Keap1结合蛋白上的loop区进行环化, 设计了一系列含有双硫醚连接的环肽, 并结合增强采样方法BE-META与RSFF2力场, 对设计分子的预组织程度进行了预测. 研究发现, 计算预测的环肽稳定构象比例, 与实验测量的结合亲和力具有相关性; 利用该策略经过多轮优化, 设计出了以高亲和力(Kd=4.7 nM)靶向Keap1蛋白的环肽结合剂CP11 (图7a). 同样地, Voelz等[131]利用分子动力学模拟和马尔可夫状态模型, 分析了模仿p53转录激活域的4个环状β-发夹配体与MDM2的折叠和结合过程. 研究比较了溶液中环肽折叠状态的占比与实验测定的结合亲和力, 结果显示, 溶液中折叠状态占比与Kd之间存在强相关性(R² = 0.962). 例如, 折叠状态占比为88.49%的肽, 其Kd为0.127 μM, 而折叠状态占比较低的肽(如11.49%和10.19%)的Kd分别为7.00和5.73 μM, 表明预组织程度高的环肽在结合时熵损失减少, 从而帮助提升结合亲和力.
除此之外, 向日葵胰蛋白酶抑制剂-1 (SFTI-1)作为一种有效的蛋白支架, 常用于激肽释放酶4抑制剂的开发, 在前列腺癌和卵巢癌的治疗中显示出巨大潜力. SFTI-1以亚纳摩尔级的高亲和力(Ki = 0.1 nM)靶向牛胰蛋白酶; Dai等[72]通过模拟单个SFTI-1和bovine β-trypsin与SFTI-1的复合物在溶液中的构象系综发现, SFTI-1的游离态与结合态的构象非常一致, 这可能解释了两者高亲和力的来源(图7b).
4.2 多构象环肽药物的设计和研究
从天然产物中提取或衍生出来的环肽, 大多数为激素及其类似物, 或是抗生素/抗真菌药物, 绝大多数不针对胞内蛋白, 也不能口服[133]. 环孢素(CsA)是少见的天然具有良好膜渗透性的环肽药物, 常用于干眼病、器官移植免疫排斥等的治疗[134,135]. 环孢霉素含有11个氨基酸, 其中7个氨基酸的酰胺基团被N-甲基化, 如图8a所示. 使用甲基取代酰胺氢, 可以降低其溶剂暴露程度, 并增加环肽的稳定构象数目, 有利于环肽透膜. 研究表明, 环孢素是典型的“变色龙”肽, 具有不同的肽键顺反异构体. Do等[136,137]的统计结果表明, CsA含有7种肽键顺反构象异构体, 其中4种可以与晶体结构对应, 如图8b所示.
利用N-甲基化策略, Baker团队[138]从头设计了一批6~12氨基酸长度的环肽, 并成功得到具有高透膜性的环肽先导化合物. 该研究中通过使用经过修改的genKIC关环算法, 生成了环状聚甘氨酸支架, 并利用FastRelx模块进行序列设计; 将不满足分子内氢键暴露的酰胺氢进行N-甲基化, 实现了透膜肽的从头设计, 如图8c所示. 对其中设计的一条序列(编号D9.16)进行实验测定, 验证了其具有良好的透膜性; 此外, 研究者还进行了结构预测, 计算显示该体系存在多种低能量构象, 不同构象间具有不同的肽键顺反异构化状态, 也验证了多构象有利于分子透膜的设计思路.
4.3 环肽作为遮蔽肽的应用开发
抗体药物是一类通过特异性识别靶抗原以发挥治疗作用的大分子生物制剂, 目前已成为肿瘤学、自身免疫性疾病及感染性疾病等领域的重要治疗手段. 然而, 由于部分靶抗原在正常组织中存在生理性表达, 可能导致“中靶脱瘤(on-target/off-tumor)”效应, 进而引发治疗相关的毒性反应[139]. 为克服这一局限性, 基于肿瘤微环境响应性激活的前抗体药物概念应运而生[140]. 经典的前抗体药物通过在抗体分子上引入遮蔽模块, 使抗体暂时处于“非活性”状态; 当药物到达肿瘤组织后, 肿瘤微环境中的蛋白酶可切割该遮蔽模块, 从而实现抗体的原位激活, 显著降低系统性毒性(图9).
目前, 前抗体药物的遮蔽机制主要分为两类: 一是基于空间位阻效应的立体遮蔽策略, 二是通过结合抗体互补决定区(CDR)以阻断抗原结合功能的结合抑制策略[141]. 基于构象稳定的特点, 第二类遮蔽模块中, 多采用环肽作为分子设计的基础框架. 例如, CytomX Therapeutics公司作为遮蔽肽技术的先驱, 开发了其核心的 Probody®技术平台. 处于I期临床研究的候选药物CX2051 是一款基于该平台的条件激活型抗体偶联药物(ADC), 靶向上皮细胞黏附分子(EpCAM). 相较于传统策略, CX2051利用肿瘤微环境特异性激活机制, 选择性靶向肿瘤部位, 并在靶点处激活, 从而实现对EpCAM的精准作用. Xilio Therapeutics公司利用遮蔽肽技术, 开发了条件性激活抗体XTX101, 该候选药物目前正处于II期临床试验阶段. 通过噬菌体展示技术筛选, 研究获得了能够特异性结合抗CTLA-4抗体CDR的环肽. 将此环肽通过优化设计的linker与抗体偶联后, 构建的XTX101分子能够实现对CTLA-4抗体的有效遮蔽[142].
利用环肽分子, 通过特异性结合CDR实现活性遮蔽的策略, 相比基于空间位阻的遮蔽策略, 具有更强的可调控性; 其遮蔽效率可通过筛选不同亲和力的环肽进行优化, 从而获得更优的体内药效特性. 不过, 目前该技术还存在通用性局限, 需针对不同抗体筛选独特环肽. 结合计算方法, 进行如结合模式预测、理性设计等在内的分析, 有望为该瓶颈提供更高效的解决方案.
5 总结与展望
环肽作为一类成药性质优异的多肽分子, 在药物研发中的应用越来越广泛. 从天然产物及其类似物出发, 一系列激素药、靶向药物被研发、获批上市; 利用其构象约束肽的性质, 可以开发得到高亲和力的结合剂/抑制剂; 利用其多构象转变、可调控的特点, 可以设计出高透膜性的先导化合物, 以及前抗体药物. 针对药物开发中的实际问题, 新的计算和实验手段不断发展. 实验方面, 多种化学/生物合成策略的开发, 使得环肽药物设计的种种构想得以被实现、验证; 以MP-DEL为代表的环肽分子库构建方法的发展, 搭配高通量筛选技术, 进一步提高了环肽药物开发的效率. 利用计算工具, 研究者可以获取多种复杂结构(如不同成环方式、不同修饰、含有非天然氨基酸单元等)的环肽单体和复合物的静/动态信息; 在此基础上, 计算方法可以辅助筛选、优化、从头设计, 以得到符合目标性质的环肽分子. 通过整理不断积累的计算和实验数据, 研究者们开始建立起环肽相关的综合数据库; 结合机器学习技术, 数据驱动训练的高精度模型被训练用于分析、预测环肽分子性质, 更好地指导了实验合成.
考虑到可探索化学空间的广泛性, 计算工具需要进一步发展, 以在适用场景、预测精度、提供信息的多样性等方面与实际应用更好地匹配. 主流的深度学习模型, 使用蛋白的结构和序列数据进行训练, 经过调整后, 能够适用于环肽体系预测的前提假设为: 环肽分子具有和线性肽及蛋白相似的二级结构偏好. 该假设对于不具有明确二级结构的小环肽分子(氨基酸数目不超过10)是否仍然成立, 直接影响模型预测精度的高低; 参考已开发的环肽药物分子, 多数结构中参与成环的残基数目小于10, 该问题则更加关键. 同时, 对于不具备稳定结构但仍有成药潜力的环肽分子, 可以通过生成模型等方法, 获取构象分布信息; 已有的预测工具, 在准确生成符合平衡分布的全原子级别构象集合任务方面还存在局限性. 上述两个问题共有的瓶颈为结构数据的缺乏; 使用MD模拟等方法构建数据集或进行数据增强, 辅助深度学习模型的训练, 被初步证明是有效的解决方案. 除结构信息外, 其他成药性相关的信息获取, 有助于更全面地分析、评估设计体系; 譬如, 结合亲和力作为基于靶标设计药物的关键参数, 其准确的预测和计算方法开发, 也对环肽的药物设计大有裨益.
此外, 实验和计算端, 仍需要更好地融合、交互; 深度学习技术的蓬勃发展为解决这些问题提供了有效的工具. 譬如, 除了常规的成环方式, 实验研究中拓展的一系列环肽构建方法, 如小分子linker成环、双环及多环结构合成, 需要对应的计算方法发展, 以高效、准确地分析其结构和功能之间的关系; 开发具有泛化能力的量子化学精度机器学习力场, 或许可以提供一种兼顾精度和效率的普适性分析工具. 一些拓扑结构复杂的环肽体系, 对计算和实验方法提出了更加深入的开发要求. 例如, 套索肽(Lasso peptides)作为一类天然产物, 存在C端氨基酸穿过分子内大酰胺环的独特“套索”结构, 赋予了其优异的热稳定性和蛋白酶稳定性, 被认为是具有理想药代动力学性质的潜在药用分子。对于该类型体系, 已有的实验解析结构稀少, 现有的结构建模工具无法准确预测, 加之缺少系统性的化学和生物合成方法, 限制了其大量发现. 近期, 针对套索肽体系的新型机器学习结构预测工具(如LassoPred[148])和生物合成方法的开发, 为该类型的药物分子研发提供了契机. 另外, 实验研究在方法学开发的同时, 往往还需要考虑产率等实际问题; 借助已有的数据积累和深度学习模型, 进行可合成性的预测, 既可以为理论设计提供筛选标准, 也可以指导实验的可行性分析, 进一步提升从计算设计到实验验证的通路效率.
参考文献:doi.org/10.1360/SSC-2025-0183
免责声明:本文为行业交流学习,版权归原作者所有,如有侵权,可联系删除
扫码联系我们
电话:18455186404
微信:salepeptide
定制多肽,肽库生物