背景
合成生物学是绿色生物制造、天然药物合成、底盘细胞改造与功能基因回路开发的底层核心技术,是未来生物经济产业创新发展的基石赛道,更是全球源头生物制造工业化转化的重点攻坚方向。当前主流传统合成生物研发体系高度依赖天然元件筛选、代谢通路随机拼接、多轮菌株高通量筛选与体内体外多轮迭代改造等湿实验流程,整套技术体系工序繁杂、实验迭代轮次极多、完整研发周期动辄数年,且前期高通量湿实验投入、人力耗材与时间成本居高不下。与此同时,传统研发模式以随机组装、经验试错为核心逻辑,通路适配可控性较差,在应对复杂多耦合代谢网络、高表达负荷的异源通路、上下文敏感的基因元件、低适配性底盘改造等复杂难题时适配能力严重不足,技术局限性日益凸显,难以满足当下规模化生物制造、高附加值天然产物药物的工业化研发需求。
依托人工智能、计算生物学与多组学大数据的深度交叉融合,蛋白大模型、DNA生成扩散模型、原子尺度代谢网络模拟与动态细胞构象预测算法等前沿技术,推动合成生物学研发范式实现根本性革新,彻底打破了传统被动筛选、经验拼接优化的固化研发模式。研究人员可通过AI算法精准解析细胞全局代谢调控网络、识别通路关键限速节点,定向优化基因元件序列、通路界面耦合作用力与宿主细胞全局理化属性,自主设计并构建具备全新序列、全新调控逻辑、全新代谢功能的原创基因线路与底盘细胞。通过AI全流程赋能,可大幅精简元件筛选、通路理性设计、菌株活性优化、发酵成药性评估的迭代流程,极大缩短前期研发周期,显著提升异源产物表达产量、通路稳定性、宿主细胞遗传稳定性与整体工业化适配质量,同时有效降低代谢负担、细胞毒性与脱靶表达风险,解决了传统研发试错率高、优化维度单一、原创度不足、工业化成功率偏低等核心痛点,全方位升级标准化、智能化、精准化的合成生物学研发体系,为各类高价值天然药物分子、生物基材料、大宗精细化学品的工业化量产提供高效、低成本的创新生物制造研发路径。
热门直播课程
01、AI+合成生物学实战应用
02、AI+抗体设计实战应用
03、AI多肽设计与大模型设计实战应用
04、AI蛋白质设计实战应用
05、AI构建虚拟细胞实战应用
06、AI智能体驱动生物医学实战应用
07、人工智能驱动的计算免疫学实战应用
限时特价
优惠600元(限10名)
课程支持永久回放,正规发票均可开具
专属讲师社群实时答疑。实操代码全套附赠
扫码咨询 ,锁定优惠名额!
AI+合成生物学
上下滑动查看
一、AI合成生物学总览与数据基础1. 合成生物学的工程化框架
1.1 合成生物学的核心对象:parts、devices、circuits、pathways、genomes、cells。
1.2 从传统“试错式工程”到 AI 驱动的设计闭环。
1.3 DBTL 框架:Design、Build、Test、Learn。
1.4 AI 在 DBTL 中的位置:预测、生成、筛选、推荐、自动化实验、闭环优化。
1.5 为什么合成生物学需要 AI:组合空间巨大、上下文依赖强、实验成本高、数据噪声大。2. AI 合成生物学的数据类型
2.1 DNA/RNA 序列数据:启动子、增强子、RBS、UTR、终止子、riboswitch、gRNA。
2.2 蛋白序列与结构数据:酶、受体、转录因子、变构开关、传感器结构域。
2.3 表达与表型数据:荧光、转录强度、产量、滴度、速率、动态范围、EC50。
2.4 多组学数据:转录组、蛋白组、代谢组、CRISPRi扰动数据。
2.5 高通量实验数据:MPRA、筛选库、条形码测序、自动化 biofoundry 数据。3. AI 方法基础
3.1 监督学习:从序列或组学特征预测功能和表型。
3.2 生成模型:从目标功能反向生成 DNA、RNA、蛋白或线路方案。
3.3 主动学习与贝叶斯优化:决定下一轮最值得做的实验。
3.4 基础模型:蛋白语言模型、基因组语言模型、多模态生物模型。
3.5 AI agent:从单个预测工具到自动化实验设计助手。
3.6 模型评估:准确率、R2、MAE、外推能力、不确定性、实验验证成功率。
图源:Genome modelling and design across all domains of life with Evo 2, Nature, 2026。
图源:A machine learning Automated Recommendation Tool for synthetic biology, Nature Communications, 2020。二、人工智能生物元件设计1. 生物元件的基本类型
1.1 启动子:表达强度、细胞类型特异性、条件响应。
1.2 增强子与顺式调控元件:调控语法、motif组合、位置效应。
1.3 RBS、5'UTR 和翻译调控元件:核糖体结合、翻译效率、mRNA结构。
1.4 终止子与绝缘元件:表达边界、上下文隔离、转录终止效率。
1.5 riboswitch 与 RNA 元件:小分子响应、RNA结构调控、可编程传感。
1.6 蛋白元件:转录因子、结合结构域、酶、传感器受体、降解标签。2. 传统元件设计与 AI 元件设计
2.1 传统方法:经验突变、motif拼接、文库筛选、理性设计。
2.2 AI 预测:从序列预测表达强度、特异性、响应曲线和上下文适配性。
2.3 AI 生成:按目标表达模式或细胞类型生成新调控序列。
2.4 AI 优化:在表达强度、特异性、稳定性和宿主负担之间做权衡。
2.5 关键难点:数据规模、实验噪声、宿主差异、序列上下文、模型可解释性。3. 启动子与调控元件设计前沿
3.1 MPRA 数据如何训练调控元件模型。
3.2 深度学习如何学习调控语法:motif、位置、方向、组合关系。
3.3 细胞类型特异调控元件的机器引导设计。
3.4 PARM:从 DNA 序列预测 promoter activity。
3.5 DNA-Diffusion:扩散模型生成细胞类型特异调控序列。
3.6 微生物启动子生成与代谢工程中的表达调节。
图源:Machine-guided design of cell-type-targeting cis-regulatory elements, Nature, 2024。
图源:Regulatory grammar in human promoters uncovered by MPRA-based deep learning, Nature, 2025。
实操:启动子、RBS 与调控元件快速判读*
使用 JASPAR 或 MEME Suite 对一段启动子/增强子序列做 motif 扫描或 motif discovery,观察模型如何把 DNA 序列转换成“转录因子结合位点/调控语法”线索;使用 Salis Lab Genetic Systems Calculator / RBS Calculator 输入 CDS 与目标翻译起始率,比较不同 RBS 设计对表达强度的影响。课堂产出为 motif 命中结果、RBS 设计结果截图和“哪些结果可以进入下一轮实验验证”的简短判断。4. 本章重点
本章让学员理解:AI 元件设计的本质,是从“查已有元件”转向“按目标表达行为设计新元件”。元件设计是后续基因线路、代谢工程和传感器构建的基础。三、AI基因线路设计1. 基因线路基础
1.1 基因线路的概念:用 DNA 编写细胞行为。
1.2 基础逻辑门:NOT、AND、OR、NAND、NOR。
1.3 经典线路:toggle switch、repressilator、feed-forward loop、feedback control。
1.4 输入、处理与输出:诱导物、传感器、调控模块、报告基因。
1.5 线路性能指标:动态范围、响应速度、泄漏表达、鲁棒性、负载效应。2. 为什么基因线路难设计
2.1 非线性动力学:Hill函数、反馈、双稳态、振荡。
2.2 宿主负载:转录翻译资源竞争、代谢压力、生长耦合。
2.3 上下文效应:元件连接后功能变化。
2.4 噪声与异质性:单细胞差异与群体平均的差别。
2.5 进化稳定性:突变、沉默、选择压力和线路失效。3. 线路设计中的模型方法
3.1 ODE 机理模型:从参数和方程理解线路动态。
3.2 逻辑综合:从目标真值表到基因门组合。
3.3 Cello 与 Cello v2:把电子设计自动化思想迁移到遗传线路设计。
3.4 机器学习代理模型:快速预测线路行为。
3.5 高通量线路测量:从一个一个调试到大规模设计空间映射。
3.6 生成式线路设计:从目标动态功能反向生成线路结构。
图源:Ultra-high-throughput mapping of genetic design space, Nature, 2026。
图源:Generative design of synthetic gene circuits for functional and evolutionary properties, npj Systems Biology and Applications, 2026。
实操:CelloCAD 逻辑线路自动设计演示*
使用 Cello / CelloCAD 输入简单逻辑需求,例如 AND、NOT 或两输入逻辑门,观察工具如何从高层逻辑规格转换为遗传门组合、元件库选择和候选 DNA 设计。课堂重点不做复杂线路调参,而是让学员理解“电子设计自动化思想如何迁移到基因线路设计”。4. 本章重点
本章让学员理解:AI 基因线路设计并不是简单预测一个元件,而是在元件组合、动态行为、宿主环境和进化稳定性之间做系统设计。AI 的价值在于帮助探索巨大组合空间,并把线路设计从手工调参推向自动化。四、AI基因组工程1. 基因组工程基础
1.1 基因组工程的目标:敲除、插入、替换、调控、重写。
1.2 CRISPR-Cas 系统:Cas9、Cas12、Cas13 的基本差异。
1.3 base editing、prime editing、CRISPRa/i、epigenome editing。
1.4 gRNA、PAM、on-target、off-target、编辑窗口和递送方式。
1.5 合成生物学中的基因组工程:通路整合、宿主优化、基因组压缩、基因组重编码。2. AI 如何辅助 CRISPR 设计
2.1 gRNA 活性预测:序列特征、GC含量、局部结构、染色质状态。
2.2 off-target 预测:相似序列、错配、插入缺失和安全评估。
2.3 编辑结果预测:indel分布、修复偏好、base editing效率。
2.4 多基因编辑与组合扰动设计。
2.5 CRISPRi/a 在代谢工程和线路调控中的应用。3. AI 设计基因编辑器与基因组基础模型
3.1 从自然 CRISPR 系统挖掘到 AI 生成编辑器。
3.2 OpenCRISPR-1:AI 设计高功能基因编辑器的案例逻辑。
3.3 大规模基因组/宏基因组数据如何训练 CRISPR-Cas 模型。
3.4 Evo 2 等基因组语言模型:从单核苷酸分辨率理解和生成基因组序列。
3.5 基因组语言模型在变异解释、调控序列生成、合成基因组设计中的潜力。
3.6 AI 基因组工程的双重用途风险与安全边界。
图源:CRISPR-GPT for agentic automation of gene-editing experiments, Nature Biomedical Engineering, 2025。
图源:Design of highly functional genome editors by modelling CRISPR-Cas sequences, Nature, 2025。
实操:CRISPR 靶点与 gRNA 候选筛选*
使用 CHOPCHOP 或 CRISPOR 输入教学用基因名、基因组坐标或示例 DNA 序列,比较候选 gRNA 的 on-target 分数、PAM、GC 含量和 off-target 风险。4. 本章重点
本章让学员理解:AI 基因组工程包括三个层次,一是优化 gRNA 和编辑实验,二是设计新的编辑器蛋白,三是用基因组基础模型理解和生成更大尺度的 DNA 程序。课程强调科研理解与安全边界,不提供高风险操作性设计。五、AI代谢工程与细胞工厂1. 代谢工程基础
1.1 代谢工程的目标:提高目标产物的产量、滴度、速率和稳定性。
1.2 细胞工厂:E. coli、Saccharomyces cerevisiae、Pseudomonas putida 等常用底盘。
1.3 通路设计:异源通路引入、关键酶优化、辅因子平衡。
1.4 代谢瓶颈:底物流向、能量供应、毒性、副产物、宿主负担。
1.5 传统策略:基因敲除、过表达、启动子调节、酶突变、适应性进化。2. 代谢工程中的计算模型
2.1 Genome-scale metabolic model。
2.2 FBA、pFBA、FVA、MOMA 等约束模型。
2.3 COBRApy、COBRA Toolbox、cameo、StrainDesign。
2.4 从代谢网络模型到基因干预建议。
2.5 模型局限:参数缺失、调控缺失、动力学缺失、实验上下文差异。3. AI 驱动的 DBTL 与菌株推荐
3.1 代谢工程为什么适合主动学习。
3.2 从组学数据、产量数据和构建信息训练模型。
3.3 贝叶斯优化与不确定性量化:选择下一轮最有价值的菌株。
3.4 ART:Automated Recommendation Tool 在合成生物学中的应用。
3.5 自动化 biofoundry:机器人实验、自动化测量和机器学习闭环。
3.6 CRISPRi 组合扰动与代谢通量调控。
图源:Automation and machine learning drive rapid optimization of isoprenol production in Pseudomonas putida, Nature Communications, 2025。
实操:酶挖掘、通路候选与代谢流预测*
使用 BRENDA 或 Selenzyme 从一个目标反应出发筛选候选酶,关注 EC 编号、底物范围、来源物种和文献证据;使用 KBase Run Flux Balance Analysis 或 Escher-FBA 演示通量平衡分析,观察培养基、反应敲除或目标函数变化如何影响生长和目标产物通量。若课堂时间有限,本章只保留 KBase/Escher-FBA 的代谢流演示。4. 本章重点
本章让学员理解:代谢工程不是单个基因的优化,而是细胞系统层面的资源重分配。AI 的价值在于把实验数据、组学数据、通路模型和下一轮设计建议连接起来,加速细胞工厂开发。六、AI生物传感器设计1. 生物传感器基础
1.1 生物传感器的作用:把不可见分子或细胞状态转化为可测信号。
1.2 传感器输入:小分子、代谢物、离子、蛋白、RNA、环境信号。
1.3 传感器输出:荧光、发光、颜色、电化学信号、抗性、生长优势。
1.4 传感器类型:转录因子传感器、riboswitch、CRISPR诊断、蛋白变构开关、FRET传感器。
1.5 传感器指标:特异性、灵敏度、动态范围、EC50、LOD、响应时间、背景噪声。2. 生物传感器与合成生物学闭环
2.1 传感器是 DBTL 中 Test 环节的关键入口。
2.2 传感器如何支持高通量筛选。
2.3 传感器如何把代谢物浓度转化为训练数据。
2.4 传感器与代谢工程、酶工程、线路设计的结合。
2.5 传感器失效原因:交叉响应、泄漏表达、动态范围不足、宿主背景干扰。3. AI 如何设计和优化传感器
3.1 受体设计:为目标小分子或蛋白设计识别结构域。
3.2 转录因子传感器改造:结合口袋、特异性和响应曲线优化。
3.3 变构蛋白开关:受体域和报告域的组合设计。
3.4 机器学习辅助突变库筛选。
3.5 剂量响应曲线建模与传感器变体排序。
3.6 生物传感器在细胞工厂开发中的闭环价值。
图源:Biosensor and machine learning-aided engineering of an amaryllidaceae enzyme, Nature Communications, 2024。
图源:Artificial allosteric protein switches with machine-learning-designed receptors, Nature Biotechnology, 2026。
实操:酶与传感器蛋白性质预测*
使用 Protein-Sol 或 SoluProt 输入候选酶/传感器蛋白序列,快速预测可溶性表达倾向;使用 DeepSTABp、FireProt 2.0 或 DynaMut2 评估热稳定性或突变对稳定性的影响;如需补充活性/底物层面的判断,可演示 DeepMolecules 对 enzyme-substrate pair、kcat 或 KM 的预测。4. 本章重点
本章让学员理解:生物传感器不仅是检测工具,更是 AI 合成生物学的“数据接口”。没有高质量传感器,许多代谢工程、酶工程和线路优化问题就无法高通量学习。七、代码实战:复现成熟 AI-SynBio pipeline1. 功能代码实战
2.1 生物元件生成主线:DNA-Diffusion
公开 Colab:
训练与序列生成:https://colab.research.google.com/github/pinellolab/DNA-Diffusion/blob/main/notebooks/training_and_sequence_generation.ipynb
使用 Hugging Face checkpoint 直接生成序列:https://colab.research.google.com/github/pinellolab/DNA-Diffusion/blob/main/notebooks/sequence_generation.ipynb
替换自定义数据训练与生成:https://colab.research.google.com/github/pinellolab/DNA-Diffusion/blob/main/notebooks/new_data_training_and_sequence_generation.ipynb
课堂用途:作为第一主线,演示“输入细胞类型/训练数据,输出候选合成调控 DNA 序列”的完整生成式 AI 流程。
2.2 调控效果评估主线:Enformer / AlphaGenome
公开 Colab:
DeepMind Enformer 使用示例:https://colab.research.google.com/github/deepmind/deepmind_research/blob/master/enformer/enformer-usage.ipynb
Google DeepMind AlphaGenome 可视化示例:https://colab.research.google.com/github/google-deepmind/alphagenome/blob/main/colabs/visualization_modality_tour.ipynb
课堂用途:与 DNA-Diffusion 串联,用生成出的候选 DNA 序列或示例变异片段,查看模型预测的调控效果。
2.3 代谢网络建模主线:COBRApy
公开 Colab:
COBRApy 代谢模型教学示例:https://colab.research.google.com/github/Gibbons-Lab/isb_course_2021/blob/main/models.ipynb
课堂用途:展示 FBA、通量平衡分析、培养基条件调整、基因敲除模拟和生长/产物权衡。
2.4 CRISPR 辅助设计主线:GuideHOM / CRISPR-GEM
公开 Colab:
GuideHOM gRNA on-target/off-target 预测:https://colab.research.google.com/drive/1VJkhQeqW1OkMG0VJoxcpML7LtnkvTX9e?usp=sharing
CRISPR-GEM 靶基因优先级分析:https://colab.research.google.com/github/jog822/CRISPR-GEM/blob/main/CRISPR_GEM_Github.ipynb
课堂用途:作为基因组工程备选实操,展示“候选靶点/候选基因输入,输出编辑效率、脱靶风险或靶基因优先级”的分析流程。
2.5 生物语言模型展示:Evo / Evo 2
公开 Colab:
Evo hello_evo 示例:https://colab.research.google.com/github/evo-design/evo/blob/main/scripts/hello_evo.ipynb
课堂用途:展示 DNA 语言模型如何读取、补全和生成序列。
2.6 GitHub 与顶刊 pipeline 拓展
PARM、ART、Cello v2、JBEI Isoprenol_CRISPRi、CRISPR-GPT 和 Evo 2 仍作为课程重要参考项目。其中 PARM 与 ART 更适合作为课后拓展或本地复现实验,不放在第一版课堂主跑流程中,避免安装依赖和运行环境占用过多授课时间。2. 实操运用串联
DNA-Diffusion + Enformer:
串联方式:
第1步:打开 DNA-Diffusion 的 sequence_generation Colab,使用公开 checkpoint 生成一批候选调控 DNA 序列。
第2步:将候选序列整理成 FASTA 或 CSV,保留序列 ID、目标细胞类型、生成参数和模型得分。
第3步:打开 Enformer Colab,选取代表性候选序列或使用课程预置片段,查看模型预测的调控信号、基因表达相关轨迹或变异效应。
第4步:根据预测结果筛选候选序列,并回到 DNA-Diffusion 的生成参数或训练数据设计,形成“小型 DBTL 闭环”。
课堂说明:这条链路可以串联讲,但不设计成一键全自动 pipeline。正式授课时应提前准备中间 FASTA/CSV 样例、截图结果和备用输出,确保网络或 GPU 波动时仍能顺利讲解。
COBRApy + ART :
COBRApy 负责稳定演示代谢模型和 FBA,ART 负责讲解机器学习如何推荐下一轮构建设计。该组合适合学员偏代谢工程、菌株设计或细胞工厂开发的班型。
GuideHOM + CRISPR-GEM:
GuideHOM 展示 gRNA 效率与脱靶风险评估,CRISPR-GEM 展示靶基因优先级分析。该组合适合学员偏基因组工程、功能基因筛选或 CRISPR 实验设计的班型。3. 实战讲解流程
4.1 pipeline 背景:对应论文、解决什么问题、在课程主线中的位置。
4.2 代码仓库结构:README、安装文件、数据目录、模型文件、运行入口。
4.3 环境准备:Python/conda/docker/GPU需求、依赖安装、常见报错。
4.4 输入数据:序列、表达表、菌株数据、组学数据或逻辑规格文件。
4.5 运行流程:核心命令、关键参数、运行时间、输出目录。
4.6 输出解释:预测结果、候选排序、图表、模型分数、下一轮实验建议。
4.7 结果复盘:pipeline 的优点、限制、适用场景和迁移方式。
4.8 科研迁移:如何替换成自己的启动子、线路、代谢工程或传感器数据。
AI+抗体设计
上下滑动查看
*涉及使用代码/计算工具的操作
第一天:代码基础,抗体基础,介绍各大药企在AI辅助抗体药物开发上的布局,复现GSK在抗体亲和力成熟上的工作
1. 代码基础知识讲解,环境搭建:Linux,VS code*
a) 超算的登录
b) Linux系统的常用shell命令:vim, ls, cd, less, rm等;
c) 一些package安装的常用命令:pip, conda, source等。
d) VS code的基本配置:连接服务器;选择不同python版本的Interpreter;debug模式的使用等。
2. 抗体基础知识讲解:
a) VDJ重排,germline,CDR区域,表位(epitope/paratope),抗体亲和力成熟,抗体的可开发性等概念介绍
b) 不同抗体编号方案(Kabat,Chothia,IMGT)讲解,使用python自动化对抗体序列编号,并识别CDR区域*
c) 抗体药物开发的基本流程
3. 各大药企在AI辅助抗体药物开发上的布局:讲解各大药企公司发表的文献及报告:
a) Genetech的lab-in-the-loop,结合了实验和计算方法的迭代优化策略的工作b) Genmab手动建立了多样性的抗体可开发性数据集,以进行可开发性数据的训练和预测.
c) GSK、阿斯利康、诺和诺德等在抗体亲和力成熟上做的工作等。
4. 抗体结构预测
1) 通用蛋白结构预测模型:AlphaFold3。
u运行网页server上的AlphaFold3预测结构,https://alphafoldserver.com*
uAlphaFold3输出结果分析,各项置信度指标的含义,以及如何判断预测的准确度,如pLDDT,ipTM,PTM,PAE。
uAlphaFold3的安装过程讲解。
a) 抗体专用结构预测模型:ImmuneBuilder,IgFold。实操如何在服务器安装和使用。
5. 复现GSK在抗体亲和力成熟上的工作*
第二天:基于大语言模型的抗体亲和力成熟。
1. 基础知识讲解
1) 介绍蛋白质的语言模型(26字母语言模型->20氨基酸字母表,上下文依赖->氨基酸的共进化)
2) 为什么要开发蛋白质大语言模型?
1. 相比于结构或功能信息,序列信息更加海量;
2. 蛋白质序列通过进化而来,可以学习蛋白质基本规律,折叠,共进化等
3) 模型架构和基础理论:transformer,多头注意力机制,Bert,GPT,T5等
2. 基于Bert架构的蛋白质语言模型
1) ESM系列(ESM-1b、ESM-1v、ESM2、ESM C)2) ESMFold:无需MSA信息的结构预测
3) 多模态的蛋白质语言模型ESM3
4) 使用抗体序列库训练的语言模型:Ablang,AntiBERTy
3. Adaptyv EGFR Binder比赛——设计靶向EGFR的更高亲和力binder。1) 比赛结果展示
2) 比赛排名靠前的抗体/蛋白是如何设计的
a) 第一轮比赛,排名第一的方法:BindCraft
b) 第二轮比赛,排名第一的方法:Cradle,在Cetuximab的基础上,用的LLM,突变了10个FR的氨基酸
c) 第二轮比赛,排名第二的方法:对一个纳米抗体进行人源化改造
d) 第二轮比赛,排名第三的方法:保留与结合重要的氨基酸,生成其它氨基酸RFdiffusion+inverse folding
4. 零样本的抗体亲和力成熟*
1) Efficient evolution,基于序列的语言模型推荐突变点(Nat. Biotechnol.文章)
i. 了解语言模型推荐突变点的原理;
ii. 安装package和模型参数。https://github.com/brianhie/efficient-evolution
iii. 运行以推荐突变点:python bin/recommend.py [sequence]
2) Structure evolution,基于结构的语言模型推荐突变点(Science文章)
i. 了解inverse folding推荐突变点原理
ii. 安装package和模型参数
1. git clonehttps://github.com/varun-shanker/structural-evolution.git
2. conda env create -f environment.yml
3. conda activate struct-evo
4. wget -P ~/.cache/torch/hub/checkpoints https://zenodo.org/records/12631662/files/esm_if1_20220410.zip
5. unzip ~/.cache/torch/hub/checkpoints/esm_if1_20220410.zip
iii. 运行以推荐突变点:python bin/recommend.py examples/7mmo_abc_fvar.pdb \
--chain A --seqpath examples/7mmo_chainA_lib.fasta \
--outpath examples/7mmo_chainA_scores.csv \
--upperbound 109 --offset 1
5. 小样本的抗体亲和力成熟*,在已有少量样本的亲和力数据下训练模型。使用MULTI-evolve的方法预测多点的组合突变。
第三天:抗体可开发性预测和优化1
1. 抗体可开发性优化在药物开发过程中的意义,
2. 衡量抗体可开发性要考虑的因素,如免疫原性、自聚集性、结合特异性、稳定性等等3. 以一篇专利文件为例讲解AI辅助抗体改造的案例。Patent No.: US12110324B2。Generate:Biomedicines公司通过AI方法在tezepelumab上改成的一种靶向(TSLP)的长效单克隆抗体GB-0895。
4. 抗体结构简单物理性质的计算:溶剂可及表面积(SASA)的讲解及计算;等电点的计算;蛋白质表面电荷分布的计算。*
5. 讲解Ginkgo举办的抗体可开发性预测比赛的结果。6. 公开的抗体可开发性数据的收集。
7. 抗体性质预测的模型实践,展示在小样本的情景下训练机器学习模型*1) 数据处理,划分数据集
2) 模型构建,基于特征工程的机器学习模型(随机森林,XGboost,ElasticNet等);学习根据蛋白质序列和结构信息构建常见特征。seq_features = feature_utils.get_all_seq_features(heavy_seq, light_seq, is_fv=True, isotype='igg1', lc_type='lambda')3) 模型训练和评价,GridSearchCV交叉验证调参等4) 模型的可解释性,特征重要性分析
第四天:抗体可开发性预测和优化2和抗体人源化
1. 基于蛋白质语言模型的可开发性预测*
1) 零样本的可开发性预测2) 少样本的可开发性预测。给定抗体序列和相应的性质,构建下游模型预测。
a) 数据处理,划分数据集
b) 获得序列embedding以构建下游模型,实现蛋白质序列的不同方式encoding,包括"onehot", "georgiev", “esm”系列模型。
c) 深度学习模型的构建。上游的大语言模型+下游简单线性层。
d) 模型训练和评价:绘制训练曲线,训练集和测试集的评价指标随epoch的变化,2. 免疫原性预测
1) 免疫系统介绍,MHC-I和MHC-II,Anti-drug Antibody等基础概念
2) 免疫原性预测是MHC结合肽段的预测
3) 预测免疫原性。netMHCpan的原理讲解,安装和使用
3. 抗体人源化
1) 人源化的基础知识和流程。目标:保留亲和力+减小免疫原性+好的稳定性和可开发性。CDR移植到人源框架,回复突变,Vernier Zone,
2) Germline的搜索,IMGT/V-QUEST数据库搜索得到V 基因和J基因相似的人类germline序列。
3) 人源化的经典方法biophi的原理讲解、安装和使用。
4) 基于AI和基于物理能量(Rosetta)的方法是如何辅助抗体人源化的。
5) 排除抗体序列的PTM。
第五天:抗体(scFv, VHH)的从头设计
1. 从头设计的意义
1) 跨膜蛋白例如GPCR,难以稳定表达为可溶性蛋白
2) VHH动物免疫羊驼成本高。
3) 更高效快速获得候选分子
2. 基础模型方法概念介绍:Diffusion模型、 flow-matching、全原子(all-atom)建模等
3. 不同公司和方法模型、实验结果讲解
1) Rfdiffusion3+ProteinMPNN生成序列,AphaFold2筛选序列。将学会各个包的安装,不同参数的选择,结合的hotspot位点选择。
a) Rfdiffusion3结构设计,生成~10000个蛋白质主链结构;根据hotspot位点,生成新的结构:
./scripts/run_inference.py 'contigmap.contigs=[B1-100/0 100-100]' 'ppi.hotspot_res=[A30,A33,A34]' inference.output_prefix=test_outputs/binder_test inference.num_designs=10000
b) ProteinMPNN-FastRelax进行序列设计,每一个主链结构两个对应的序列,共设计~20000个序列;
c) 筛选:使用AlphaFold2预测设计结构,预测的置信度pAE<10,预测结构与设计结构的RMSD<1A,从中挑选95个进行实验验证。
2) Nabla Bio开发的JAM(Joint Atomic Modeling)系统3) Chai2 Discovery开发的Chai-2方法,用以实现抗体的从头生成4) MIT开发的Bolzgen方法原理、安装使用讲解。
安装和使用boltzgen讲解,将详细讲解yaml配置文件的写法,以一个靶点为例,从头生成VHH与该靶点结合。
5) PPIFlow:基于flow-matching的生成方法,原理,安装和使用方法。
4. VHH的生成实践
1) 确定纳米抗体序列框架(Framework区域)序列,生成CDR区域序列。分析整理纳米抗体序列,绘制序列保守性的Logo图,以此确定在生成VHH时,哪些位置的氨基酸需要固定。2) 对生成的序列进行筛选。在亲和力、序列稳定性、可开发性等各个方面进行筛选。
a) 预测结构与设计结构的RMSD,AlphaFold预测设计结构的置信度pAE等
b) 筛选Cys,Met等氨基酸含量
c) 减少电荷patch
d) 根据等电点等性质筛选。
AI多肽设计与大模型设计
上下滑动查看
一、多肽与深度学习设计导论
1. 从氨基酸到多肽(零基础起步)
1.1 氨基酸是什么:从最基础的化学结构讲起,介绍 20 种天然氨基酸的通式——每个氨基酸都由一个中心碳、一个氨基(–NH₂)、一个羧基(–COOH)和一个决定其性质的侧链 R 基组成。按侧链性质把它们归为疏水(如 Ala、Val、Leu、Ile、Phe)、极性不带电(如 Ser、Thr、Asn、Gln)、带正电(Lys、Arg、His)、带负电(Asp、Glu)四大类。课堂上会发一张“氨基酸性质速查表”,让学员对每个字母代表什么性质形成直觉,这是后面理解净电荷、疏水性、两亲性等设计参数的基础。
1.2 肽键与序列方向:讲解两个氨基酸如何通过一个氨基与另一个羧基脱水缩合形成肽键,多个氨基酸首尾相连即构成多肽链。强调序列是有方向的(从 N 端到 C 端读写),这一点在后续做序列生成、突变标注时非常关键。随后介绍单字母与三字母两套代码的对照,并现场带学员把一条真实抗菌肽序列(如 KWKLFKKI)逐个残基读出来,顺便观察它为什么带正电、为什么两亲。
1.3 多肽 vs 蛋白质:从长度(多肽通常在 50 个残基以内)和是否能形成稳定三维折叠两个角度区分二者。重点讲清多肽的“柔性”特点——很多多肽在游离状态下并没有单一固定构象,而是在与靶点结合时才诱导形成稳定结构(诱导契合),这正是多肽结构预测和设计比球状蛋白更棘手的根本原因,也为第二主题的结构预测埋下伏笔。
1.4 多肽的种类:系统介绍线性肽、环肽(头尾环化或二硫键环化)、订书肽(stapled peptide,通过化学桥固定螺旋)、以及含非天然氨基酸或 D-氨基酸的肽。结合配图逐一说明为什么这些结构改造能够显著提升多肽的稳定性、刚性与穿膜能力,让学员在一开始就建立“结构改造是多肽成药关键手段”的整体认识。
2. 多肽为什么重要(治疗性多肽)
2.1 多肽药物的优势与局限:优势方面,多肽结合特异性高、脱靶毒性低、可通过化学合成大规模制备,介于小分子与抗体之间兼具二者部分优点;局限方面,多肽半衰期短、口服利用度低、易被体内蛋白酶降解。课堂用一张“小分子 vs 多肽 vs 抗体”的对比表,从分子量、靶点类型、给药方式、成本等维度帮学员精准定位多肽药物的适用场景。
2.2 明星案例 GLP-1:以近年爆火的司美格鲁肽(semaglutide)为例,完整拆解一个多肽药物是如何被“工程化”的——通过关键位点的氨基酸替换抵抗 DPP-4 降解、再接上一条脂肪酸链借助白蛋白结合延长循环时间,最终把天然 GLP-1 只有几分钟的半衰期延长到约一周、实现每周一次给药。以此串起“活性—稳定性—给药方式”三者之间的设计取舍。
2.3 其他经典案例:再补充胰岛素(最早的多肽药物之一)、环孢素(天然环肽、少见地可口服、免疫抑制)、多黏菌素(一类抗菌肽/脂肽)等案例,说明不同结构类型(线性、环状、脂化)对应着不同的成药策略与适应症,帮助学员建立“结构—性质—用途”的对应感。
3. 多肽设计要解决的核心难题(逐条讲)
3.1 活性与特异性:设计的第一目标是让多肽能有效地结合并调控目标靶点,同时尽量避免结合到其他蛋白造成脱靶副作用。会讲清活性(结合得牢不牢、功能强不强)与特异性(认得准不准)常常需要权衡,是贯穿全课程的核心矛盾。
3.2 稳定性与半衰期:体内存在大量蛋白酶,会在特定位点(如胰蛋白酶偏好切在 Lys/Arg 之后)把多肽切碎;同时肾脏会快速清除小分子量的肽。讲清这两条降解/清除途径,为第六主题的环化、订书、D-氨基酸等稳定化改造手段做铺垫。
3.3 膜穿透与口服利用度:多肽通常带电、亲水、分子量偏大,很难穿过细胞膜或肠道上皮,这也是绝大多数多肽药物只能注射给药、靶点主要局限在细胞外的根本原因。理解这一点,才能明白为什么“细胞穿膜肽(CPP)”是一个独立且重要的研究方向。
3.4 免疫原性、毒性/溶血性:外源多肽可能引发免疫反应,某些高疏水/高正电的序列会破坏人体自身细胞膜造成溶血或细胞毒。强调在设计阶段就必须把“安全性”当作硬约束,与活性一起优化,而不是等到最后才补救。
4. 机器学习与大模型入门(面向零基础)
4.1 用手写数字识别建立直觉:借助最经典的手写数字识别例子,把机器学习拆解为“输入 → 模型 → 输出”三段——输入是一张图(或一条序列),模型是一堆可调参数,输出是一个类别或分数。由此自然引出训练集(用来学)、验证集(用来调)、测试集(用来公正评估)三者的分工。
4.2 特征与标签:讲清有监督学习的两个核心概念——把一条多肽用某种方式变成一串数字,就是“特征”;它对应的活性、毒性或是否为抗菌肽,就是“标签”。模型要做的,就是学习从特征到标签的映射关系。用多肽的真实例子替换抽象说法,降低理解门槛。
4.3 判别 vs 生成:用一句话讲清两类模型的分工——判别模型回答“这条肽好不好/是不是抗菌肽”(做打分、分类、预测),生成模型回答“帮我造一条符合要求的新肽”(做设计、生成)。整门课程正是围绕“判别 + 生成”这两条主线交替展开的。
4.4 过拟合与泛化:用“死记硬背题库 vs 真正学会解题”的比喻讲清过拟合,说明为什么必须留出测试集、为什么模型在训练集上的高分不能代表真实能力。特别强调在生物序列里一个常见陷阱:如果训练集和测试集含有高度相似的序列,会造成“数据泄漏”、严重高估性能,因此需要按序列相似度而非随机来划分数据。
4.5 从判别到大模型:解释什么叫“从头设计”(de novo design)——不再依赖已知的天然模板去改造,而是让模型直接生成全新的序列甚至结构。再说明为什么近年的大模型(蛋白质语言模型、扩散模型)让这件原本极难的事情第一次变得真正可行,为后续各主题定下总基调。
5. 动手:代码环境搭建 *
5.1 命令行/Linux 基础:带零基础学员认识终端,理解“用文字命令操作电脑”这件事,并掌握做科研计算最常用的一小撮命令与虚拟环境管理。
▸ 演示 cd(进目录)、ls(看文件)、mkdir(建目录)、cp/mv(复制移动)等基本命令,并创建一个课程项目文件夹 peptide-course/
▸ 用 conda create -n peptide-ai python=3.10 创建虚拟环境,再 conda activate peptide-ai 激活它,讲清“为每个项目单独建环境”的好处
5.2 VS Code + Jupyter:搭建一个既能写脚本、又能交互式探索数据的编程环境,这是后面所有实操的“主战场”。
▸ 在 VS Code 中打开项目文件夹、安装 Python/Jupyter 扩展、选择刚建好的 conda 内核
▸ 新建一个 .ipynb,在第一个 cell 里 print 一条多肽序列并运行,确认环境跑通
5.3 Python 极简入门:只挑做数据分析必需的最小知识集——变量、列表、字典、for 循环、条件判断、函数——用多肽相关的小例子把它们串起来,避免大而全的语法轰炸。
▸ 小练习:写一个函数 count_aa(seq),输入一条序列、返回每种氨基酸出现的次数(用字典实现)
5.4 安装依赖:讲清“库”是什么、为什么要装,用 pip/conda 安装本课程会反复用到的 numpy、pandas、matplotlib、biopython,并介绍 requirements.txt 如何让环境可复现。
5.5 拓展:vibe coding(AI 辅助写代码):现场演示如何用 AI 编程助手把一句自然语言需求(例如“读入这个 FASTA 并画出长度分布”)直接变成可运行代码,让零基础学员也能快速产出结果、把精力集中在生物问题本身而非语法细节上。
6. 动手:常用数据库与可视化 *
6.1 多肽数据库导览:介绍多肽研究中最常用的几个专业数据库,讲清各自收录什么数据、字段含义以及如何检索下载,让学员知道“做设计前去哪里找数据”。
▸ 在 APD3 / DBAASP 中按活性、来源检索抗菌肽,在 CPPsite 中检索细胞穿膜肽,在 PepBDB 中查肽-蛋白复合物结构
▸ 把感兴趣的一批序列导出为 FASTA 文件,供后续分析使用
6.2 PyMOL / Mol* 可视化:教学员把抽象的序列/坐标“看见”,建立结构直觉,这是理解结合、穿膜等机制的前提。
▸ 加载一条多肽的 PDB 文件,在 cartoon(卡通)与 stick(棒状)显示之间切换
▸ 旋转视角、测量残基间距离、给关键残基上色,并导出一张出版级结构图
6.3 biopython / biotite:用几行 Python 代码完成常见的序列/结构处理——读取 FASTA、计算序列长度、分子量与理论等电点(pI),以及解析 PDB/mmCIF 提取原子坐标,为实战项目的批量分析打基础。
7. 实战项目
7.1 数据获取:从 DBAASP 下载一批抗菌肽序列,用 pandas 把它们整理成一张规范的 CSV 表(包含序列、长度、活性标注等字段),并做基本的清洗(去重、去掉含非法字符的序列)。
7.2 性质画像:用 biopython 批量计算每条肽的净电荷、GRAVY 疏水性指数、螺旋倾向等描述符,再用 matplotlib 画出各性质的分布直方图与两两散点图,形成本课程的第一份“数据画像”报告,让学员亲手体会“数据长什么样”。
二、多肽的结构预测与表征
1. 先搞懂“结构”是什么
1.1 四级结构层次:系统讲解蛋白质/多肽结构的四个层次——一级结构(氨基酸序列本身)、二级结构(α 螺旋、β 折叠等局部规则构象)、三级结构(整条链在空间中的折叠方式)、四级结构(多条链的组装)。用配图把四个层次一一对应,让学员建立“序列决定结构、结构决定功能”的整体框架。
1.2 二级结构识别:详细讲α 螺旋与β 折叠各自的氢键规律和几何特征(螺距、方向),并训练学员在 PyMOL 里一眼认出它们。对多肽尤其重要的是两亲性 α 螺旋——这是抗菌肽、细胞穿膜肽发挥功能的常见结构基础。
1.3 短肽为什么“不好定”:深入解释短肽结构预测的难点——残基数量少、缺乏能够稳定折叠的疏水核心,导致其构象在溶液中高度动态、在多个状态之间快速切换,因此单一的静态预测结构往往不能真实代表它的行为。这一节帮学员对预测结果保持恰当的怀疑态度。
1.4 环化/订书如何锁构象:讲清环化、订书、二硫键等共价约束是如何大幅压缩多肽可及的构象空间、把它“锁定”在有活性的构象上的,从结构角度解释为什么这些改造既能提升稳定性、又常常能提升活性。
2. 为什么要预测结构
2.1 结构决定功能:用具体例子说明——结合口袋在形状和电荷上的互补决定了能否结合、两亲性螺旋的疏水面决定了能否插入细胞膜——让学员理解“想设计功能,必须先掌握结构”。
2.2 结构是设计的前提:指出后续几乎所有高级方法(分子对接、binder 从头设计、结合界面分析、结构层面的稳定化改造)都以三维结构为输入,因此结构预测是整个 AI 多肽设计流程的基础环节。
3. 传统预测方法(简要了解)
3.1 同源建模:介绍用 SWISS-MODEL / MODELLER 依据同源模板搭建结构的经典思路,并指出多肽往往缺乏合适同源模板、传统同源建模在多肽上常常失效的局限,从而引出深度学习方法的必要性。
3.2 分子动力学:讲解用力场在计算机中模拟肽在水环境里随时间运动、采样多种构象的思路,并借此建立“构象系综”(一个肽对应一群构象而非单一结构)的重要概念。
3.3 分子对接原理:说明分子对接是把配体或多肽放进受体口袋、用打分函数(近似结合能)来评估并排序不同结合姿势(pose)的过程,是研究“肽如何结合靶点”的基础工具。
3.4 动手:用 AutoDock Vina 做一次肽-受体对接 *
▸ 用 PyMOL/OpenBabel 准备受体:去除水分子、加氢、转换为 pdbqt 格式
▸ 在结合口袋周围定义对接盒子(center_x/y/z 与 size_x/y/z)
▸ 编写 config 并运行 vina,得到多个 pose 及其结合能(affinity, kcal/mol)
▸ 在 PyMOL 中载入最优 pose,观察氢键、盐桥等关键相互作用
4. AlphaFold 的直觉理解(不讲公式)
4.1 共进化信号:用通俗语言解释共进化——在漫长演化中,如果两个残基在空间上相互接触,它们往往会“成对地一起突变”以维持相互作用;因此从多序列比对(MSA)里统计出的这种共变信号,就成了推断三维接触、进而推断结构的核心线索。
4.2 注意力机制大白话:不写任何公式,用“阅读时该重点看哪些字”的比喻讲清注意力机制——模型会为每个残基学习它应该重点关注序列中的哪些其他残基,从而高效地捕捉远距离的相互作用。
4.3 AF2 两大部件:拆解 AlphaFold2 的核心流水线——EvoFormer 模块反复地在“MSA 表示”和“残基对表示”之间交换信息、提炼共进化与几何线索;结构模块再把这些抽象表示翻译成具体的三维坐标;最后通过 recycling(把输出再喂回输入)多轮迭代逐步精修。
4.4 AF3 与扩散:介绍 AlphaFold3 用扩散式生成的方式直接“画”出原子坐标,并把预测范围从单纯的蛋白扩展到蛋白-核酸-配体-离子的通用复合物,说明这对研究多肽与小分子、核酸共同作用的体系意义重大。
4.5 ESMFold:讲清 ESMFold 用蛋白质语言模型学到的表示直接替代了耗时的 MSA 搜索,因此可以在单条序列上秒级出结构,特别适合缺乏同源信息的人工设计短肽的快速筛查。
4.6 专题 AlphaFold3:作为专题深入讲 AF3 的关键变化(用 Pairformer 替代 EvoFormer、用扩散头生成坐标),演示它在预测肽-蛋白/肽-配体复合物上的能力,同时客观讨论它在高柔性多肽和弱结合体系上的局限与使用注意事项。
5. 动手:预测一条多肽的结构 *
5.1 ColabFold / AlphaFold2 预测单肽:使用 ColabFold(AlphaFold2 的轻量在线实现)完整跑一遍单肽预测,理解每一步在做什么。
▸ 在 ColabFold notebook 中粘贴目标序列,选择 MSA 模式(对短肽可对比 single-sequence 与建 MSA 的差异)
▸ 运行预测,下载 5 个模型的 PDB 及 pLDDT/PAE 结果文件
▸ 在 PyMOL 中按 b-factor(pLDDT) 着色查看结构,识别高/低置信区域
5.2 ESMFold 快速预测:用 ESMFold 的网页版或本地 API 对同一条序列一键出结构,直观感受它相比 AF2 在速度上的巨大优势以及在精度上的取舍。
5.3 对比分析:针对同一条柔性短肽,把 AF2 与 ESMFold 的预测结果叠合比较(计算 RMSD、对比 pLDDT),引导学员讨论“什么时候该信 AF2、什么时候用 ESMFold 就够了”,培养对预测结果的批判性判断。
6. 动手:预测复合物与环肽 *
6.1 肽-蛋白复合物:用 AlphaFold-Multimer 或 AF3 预测多肽与靶蛋白结合后的复合物结构,重点看界面区域的 pLDDT 与链间 PAE,用它们判断预测的结合模式是否可信——这是后续 binder 设计中反复要用到的技能。
6.2 环肽/大环肽:介绍并使用 HighFold 等专门处理环化约束的工具来预测环肽/大环肽结构,同时演示普通 AF2 在处理头尾环化、二硫键约束时的失真,让学员明白“选对工具”的重要性。
7. 动手:看懂预测结果好不好 *
7.1 pLDDT:讲清 pLDDT 是模型对每个残基局部结构的置信度打分(0–100),一般 >70 相对可信、>90 很可信,而柔性区/无序区往往偏低;教学员不要盲信一个漂亮的结构,而要先看置信度分布。
7.2 PAE:讲解预测对齐误差(PAE)热图如何反映“两个残基相对位置”的可信度,并演示如何用它判断不同结构域之间、以及肽-靶界面之间的相对摆放是否可靠。
7.3 fpocket:用 fpocket 在靶点结构上自动检测口袋并给出可药性(druggability)评分,帮助学员在设计前先定位“应该把结合肽做到哪里去”。
8. 实战项目
8.1 批量结构预测:对第一主题产出的一组候选肽用脚本批量调用 ESMFold 预测结构,按 pLDDT 自动筛选出高置信构象,体验“把单次操作工程化为批处理流程”的思路。
8.2 复合物分析:挑选一个感兴趣的靶点,预测一个肽-靶点复合物,用 PyMOL 标注界面残基、氢键与盐桥,产出一张带注释的结合模式图,并写一小段结合机制说明。
三、抗菌肽(AMP)设计
1. 认识抗菌肽
1.1 来源与定义:介绍抗菌肽是广泛存在于动物、植物、微生物体内的天然免疫效应分子,是宿主抵御病原的第一道防线;从序列上看,它们通常较短(约 10–50 个残基)、带正电、并具有两亲性,这些共性正是后续做预测和设计时最重要的特征。
1.2 分类:按二级结构把抗菌肽分为α 螺旋型(如 magainin、LL-37)、β 折叠型(常含二硫键,如 defensin)、环状型与延伸型(富含特定氨基酸如脯氨酸、色氨酸)四大类,并说明不同类型在稳定性、活性谱与设计难度上的差异。
1.3 为什么重要:结合当前全球抗生素耐药(AMR)的严峻形势,说明抗菌肽因主要作用于细菌膜的物理性质、细菌难以通过单点突变快速逃逸,被寄望为对抗“超级细菌”的新型武器,凸显这一研究方向的现实意义。
2. 抗菌肽是怎么杀菌的
2.1 膜破坏模型:详细讲解经典的桶板(barrel-stave)、地毯(carpet)、环孔(toroidal-pore)三种膜破坏模型——带正电的抗菌肽先通过静电吸附到带负电的细菌膜表面,再借助疏水面插入脂双层、最终破坏膜的完整性导致细菌死亡。理解机制有助于理解为什么电荷和两亲性如此关键。
2.2 胞内靶点:说明并非所有抗菌肽都靠破膜,一部分能穿过膜进入胞内,抑制 DNA/RNA 或蛋白质合成、干扰细胞分裂等,作用机制更接近传统抗生素。
2.3 为什么不容易耐药:解释由于抗菌肽针对的是细菌膜较为保守的整体物理化学性质,而非某个具体的蛋白靶点,细菌很难通过少数几个突变就获得抗性,这是抗菌肽相对传统抗生素的核心优势。
3. 哪些性质决定活性(关键参数 + 如何量化)
3.1 净电荷:抗菌肽的净电荷通常在 +2 到 +9 之间,正电有利于吸附到带负电的细菌膜。课堂讲解如何根据序列中带电残基数目和给定 pH 值计算净电荷,并讨论电荷过高可能带来的毒性问题。
3.2 疏水性:疏水性决定了肽插入膜的能力,可用 GRAVY 值或“疏水矩”来量化。强调这是一把双刃剑——适度疏水利于杀菌,过度疏水则容易破坏人体自身细胞膜、导致溶血。
3.3 两亲性:讲解两亲性指分子同时具备明显的亲水面和疏水面,对α 螺旋型抗菌肽可用“螺旋轮投影”直观展示极性/疏水残基是否分列两侧,并用疏水矩定量。两亲性是膜活性的关键结构基础。
3.4 螺旋度与长度:讨论螺旋倾向、序列长度对活性和选择性的综合影响——太短往往不足以形成稳定膜活性构象、太长则合成成本高且毒性风险上升,设计时需要在多个参数间寻找平衡。
4. 传统怎么设计和筛选
4.1 理化性质/模板改造:介绍最经典的做法——在一条已知的天然抗菌肽模板上做定点突变,系统调节净电荷、疏水性、两亲性,观察活性变化,逐步优化。这是理解后续 AI 方法的对照基线。
4.2 QSAR:讲解定量构效关系(QSAR)如何在“理化描述符”与“抗菌活性”之间建立回归关系,从而在实验之前就预测并指导优化方向,是机器学习进入这个领域之前的主流量化手段。
4.3 经典机器学习:介绍用支持向量机(SVM)、随机森林等传统模型配合人工设计特征来判别一条序列是否为抗菌肽的经典工作思路(如 CAMP、AMPScanner 等),为后面对比深度学习方法做铺垫。
5. 用模型来“打分”(判别模型)*
5.1 序列编码:系统讲解把一条氨基酸序列转化为模型可读数字的几种主流方式——one-hot 编码、理化性质向量、k-mer 频率,以及用预训练蛋白语言模型(如 ESM)直接提取的高维 embedding,并比较它们在信息量、数据需求和效果上的优劣。
5.2 抗菌活性预测:既介绍如何直接调用现成工具,也带学员从零训练一个属于自己的抗菌活性分类器,完整体验判别模型的构建流程。
▸ 准备正样本(已知 AMP)与负样本(非 AMP 序列),注意平衡与去冗余
▸ 为每条序列提取手工特征或 ESM embedding,构建特征矩阵
▸ 训练分类器(随机森林或小型 MLP),用交叉验证 + ROC-AUC/PR-AUC 评估
▸ 绘制 ROC 曲线、分析哪些特征最重要
5.3 毒性/溶血性预测:介绍并使用 HemoPI、ToxinPred 等工具对候选肽做溶血性、毒性预测,把“安全性”作为与活性并列的筛选维度,避免设计出高活性但高毒的序列。
5.4 手工特征 vs 端到端:通过在同一数据集上对比“传统理化特征 + 随机森林”与“蛋白语言模型微调”两条技术路线的表现,让学员直观理解深度学习/大模型带来的增益,以及它对数据量的要求。
6. 用模型来“造肽”(生成模型)
6.1 VAE:用“压缩再还原”的比喻讲清变分自编码器——把序列编码进一个连续的隐空间,再从隐空间解码回序列;训练好后可以在隐空间中采样或插值,从而生成全新的候选肽(以 HydrAMP 等抗菌肽生成工作为例)。
6.2 GAN:讲解生成对抗网络的核心思想——生成器不断尝试造出以假乱真的肽,判别器不断学习分辨真假,两者对抗训练直到生成器能产出逼真的序列(以 PepGAN 等思路为例),并讨论 GAN 在离散序列上训练不稳定的难点。
6.3 扩散模型:用“从一团噪声里逐步显影出图像”的直觉讲清扩散模型,说明它如何通过反复去噪来生成序列或结构(以 AMP-Diffusion 等思路为例),并点明它正是当前 RFdiffusion、AlphaFold3 等前沿方法的共同基石。
6.4 语言模型/大模型:讲解如何用 GPT 式自回归模型按条件“写”出抗菌肽,或用 BERT 式模型(如 ESM)通过掩码采样来生成/改造序列,把第五主题的大模型能力直接对接到抗菌肽设计上。
6.5 专题:深度学习引导的 AMP 发现闭环:以一篇代表性研究为主线,完整拆解现代抗菌肽发现的工业级闭环流程——用生成模型产出海量候选、经活性/毒性/新颖性多级计算过滤大幅缩小范围、挑选少量候选进行化学合成、再回到湿实验测定最小抑菌浓度(MIC)验证、并把实验结果回填数据反哺模型,形成“干湿结合”的迭代设计范式。
7. 实战项目
7.1 判别筛选:用第 5 节训练好的判别模型对一批候选肽进行抗菌活性打分和排序,结合毒性预测卡定阈值,输出一份“值得进一步关注”的候选短名单。
7.2 生成 + 过滤:用生成模型批量产出上千条候选序列,再串联抗菌活性、溶血性、与天然序列相似性等多个过滤器逐层筛选,最终留下多样且有潜力的 Top-N,完整体验“大量生成 + 严格过滤”的设计哲学。
7.3 文章复现:选取一篇有代表性的抗菌肽生成设计论文,复现其核心的设计-筛选流程,产出候选清单并逐条给出入选理由,训练学员阅读并落地前沿文献的能力。
四、靶点结合肽 / Binder 从头设计
1. 什么是结合肽 / binder
1.1 结合位置:讲清结合肽要真正发挥作用,必须精准占据靶点的功能位点或蛋白-蛋白相互作用界面,从而阻断或激活其功能;设计的第一件事就是想清楚“要结合到靶点的哪个部位”。
1.2 表位与热点:区分两个关键概念——表位(epitope)是靶点上被结合肽覆盖的整片区域,而热点(hotspot)是这片区域中贡献了绝大部分结合能的少数关键残基。讲解如何通过实验的丙氨酸扫描或计算方法找出 hotspot,并以此作为设计的“锚点”。
1.3 结合肽 vs 蛋白 binder:对比多肽结合物与更大的蛋白结合物——多肽更小、更灵活、更易化学合成和修饰,但可埋藏的结合面积小、天然亲和力往往偏弱,因此常需要环化、订书、引入非天然氨基酸等手段来弥补,这也串联起第六主题的优化方法。
2. 设计的整体流程(先看全貌)
2.1 三步法:先给学员一张全景图——现代从头 binder 设计通常分三步:先生成合理的三维骨架(决定“长什么形状”)、再为骨架设计氨基酸序列(决定“用哪些残基”)、最后回测验证并迭代优化(判断“靠不靠谱、要不要重做”)。理解这个总框架后再逐步深入每一步,学员不会迷失在工具细节里。
3. 第一步:生成骨架
3.1 RFdiffusion 直觉:用“从一团随机噪声出发、一步步去噪、逐渐长出合理蛋白主链”的直觉讲清 RFdiffusion;说明它既可以无条件生成全新结构,也可以在给定条件下定向生成,是目前从头结构设计最主流的扩散模型。
3.2 施加约束:讲解如何把设计意图“告诉”模型——指定要结合的靶点、锚定到指定的 hotspot、或围绕一段固定的功能 motif 生成支架(motif scaffolding),从而让生成的骨架天生就“面向靶点”。
▸ 准备靶点结构并确定 hotspot 残基编号
▸ 用 contigs 语法描述“靶点固定 + 结合肽长度范围”,设置 hotspot 参数
▸ 运行 RFdiffusion 生成多条候选骨架,并初步筛掉明显不合理的构象
3.3 专题 RFpeptides:作为专题介绍 RFpeptides 如何在 RFdiffusion 流程中引入环化处理,实现大环肽 binder 的从头设计,并结合已发表的实验验证成功案例,讲清这条路线的实际威力与适用范围 *
4. 第二步:设计序列 *
4.1 ProteinMPNN:讲解 ProteinMPNN 的作用——给定一条主链的三维坐标,预测每个位置放哪种氨基酸能最稳定地折叠成这个形状;并说明采样温度(temperature)如何在“保守可靠”和“多样探索”之间调节。
▸ 输入上一步生成的骨架 PDB
▸ 设置采样温度、指定需要固定或允许变化的位置(如保留界面关键残基)
▸ 批量生成多条候选序列,供下一步回测
4.2 多肽注意点:针对多肽的特殊性提醒若干实操细节——短肽两端的处理、环化位点残基的选择、以及尽量避免使用化学合成困难或易氧化的残基,让设计结果更容易真正被合成出来。
5. 第三步:验证与打分 *
5.1 AF2 回测:讲解 binder 设计中最重要的“自洽性”检验——把 ProteinMPNN 设计出的序列单独喂给 AlphaFold2 重新折叠,看它能否折回当初设计的目标构象;用 pLDDT 和与目标结构的 RMSD 来量化,是过滤失败设计最有效的手段之一。
5.2 界面评估:介绍一系列评估结合可信度的指标——界面 PAE(interaction PAE)、界面 pLDDT、界面接触残基数、以及近似结合能等,教学员综合这些指标判断哪些候选真正有希望结合。
5.3 迭代优化:强调从头设计是一个循环而非一次成功——对未通过回测的候选,回到骨架生成或序列设计步骤调整参数、重新生成,形成“生成—筛选—再生成”的迭代闭环,这也是真实设计工作的常态。
6. 实战项目
6.1 完整流程:选定一个真实靶点,完整走通 RFdiffusion 生成骨架 → ProteinMPNN 设计序列 → AlphaFold2 回测与排序 的从头结合肽设计流水线,把本主题所有工具串成一条可复用的 pipeline。
6.2 输出:整理排名靠前的候选肽,产出结构图、界面指标汇总表与设计说明文档,形成一份可以拿去和实验合作者讨论的完整设计报告。
五、面向功能的多肽序列生成与大模型
1. 语言模型是什么(从头讲起)
1.1 序列即“句子”:用一个贯穿全章的核心类比——把 20 种氨基酸当作“字”、把一条蛋白/多肽序列当作一句“话”,那么让模型学习蛋白序列,本质上就和让它学习一门语言一样。这个类比帮零基础学员一下子抓住蛋白语言模型的直觉。
1.2 RNN 直觉:讲解早期的循环神经网络如何像人一样一个字一个字地顺序阅读、并用一个不断更新的“隐藏状态”记住前文,同时指出它在处理很长序列时容易“忘记”开头、难以捕捉长程依赖的固有缺陷。
1.3 Transformer 直觉:讲清 Transformer 用自注意力机制让序列中任意两个位置都能直接“对话”,因此既能高效并行计算、又特别擅长捕捉相距很远的残基之间的关联——这正是它取代 RNN、成为所有现代大模型基石的原因。
1.4 预训练在学什么:解释在海量无标注的天然蛋白序列上做“完形填空/接龙”式的自监督预训练,模型能够自发地学到氨基酸之间的搭配规律、进化保守性乃至结构倾向,从而得到一套可迁移到各种下游任务的通用表示。
2. 两种典型:BERT 与 GPT
2.1 BERT / 掩码式:讲解 BERT 式模型通过“完形填空”(随机遮住一些残基、让模型预测被遮住的是什么)来训练,因而特别擅长理解序列、给序列或突变打分,蛋白领域的 ESM 系列正属于这一类。
2.2 GPT / 自回归:讲解 GPT 式模型通过“文字接龙”(根据前面的残基预测下一个残基)来训练,因而天然擅长逐位地生成全新序列,是条件化蛋白/多肽生成的主力架构。
2.3 对应到多肽:把两类模型的分工落到多肽任务上——掩码式模型主要用于突变效应打分、天然性评估与特征提取,自回归/生成式模型主要用于按功能需求从头生成候选序列。
3. ESM 系列深入
3.1 ESM 系列模型演进:回顾 ESM-1b(650M 参数)→ ESM-2(8M 到 15B 多规格)→ ESMFold(结构预测)→ ESM-IF(反向折叠)的发展脉络;说明 ESM-2 是当前蛋白质序列表示的 state-of-the-art 模型,也是本课程做表征、打分与微调的默认主力模型。
3.2 ESM2-650M 架构解析:讲解 33 层 Transformer、1280 维 embedding、约 6.5 亿参数的规模;说明 ESM-2 在 UniRef50 上进行自监督预训练,通过掩码语言建模从数以亿计的天然序列中学到了蛋白质家族的进化约束与结构倾向,这也是它的 embedding 能广泛迁移的根本原因。
3.3 ESM2 在多肽评估中的应用(Perplexity 打分):讲解 perplexity(困惑度)的直观含义——模型认为该序列“像不像”天然蛋白质;perplexity 越低,说明序列越符合天然蛋白质的统计规律,因而可以直接作为多肽“天然性 / 可折叠性”的一个廉价初筛指标,在做完生成后用它快速剔除明显不合理的序列。
▸ 用 transformers/fair-esm 加载 esm2_t33_650M_UR50D 模型与对应 tokenizer
▸ 对每条候选多肽逐位做掩码、累加对数似然,计算 (pseudo-)perplexity
▸ 按 perplexity 从低到高排序,剔除高困惑度(明显不像天然蛋白)的候选
3.4 从 ESM2 到 PepMLM(微调策略与条件化生成):解释 PepMLM 如何在 ESM2-650M 的基础上,使用 PepNN 和 Propedia 数据库中的肽-蛋白配对数据进行微调;其核心变化在于把靶蛋白序列作为条件(condition)拼接进输入,强制模型学习“给定靶点、生成能与之结合的肽”的映射关系,从而把一个通用的蛋白语言模型改造成一个面向靶点的结合肽生成器。这一节把“预训练大模型 + 任务微调 + 条件化生成”的完整范式讲透。
4. 怎么让模型“按需求”生成
4.1 预训练 + 微调范式:讲清当今大模型应用的主流范式——先用海量通用数据预训练出一个“懂蛋白语言”的基座模型,再用相对少量的任务数据进行微调,让它专精于某个具体功能,这样既省数据又省算力。
4.2 条件生成:讲解条件生成的思想——把想要的功能标签、类别或靶点序列作为额外输入“条件”喂给模型,引导它只生成满足该条件的序列,而不是漫无目的地乱生成,这是可控设计的关键。
4.3 专题 ProGen / ZymCTRL:以 ProGen、ZymCTRL 为例讲解如何用控制标签(如蛋白家族、酶功能)来条件化地生成蛋白序列,并讨论如何把这套成熟思路迁移到多肽的功能条件生成上。
4.4 扩散生成功能肽:介绍在序列空间或结构空间上运用扩散模型、并结合条件约束来生成目标功能多肽的新兴思路,把第四主题的扩散结构生成与本章的功能序列生成联系起来。
5. 生成特定功能的肽
5.1 细胞穿膜肽(CPP):讲解 CPP 的典型序列特征(富含精氨酸/赖氨酸、常具两亲性),以及为什么它是解决多肽“进不了细胞”这一核心难题的关键工具;并说明如何用条件生成模型定向产出 CPP 候选。
5.2 抗癌肽:介绍抗癌肽(尤其是膜裂解型)如何利用肿瘤细胞膜与正常细胞膜在电荷等方面的差异实现选择性杀伤,以及在设计时如何兼顾疗效与对正常细胞的安全性。
5.3 信号肽等:简要介绍信号肽、抗病毒肽、激素肽等其他功能肽的生成任务,说明本章方法框架具有很强的通用性,可迁移到各类功能目标。
5.4 动手:微调一个小模型生成目标肽 *
▸ 准备目标功能数据集(如 CPP 的正负样本),做清洗与划分
▸ 在 ESM2 或一个小型自回归模型上进行微调(可用 LoRA 等轻量方式降低算力需求)
▸ 从微调后的模型采样生成候选序列,去重并做初步长度/组成过滤
6. 生成完怎么评估好坏 *
6.1 天然相似性:用 BLAST 比对或 embedding 空间距离衡量生成序列与已知天然序列的接近程度;强调要在“足够像天然(可能可折叠、可表达)”和“足够新颖(有专利与创新价值)”之间取得平衡。
6.2 多样性:用序列聚类或计算候选之间的两两相似度来评估生成结果是否过于雷同——一个只会反复生成几乎相同序列的模型是没有实用价值的,多样性是衡量生成质量的重要维度。
6.3 结构合理性:用 ESMFold 或 AF2 对生成序列快速回测,看其能否折叠成 pLDDT 较高的合理结构,把结构不合理的候选提前淘汰。
6.4 成药性初筛:把第六主题的毒性、溶血性、稳定性等预测器作为前置过滤器接入生成流程,尽早剔除高风险候选,避免把宝贵的实验资源浪费在注定失败的序列上。
7. 实战项目
7.1 目标:以“设计一批细胞穿膜肽(CPP)”为具体目标,把本章学到的微调与条件生成方法真正用起来。
7.2 流程:完整走一遍数据准备→ 模型微调 → 批量生成 →(perplexity / 结构合理性 / 毒性)多指标联合筛选 → 输出 Top-N 候选并逐条说明入选理由 的闭环,产出一份可交付的生成设计报告。
六、多肽性质预测、优化与工程改造(成药性)
1. 成药性到底看哪些指标
1.1 稳定性:讲解体内蛋白酶如何在特定位点降解多肽(例如胰蛋白酶偏好切在 Lys/Arg 之后),如何从序列上识别这些潜在的“易切位点”,并如何评估一条肽在血浆中的整体稳定性,这是多肽能否成药的第一道门槛。
1.2 半衰期:说明多肽的体内半衰期主要由肾小球滤过(与分子量相关)和酶解共同决定,并预告后面会讲到的延长策略——PEG 化、脂肪酸修饰、与白蛋白结合等,把“为什么半衰期短”和“怎么解决”连起来讲。
1.3 膜穿透性:分析影响多肽穿膜能力的主要因素(脂水分配系数 logP、净电荷、两亲性、分子量等),并介绍可用于预测穿膜概率的计算工具,呼应第一主题提出的“多肽进不了细胞”这一核心难题。
1.4 毒性与免疫原性:讲解需要评估的几类安全性风险——对红细胞的溶血性、对正常细胞的细胞毒性、以及可能引发免疫反应的 T 细胞表位,强调这些指标必须与活性同步优化。
2. 动手:用模型预测这些性质 *
2.1 稳定性/半衰期:用基于序列规则的方法标注出潜在的蛋白酶切割位点,并结合预测工具给每条候选肽打一个稳定性评分,产出一张“稳定性风险清单”。
2.2 膜穿透/CPP:使用 CellPPD 等在线/本地工具批量预测候选肽的细胞穿膜概率,筛选出更可能进入细胞、适合作用于胞内靶点的序列。
2.3 毒性/免疫原性:使用 ToxinPred 预测毒性、用免疫原性/表位预测工具评估免疫风险,把高风险候选在计算阶段就过滤掉,降低后续实验成本。
3. 从结构上让肽更“耐用”
3.1 环化:讲解头尾酰胺环化与二硫键环化两类主要环化方式,说明环化如何通过消除易被外切酶识别的自由末端、并限制构象自由度,来同时提升多肽的酶稳定性与结合活性。
3.2 订书肽:讲解订书肽如何通过在螺旋的两圈之间引入一条全碳或硫醚化学桥,把α 螺旋“钉”得更稳固,从而显著提升其蛋白酶抗性、结合亲和力乃至细胞穿透能力,是近年热门的多肽稳定化策略。
3.3 非天然氨基酸:介绍引入天然界不存在的氨基酸(如β-氨基酸、N-甲基化氨基酸等)如何让多肽逃避蛋白酶识别、并精细地调节其溶解度、刚性与穿膜性等理化性质。
3.4 D-氨基酸/逆序-D:讲解用 D 型氨基酸替换 L 型、乃至采用“逆序-D”(retro-inverso)策略,如何在尽量保持结合构象的同时,让多肽几乎完全逃脱只识别 L 型底物的蛋白酶降解,是提升稳定性的强力手段。
4. 用机器学习帮忙改造(优化)*
4.1 零样本突变效应预测:讲解如何用 ESM-1v / ESM-2 这类蛋白语言模型,在完全不需要额外训练数据的情况下(zero-shot),直接根据模型对突变前后序列的打分变化来预测某个突变是有益还是有害,从而快速圈定值得尝试的突变。
▸ 对目标肽的每个位置,枚举其所有可能的单点突变
▸ 用语言模型计算每个突变体相对野生型的对数似然差(打分)
▸ 按打分排序、挑出高分突变,并尝试将多个有益突变组合叠加
4.2 定向进化思路:讲解经典定向进化“构建突变库 → 高通量筛选 → 富集迭代”的实验范式,并说明机器学习如何通过预测有希望的突变、大幅减少需要实验筛选的轮次和规模,实现“更聪明地进化”。
4.3 Low-N 策略:讲解在实验数据极其有限(仅几十条)的现实场景下,如何借助预训练模型强大的先验表示,只用少量标注数据就训练出可用的性质预测或优化模型,解决生物领域普遍存在的“小数据”难题。
4.4 用自有数据训练小模型:手把手带学员把自己实验室积累的活性/稳定性等实测数据整理成规范训练集,在 ESM 等预训练表示之上微调一个轻量的回归/分类头,得到一个贴合自身课题的定制化预测模型。
5. 实战项目
5.1 全流程串讲:给定一条初始多肽,完整演示“性质预测 → 定位薄弱环节(如某处易被降解或毒性偏高)→ 用环化/突变等手段针对性优化 → 重新预测验证”的迭代闭环,把全课程学到的判别、生成、优化能力融会贯通。
5.2 学员小项目:给定一个真实的靶点或功能目标,让学员独立走一遍“设计 → 结构预测 → 性质预测 → 优化”的完整流程,最终产出一批候选多肽以及一份图文并茂的设计报告。
AI蛋白质设计
上下滑动查看
*涉及使用代码/计算工具的操作
第一天:熟悉超算环境与蛋白质从头设计实践
1.环境搭建:Linux,VScode,Jupyter notebook*
a)超算的登录
b)Linux系统的常用shell命令:vim, ls, cd, less, rm等;
c)一些package安装的常用命令:pip, conda, source等。
d)Jupyter notebook的安装和使用。
e)VScode的基本配置:连接服务器;选择不同python版本的Interpreter;debug模式的使用等。
2.基础知识讲解
a)三类方法在不同程度上探索蛋白质序列空间:
i. 蛋白质定向进化(directed evolution)
ii. 固定蛋白质主链的序列设计(Fix-backbone protein design)
iii. 蛋白质的从头设计(De novo protein design)
b)关键数据库:RCSB PDB, SCOPe, CATH, UniRef, BFD等
c)常见概念和名词: rotamer,scaffold, motif,domain,backbone,side-chain,apo和holo结构,
d)使用的不同模型的原理,transformer,diffusion模型,Flow Matching等。
3.Rfdiffusion3+ProteinMPNN生成序列
a)Rfdiffusion3生成蛋白质骨架结构,ProteinMPNN精细的生成氨基酸序列。
b)Rfdiffusion3的安装实操
c)Rfdiffusion3的使用实操
d)ProteinMPNN的安装实操
e)ProteinMPNN的使用实操
f)Rfdiffusion+ProteinMPNN生成序列,AphaFold2筛选序列。整体实操流程:
i. 计算SAP(Spatial Aggregation Propensity)的值,选择3-6个氨基酸作为hotspot,即结合位点;这里需要使用Rosetta进行计算,首先将安装rosetta,准备蛋白,再计算每一个氨基酸的SAP值,将SAP数值映射到结构上。选择hotspot位点。
ii. Rfdiffusion结构设计,生成~10000个蛋白质主链结构;
根据上面挑选得到的hotspot位点,更改相应的hotspot参数,生成新的结构
iii. ProteinMPNN-FastRelax进行序列设计,每一个主链结构两个对应的序列,共设计~20000个序列;
iv. 筛选:使用AlphaFold2预测设计结构,预测的置信度pAE<10,预测结构与设计结构的RMSD<1A,从中挑选95个进行实验验证。
4.其它的蛋白质设计方法的实操*
a)BindCraft——序列生成和筛选的自动化实现
BindCraft相比于Rfdiffusion+ProteinMPNN更加用户友好,一站式设计流程,序列的生成和筛选自动化实现。将讲解其中参数的设计和选择,如过滤序列条件、生成氨基酸的偏好性等。使用包括置信度评分(如AlphaFold2预测得到的pLDDT、ipTM)、物理指标(如Rosetta界面能量)和序列特征(如疏水性比例)进行筛选。
b)MIT开发的Bolzgen方法原理、安装使用讲解。
安装和使用boltzgen讲解,将详细讲解yaml配置文件的写法,以一个靶点为例,从头生成VHH与该靶点结合。
c)PPIFlow:基于flow-matching的生成方法,原理,安装和使用方法。
第二天:蛋白质结构预测和分析
1.蛋白质结构预测方法
1)从CASP比赛结果来简述蛋白质结构预测方法的发展。基于能量函数 -> 接触图的应用 -> 端到端的预测结构(AlphaFold2)。
2)AlphaFold2的模型相比于以前的方法有什么改进
a)将基于MSA和基于模板的方法整合,使用注意力机制进行MSA信息和模板信息的相互交流。
b)以前提取MSA信息为计算协方差矩阵,AlphaFold2创造性的直接将MSA信息作为输入,将图像识别的算法转变成了自然语言处理算法,减少了中间处理过程中的信息损失。
3)AlphaFold3相比于AlphaFold2改进了什么,还有什么不足。
a)扩展到了多种生物分子的复合物结构预测,包括蛋白质-DNA、蛋白质-RNA、蛋白质-小分子,并使用扩散模型。
b)复合物组装与动态预测缺陷,抗体-抗原复合物结构准确度有待提高。
4)运行网页server上的AlphaFold3预测结构,https://alphafoldserver.com*
5)如何使用AlphaFold3预测蛋白质的糖基化,不同糖基化的类型的输入方法。
6)AlphaFold3输出结果分析,各项置信度指标的含义,以及如何判断预测的准确度,如pLDDT,ipTM,PTM,PAE。2.ESMFold2的安装和使用。
3.蛋白质结构分析和可视化
1)pdb文件的解读,每一行中的内容代表什么含义。
2)用 pymol 可视化蛋白质结构*
a)pymol的基础操作讲解
b)如何将实验值投影到结构图的颜色上,如何画出发表文章中好看的图
3)计算蛋白质结构中两个氨基酸的距离*
a)使用python的文本文件操作实现
b)使用python中biopython包实现
4.蛋白质结构相关物理性质的计算*
1)二级结构的分类和计算
2)溶剂可及表面积(SASA)的讲解及计算
第三天:蛋白质序列分析,数据挖掘和训练数据准备
讲解和实操:
1.获得同源序列
1)了解不同蛋白质序列库,如UniRef90,UniClust30,Pfam等
2)了解不同工具原理并使用:NCBI BLAST,Jackhmmer,HHblits
3)给定一条蛋白质序列,比对序列库,生成多序列比对(MSA)*
从AlphaFold2的经典代码仓库中找到它的生成MSA的代码并学习(alphafold/alphafold/data/tools/jackhmmer.py)。
运行示例:jackhmmer --cpu 8 -N 2 -E 1e-7 query.fasta uniprot_sprot.fasta -o output.sto
2.对MSA进行频率分析*
1)使用python的文本文件操作实现
2)使用python中biopython包实现
3)绘制序列Logo,可视化的展示每个位点的氨基酸频率和保守性
3.序列的同源性计算和进化树的绘制*
1)不同同源性的计算方法及应用情景,氨基酸序列的identity和Similarity,BLOSUM62的介绍。
2)进化树的绘制
4.基于序列相似性阈值划分训练集和测试集*
1)为什么要做?避免数据泄露
2)选择相似性度量方法
3)相似性矩阵的计算
4)划分数据集
5.大规模蛋白质序列的聚类分析和去冗余*
1)为什么要做?防止过度学习某一类序列特征,消除序列偏差;也能防止训练过程中数据泄露。
2)聚类方法的选择,CD-HIT、MMseq2和Linclust
3)选择代表序列,去冗余
4)实际复现S2ALM这一模型文章中的聚类方法。mmseqs easy-cluster examples/DB.fasta clusterRes tmp --min-seq-id 0.7 -c 0.8 --cov-mode 1
第四天:蛋白质的大语言模型及其应用
1.基础知识讲解
1)介绍蛋白质的语言模型(26字母语言模型->20氨基酸字母表,上下文依赖->氨基酸的共进化)
2)为什么要开发蛋白质大语言模型?1. 相比于结构或功能信息,序列信息更加海量;2. 蛋白质序列通过进化而来,可以学习蛋白质基本规律,折叠,共进化等
3)模型架构和基础理论:transformer,多头注意力机制,Bert,GPT,T5等
2.基于Bert架构的蛋白质语言模型
1)ESM系列(ESM-1b、ESM-1v、ESM2、ESM C)2)ESMFold:无需MSA信息的结构预测
3)使用抗体序列库训练的语言模型:Ablang,AntiBERTy
3.类似GPT的生成模型ProGen
1)36层Transformer解码器架构,包含12亿参数
2)引入“控制标签”(如蛋白质家族ID、功能属性)作为输入,生成蛋白质序列空间以外的新的蛋白质序列
3)成功生成新的溶菌酶
4.多模态的蛋白质语言模型ESM3
1)模型架构融合序列,结构和功能信息
2)相比于ESMFold,单体结构预测精度更好
3)基于多模态提示(序列、结构、功能关键词)设计新的蛋白质序列
4)ESM3的安装,生成序列,快速结构预测。*5.蛋白质语言模型的应用和实战演练*
1)获得序列embedding以构建下游模型(Cell systmes文章举例),从文章github仓库中提炼序列embedding的代码并学习使用。https://github.com/fhalab/MLDE?tab=readme-ov-file#generating-encodings-with-generate_encoding.py,看懂代码中EncodingGenerator的类,将这个类方法用在我们自己的代码上,实现蛋白质序列的不同方式encoding,包括"onehot", "georgiev", “esm”系列模型。2)使用不同的蛋白质语言模型,零样本的预测蛋白质突变效应。3)给定少量的突变效应数据作为训练数据,训练模型,预测新的突变效应值。
第五天:深度学习辅助酶设计
1.基础知识讲解
酶的过渡态理论,theozyme,fitness landscape,epistasis
2.酶学性质预测
1.DLKcat与GotEnzyme数据库介绍
2.UniKP:利用预训练模型挖掘、改造Kcat
3.CLEAN:基于对比学习的EC号预测挖掘稀有脱卤酶
3.蛋白质热稳定性改造
1.MutCompute介绍
2.利用MutCompute改造PETase(Nature)
3.ThermoMPNN介绍与使用*
4.Pythia介绍与使用*
4.从Frances H. Arnold(2018年因在酶的定向进化领域的贡献获得诺贝尔化学奖)的工作看酶的定向进化方法的发展
1. 传统定向进化实验流程
2.MLDE(Mechine Learning Directed Evolution),学习序列与酶性能之间的映射关系,推荐新的突变组合(PNAS文章)
3.ftMLDE(focused training MLDE),主动学习流程,构建informative的训练数据(Cell Systems文章)。零样本突变效应预测挑选数据集,再通过小样本数据训练的策略微调。5.酶的从头设计
1.从头设计Diels-Alder催化酶
a)基于Rosetta的Inside-out策略(Science文章)
b)通过Foldit蛋白质折叠游戏改善结构问题(Nat. Biotechnol.文章);c)Foldit蛋白质折叠游戏的实践*2.从头设计荧光素酶,Family-wide hallucination,基于该酶家族的结构幻化出新的结构(Nature文章)
3.RFdiffusion+PLACER从头设计丝氨酸水解酶(Science文章)
6.利用预测结构的相似性,挖掘序列的新酶功能(复现顶刊cell文章)*
1. InterPro数据库中下载数据
2.TM-score计算结构距离
3.UPGMA结构聚类,画出进化树
4.挑选序列
第六天: 蛋白质功能与互作预测;实验验证与”设计-构建-测试“闭环
1.蛋白质功能预测:
1) 基础知识:
a) 基因本体论(Gene Ontology, GO),
b) MF/BP/CC,MF Molecular Function 分子功能;BP Biological Process 生物过程;CC Cellular Component 细胞组分。
c) GAF (GO Annotation File) 文件。
d) 本体文件来理解GO术语之间的层次关系。
e) 解析GAF,提取蛋白质ID和GO ID。
2)ProteinKG65构建蛋白质知识图谱,将基因本体论的知识带入蛋白质功能和结构预测
3)DeepGO-SE,结构感知的GO预测模型
4)DEEPTRANS ,初级主动运输蛋白(PAT)分类 RAG(检索增强生成)+ ProtT5嵌入 + 多尺度CNN,从TCDB数据库检索上下文知识 94.78%和93.06%的平均准确率;对新PDB蛋白90%准确率。
2.实验验证与“设计-构建-测试”闭环
以Genetech的lab-in-the-loop为例,讲解产业界AI工作,结合了实验和计算方法的迭代优化策略的工作。完整闭环遵循Design(AI 计算设计)→Build(自动化合成构建)→Test(高通量实验测试)→Learn(数据回流重训模型),循环往复迭代优化,每一轮循环都压缩候选范围、提升模型预测精度。
a)Design 计算端:AI 模型生成候选方案,精准缩小实验范围:主动学习采样策略:AI 不只挑 “当前最优分子”,还会主动选取边界样本、预测不确定样本安排实验,刻意补齐数据集盲区,避免模型过拟合。
b)Build 构建端:自动化实验平台完成合成 / 表达(实验硬件闭环)
c)Test 测试端:湿实验高通量测评,产出真实量化结果
d)Learn 学习端:实验数据回流,全量更新 AI 模型,本轮实测数据加入训练集,重新微调深度学习模型。开启下一轮循环。
AI构建虚拟细胞
上下滑动查看
第一天| 细胞数据数字化与基础表征
上午:理论讲解(第一、二阶段)第一阶段:细胞数据数字化(Data Representation)
核心目标:解决"如何让细胞被AI理解"• 细胞多组学数据的复杂性(RNA、ATAC、Protein、Spatial)• 数据标准化与质量控制的最佳实践• 从原始数据到机器可读结构的核心逻辑配套模型理论:• MultiVI:RNA+ATAC多模态统一表征(重点讲解)• totalVI:RNA+Protein联合编码• MOFA+:多组学因子分析• OmniReg-GPT(新模型,NC2026):DNA序列基础表征,基因组位点识别与表达预测第二阶段:细胞状态建模(State Learning)
核心目标:解决"如何识别细胞处于什么状态"• 从"细胞数据"到"细胞状态"的转化逻辑• 潜变量空间的生物学意义• 细胞亚群识别与稀有细胞发现配套模型理论:• scVI/scANVI:单细胞潜变量建模(核心)• β-VAE:解耦表征学习• Contrastive Cell Embedding:对比学习在细胞表征中的应用
下午:实操演练(对应上午第一、二阶段理论)实操前置准备:GPU服务器环境适配、Linux与Python环境调试
1. Linux 常用命令进阶:细胞数据文件(单细胞RNA、ATAC数据)的批量管理、权限设置、格式转换;2. Python 环境搭建与优化:细胞数据处理相关包(scanpy、torch、scvi-tools)的安装与调试。实操模型讲解(Python代码解析 + GPU服务器上机实操)
1. 实操模型1:MultiVI(多模态统一表征)—— 对应第一阶段理论,实现RNA+ATAC数据统一编码,完成数据降噪与批次效应校正,掌握潜变量空间构建方法,理解其作为模型底座的核心作用;2. 实操模型2:scVI(单细胞潜变量建模)—— 对应第一、二阶段理论,基于单细胞RNA数据,完成潜变量建模、细胞聚类初步分析,掌握基础表征模型的训练与评估方法,衔接细胞状态识别的核心需求;3. 实操模型:OmniReg-GPT演示(新模型)—— DNA序列特征提取,基因表达预测,理解基础表征模型在基因组学中的应用,展示Nature Communications论文核心技术。
第二天| 细胞状态建模与空间转录组
上午:理论讲解(第二阶段深化)空间转录组基础理论
核心目标:解决"细胞在组织中的空间状态"• 空间转录组技术概览(Visium、Stereo-seq、MERFISH)• 空间约束下的细胞状态识别• 组织微环境与细胞通讯配套模型理论:• GraphST:图神经网络空间表征• STAligner:空间转录组跨样本整合
• Nicheformer(新模型,2025NM):空间基础模型下午:实操演练(对应上午空间转录组理论)实操前置准备:空间转录组数据预处理与工具包调试
1. Python 工具包适配:PyTorch Geometric(图神经网络)、squidpy(空间分析)工具包的安装与调试;2. 数据预处理复习:空间转录组数据格式(Visium、Stereo-seq)的读取与预处理方法。实操模型讲解(Python代码解析 + GPU服务器上机实操)
1.实操模型:GraphST实操(空间数据聚类与域识别)—— 基于空间转录组数据,构建空间图网络,完成组织域识别与空间聚类,掌握图神经网络在空间数据中的应用;2. 实操模型:STAligner实操(空间转录组跨样本整合)—— 理解空间转录组的批次效应如何消除,掌握去批次的基本原理与核心方法,理解空间组的建模思路3. 实操模型:Nicheformer实操(空间基础模型)—— 细胞微环境表征,掌握空间基础模型的核心应用,深化细胞状态识别的实操能力。
第三天| 调控机制推理与细胞动态预测
上午:理论讲解(第三、四阶段)第三阶段:细胞调控机制建模(Regulatory Modeling)
核心目标:解决"为什么细胞会发生变化"• 细胞调控的底层机制• 从表型识别深入到机制层面• 调控机制建模在药物研发中的核心价值配套模型理论:• GAT:图注意力网络,基因调控网络推理• SCENIC:转录因子调控推断• Gene Regulatory Graph:因果关系建模第四阶段:细胞动态预测(Dynamic Evolution)
核心目标:解决"细胞下一步会走向哪里"• 细胞命运轨迹推演的核心逻辑• 动态预测对药物研发(如耐药、复发预测)的重要意义配套模型理论:• CellRank 2:命运概率与轨迹推演• RNA Velocity:转录动力学建模• stVCR(新模型,Nat Methods 2026):空间细胞发育轨迹推断,基于Neural ODE的空间-基因双速度场建模
下午:实操演练(对应上午第三、四阶段理论)实操前置准备:图神经网络与动态预测工具包调试
1. Python 工具包适配:PyTorch Geometric(图神经网络)、CellRank(动态预测)工具包的安装与调试;2. 数据预处理复习:回顾上午理论相关的基因表达数据、调控关系数据的预处理方法。实操模型讲解(Python代码解析 + GPU服务器上机实操)
1.实操模型:SCENIC(调控网络机制推理)—— 对应第三阶段理论,基于基因表达数据,构建基因调控网络,识别关键调控节点,掌握机制推理的核心方法,理解其在药物靶点发现中的应用;2. 实操模型:CellRank 2(命运与轨迹推演)—— 对应第四阶段理论,基于单细胞数据,推演细胞分化轨迹,预测细胞未来状态,掌握动态预测的核心方法,贴合药物研发中耐药、复发预测的需求;
3. 实操模型:stVCR实操(新模型)—— 空间轨迹推断,预测细胞分化方向,理解Neural ODE建模空间-基因双速度场的核心原理,展示Nature Methods 2026论文核心技术;
第四天| 药物扰动建模与疾病系统
上午:理论讲解(第五、六阶段)第五阶段:药物作用建模(Drug Perturbation Modeling)
核心目标:解决"药物如何改变细胞命运"• 药物作用于细胞的核心逻辑• 药物扰动建模在药物研发全流程中的应用场景配套模型理论:• ChemCPA:药物剂量-响应建模• scGen:扰动响应生成• CellOT:最优传输扰动预测• scGPT:大模型预测扰动第六阶段:疾病系统建模(Disease System Modeling)
核心目标:解决"疾病中细胞网络如何重构"• 疾病状态下细胞网络的变化规律• 疾病系统建模在患者分层、疾病亚型预测中的核心价值配套模型理论:• DeepProg:疾病预后预测• Numbat-multiome:从单细胞多组学数据推断CNV并重建肿瘤系统发育
下午:实操演练(对应上午第五、六阶段理论)实操前置准备:药物扰动模型工具包调试
1. Python 工具包适配:ChemCPA、scGen等药物扰动相关工具包的安装与调试;2. 数据准备:药物作用相关数据(药物剂量、细胞反应数据)的预处理与导入方法。实操模型讲解(Python代码解析 + GPU服务器上机实操)
1. 实操模型:ChemCPA(药物扰动预测)—— 对应第五阶段理论,构建药物扰动模型,预测不同药物剂量的作用效果、联合用药反应,掌握虚拟筛选的核心能力,理解其在药物研发ROI提升中的作用;2. 实操模型:scGen实操(单药扰动响应生成)—— 基于单细胞数据,生成药物扰动后的细胞状态预测,掌握生成式扰动模型的核心方法;3. 实操模型:DeepProg(疾病预后分析)——基于多组学数据和AI模型,分析疾病状态下患者预后进展。
第五天| 数字孪生与虚拟临床应用
上午:理论讲解(第七、八阶段)第七阶段:数字孪生细胞/组织(Digital Twin)
核心目标:解决"如何构建可推演虚拟人体局部系统"• 数字孪生技术在细胞、组织层面的应用逻辑• 其在降低药企湿实验成本中的核心价值配套模型理论:
• Virtual cell:虚拟细胞总览• DrugCell:药物反应神经网络•PhysiCell(Cell 2026):细胞仿真引擎第八阶段:虚拟临床与药物研发(Virtual Clinical Translation)
核心目标:解决"如何直接服务药物研发和临床决策"• 虚拟临床试验的设计逻辑• 从体外到体内的预测链条• ROI计算与决策支持配套模型理论:• PK/PD Neural Surrogate:药代动力学神经网络• Clinical Response Simulator:临床响应模拟
下午:实操演练+ 课程总结实操前置准备:数字孪生与虚拟临床模型工具包调试
1. Python 工具包适配:DrugCell、PhysiCell等数字孪生相关工具包的安装与调试。实操模型讲解(Python代码解析 + GPU服务器上机实操)
1. 实操模型:DrugCell(产业级药物反应预测)—— 对应第七阶段理论,构建药物反应预测模型,解释药物作用机制,掌握产业级模型的应用方法,理解其在降低湿实验成本中的作用;2. 实操模型:PhysiCell(数字孪生底层仿真)—— 对应第七阶段理论,搭建虚拟细胞仿真环境,完成从虚拟细胞到虚拟组织的仿真闭环,掌握数字孪生底层操作,衔接虚拟临床应用;
AI驱动计算免疫学
上下滑动查看
第一天、AI 与免疫计算基础
1. 机器学习与深度学习基础
1.1. 机器学习简介:从手写数字识别到大语言模型
1.2. 监督学习、无监督学习、自监督学习、迁移学习与生成式模型
1.3. 分类、回归、排序、表征学习在免疫计算中的对应问题
1.4. 常用评价指标:Accuracy、ROC-AUC、PR-AUC、Top-k recall、校准曲线
1.5. 免疫计算中特别重要的数据划分:随机划分、按抗原划分、按 TCR/BC划分、按 HLA 等位基因划分
1.6. 负样本构造、数据泄漏、类别不平衡与模型泛化问题
2. 代码环境与数据处理
2.1. Linux 基础与常用命令*
2.2. Conda、VS Code、Jupyter Notebook 环境搭建*
2.3. Python 基础:NumPy、Pandas、Matplotlib、Scikit-learn*
2.4. PyTorch 基础:Dataset、DataLoader、训练循环、GPU 使用*
2.5. 生物序列数据格式:FASTA、CSV、TSV、PDB/mmCIF*
2.6. HLA 命名、TCR/BCR 链信息、CDR3 序列、V/D/J 基因片段解析**拓展:vibe coding初讲解
3. 免疫学基础
3.1. 先天免疫与适应性免疫概览
3.2. 抗原、表位、免疫原性、
3.3. MHC-I 与 MHC-II 抗原呈递通路
3.4. pMHC 复合物:肽段、HLA、结合槽与呈递稳定性
3.5. TCR 结构:α/β 链、CDR1/2/3、克隆型与抗原特异性
3.6. BCR/抗体结构:重链、轻链、CDR-H3
3.7. 肿瘤新抗原、病毒抗原、细菌保护性抗原与疫苗靶点
第二天、免疫计算数据、数据库与表征方法
1. 常用免疫数据库
1.1. IEDB:T 细胞/B 细胞表位、MHC 结合、免疫原性数据*
1.2. VDJdb、McPAS-TCR:TCR-抗原配对数据*
1.3. ImmuneCODE、huardb、单细胞 TCR/BCR 数据*
1.4. OAS、SAbDab、CoV-AbDab:抗体序列与结构数据*
1.5. PDB、AlphaFold DB、IMGT、ANARCI 编号体系*
1.6. 数据清洗:去重、标准化、链配对、HLA 统一命名、CDR 区域提取*
2. 免疫分子的 AI 表征
2.1. One-hot、k-mer、BLOSUM、理化性质特征
2.2. 蛋白质语言模型表征:ESM、ProtT5、immune receptor language model
2.3. TCR/BCR 专用表征:CDR3-only、CDR1/2/3、多链联合编码
2.4. HLA 表征:全序列、pseudo-sequence、结合槽残基
2.5. pMHC 表征:肽段-HLA pair、三维结构、接触图、图神经网络输入
2.6. 抗体-抗原表征:paratope、epitope、界面残基、抗体编号与结构坐标
3. 常用结构与可视化工具
3.1. PyMOL 与 Mol* 可视化 pMHC、TCR-pMHC、抗体-抗原复合物*
3.2. Biopython、Biotite 分析序列和结构数据*
3.3. ANARCI 提取TCR/抗体编号和 CDR 区域
3.5. AlphaFold/AlphaFold-Multimer/Alphafold3/tfold/ 用于免疫复合物结构预测*
3.6. 结构质量评估:pLDDT、PAE、界面接触、RMSD、DockQ*
第三天、pMHC 识别:抗原呈递、MHC 结合与免疫原性预测
1. 抗原加工与 pMHC 形成机制
1.1. MHC-I 抗原加工:蛋白酶体切割, HLA 结合
1.2. MHC-II 抗原加工:内吞体加工、HLA-DP/DQ/DR 呈递
1.3. 肽段长度、锚定位点、HLA 等位基因特异性
1.4. pMHC 稳定性、呈递丰度与免疫原性之间的区别
2. 传统与深度学习 pMHC 预测方法
2.1. NetMHCpan、MHCflurry、MixMHCpred、IEDB 工具链介绍*
2.2. 肽段-HLA 结合预测:binding affinity 与 ligand presentation
2.3. CNN/RNN/Transformer 在 peptide-HLA pair 建模中的使用
2.4. HLA 泛化:已知 HLA、低样本 HLA、未见 HLA 的建模策略
2.5. 免疫原性预测:MHC binding 之外还需要考虑什么
3. pMHC 结构建模
3.1. pMHC 结构基础:HLA 结合槽、锚定残基
3.2. pMHC 结构预测与同源建模*
3.3. AlphaFold/AlphaFold-Multimer 用于 pMHC 建模的注意事项*
3.4. 肽段构象、HLA 接触残基与结构特征提取*
3.5. 从序列模型走向结构模型:contact map、distance map、graph
4. pMHC 实战项目
4.1. 构建一个 MHC-I peptide-HLA binding 基线模型*
4.2. 比较传统工具与深度学习模型在不同 HLA 上的表现*
4.3. 对候选肿瘤突变肽进行 pMHC ranking*
4.4. 可视化高分候选肽段在 HLA 结合槽中的结构模式*
第四天、TCR 受体组建模与 DeepTCR
1. TCR 生物学与受体组数据
1.1. V(D)J 重排与 TCR 多样性来源
1.2. α/β 链配对、CDR3 区域与抗原特异性
1.3. 克隆型定义、克隆扩增、公共 TCR 与私有 TCR
1.4. Bulk TCR-seq 与 single-cell TCR-seq 的区别
2. TCR 表征学习
2.1. CDR3 序列编码:字符级、氨基酸级、语言模型 embedding
2.2. V/J gene usage 的整合
2.3. TCR repertoire-level representation
2.4. 无监督聚类、motif 发现、抗原特异性富集分析
2.5. 受体组分类:疾病诊断、感染状态、肿瘤免疫反应
3. DeepTCR 专题
3.1. DeepTCR 框架介绍
3.2. DeepTCR 的无监督学习模块:repertoire structure 与聚类
3.3. DeepTCR 的监督学习模块:抗原特异性与疾病分类
3.4. DeepTCR 如何联合 CDR3 序列与 V/D/J gene usage 建模;该框架设计为可处理复杂 TCR 测序数据的深度学习工具。
3.5. DeepTCR 可解释性:motif、saliency、特异性克隆分析
3.6. DeepTCR 代码复现与结果解释*
4. TCR 受体组实战项目
4.1. 训练一个 repertoire-level 分类模型*,
4.2. 使用 DeepTCR 进行抗原相关 TCR 模式挖掘*
4.3. 可视化 TCR embedding、克隆扩增与抗原相关 motif*
第五天、TCR-pMHC 识别:从序列模型到结构模型
1. TCR-pMHC 识别问题定义
1.1. 输入形式:TCRβ、TCRαβ、peptide、HLA、pMHC 结构
1.2. 输出形式:binding/non-binding、ranking、抗原分类、多抗原检索
1.3. 泛化设定:unseen TCR、unseen peptide、unseen HLA、unseen TCR-peptide pair
1.4. 负样本构造:随机负样本、同 HLA 负样本、hard negative
1.5. 数据泄漏与过拟合:为什么随机划分会高估模型性能
1.6. 2025 年 Nature Methods 对 50 个 TCR-epitope 预测模型进行了系统评测,强调了多数据集、多抗原和严格泛化评估的重要性。
2. 传统与深度学习 TCR-pMHC 方法
2.1. 基于距离和聚类的方法:TCRdist、GLIPH/GLIPH2
2.2. 序列双塔模型:TCR encoder + peptide encoder
2.3. Cross-attention 模型:TCR 与 peptide/HLA 交互建模
2.4. 多模态输入:TCRαβ + peptide + HLA + gene usage
2.5. 可解释性:CDR3 motif、关键氨基酸、注意力热图
2.6. Zero-shot 与 few-shot 抗原特异性预测
3. PanPep 专题
3.1. PanPep 任务设定:TCR-antigen binding recognition
3.2. Meta-learning 在少样本抗原特异性预测中的作用
3.3. Neural Turing Machine 与外部记忆机制
3.4. PanPep 将 meta-learning 与 neural Turing machine 结合,用于更稳健地预测 TCR-抗原结合,尤其强调对未见 peptide 的泛化。
3.5. PanPep 代码结构、输入格式、训练与推理流程*
3.6. PanPep 与普通监督学习模型的对比实验*
4. 原子级 T 细胞抗原识别与图神经网络
4.1. 为什么仅用序列不足以解释 TCR-pMHC 识别
4.2. pMHC/TCR-pMHC 结构图构建:节点、边、距离、原子特征
4.3. GCN/GAT/EGNN/SE(3)-equivariant 网络简介
4.4. “Identifying T cell antigen at the atomic level with graph convolutional network” 专题:deepAntigen 使用图卷积网络在原子层面识别 T 细胞抗原,并同时涉及 antigen-HLA binding 与 antigen-TCR interaction 建模。
4.5. 原子级特征可解释性:界面残基、接触贡献、突变敏感性
4.6. 使用结构数据构建 TCR-pMHC 图输入*
5. Phage display + 机器学习发现癌抗原特异性 TCR
5.1. TCR discovery 的实验-计算闭环
5.2. Phage display 如何扩大 TCR-epitope 数据获取能力
5.3. Giancarlo Croce 等人的 Sci. Adv. 2025 论文专题:该研究展示了 display technologies 与 TCR-epitope interaction predictors 结合,可用于从大规模 TCR repertoire 中发现 TCR。
5.4. 从实验富集数据到监督学习标签
5.5. 模型筛选、候选 TCR 排序与验证策略
5.6. 复现实战:模拟 phage display enrichment 数据并训练 TCR-epitope ranking model*
6. TCR-pMHC 综合实战
6.1. 构建 TCRβ-peptide 识别基线模型*
6.2. 加入 HLA 信息提升 pMHC-aware TCR prediction*
6.3. 使用 PanPep 进行 few-shot antigen-specific TCR prediction*
6.4. 使用结构图模型分析 TCR-pMHC 界面*
6.5. 输出候选 TCR 的 ranking、解释性图*
第六天、BCR/抗体-抗原识别
1. BCR 与抗体基础
1.1. BCR 与分泌型抗体的关系
1.2. 重链、轻链、CDR-H1/H2/H3、CDR-L1/L2/L3
1.3. 抗体-抗原识别:paratope、epitope、构象表位与线性表位
1.4. 中和抗体、保护性抗体与交叉反应性
2. 抗体序列与结构建模
2.1. 抗体编号体系:Kabat、Chothia、IMGT
2.2. ANARCI 提取 CDR 区域*
2.3. OAS/SAbDab 数据清洗与抗体序列标准化*
2.4. tfold、ABodyBuilder、AlphaFold-Multimer 预测抗体结构*
2.5. 抗体-抗原复合物结构可视化与界面分析*
3. BCR/抗体-抗原识别的 AI 方法
3.1. 抗体语言模型:AbLang、AntiBERTy、抗体专用 PLM
3.2. 抗原特异性 BCR 分类
3.3. epitope prediction
3.4. 抗体-抗原 binding prediction:序列模型、结构模型、图神经网络
3.5. 亲和力预测与 ΔΔG 预测
3.6. 抗体 developability:聚集性、免疫原性、可表达性、稳定性
4. 抗体设计与优化
4.1. CDR grafting 与人源化
4.2. 亲和力成熟的机器学习建模
4.3. 生成式抗体设计:语言模型、扩散模型, 基于序列设计,基于序列结构协同设计
4.4. 抗体-抗原 docking 与候选排序
4.5. 抗体设计中的安全性与交叉反应风险
5. BCR/抗体实战项目
5.1. 从抗体序列中自动提取 CDR 并编号*
5.2. 训练抗原特异性 BCR 分类模型*
5.3. 预测抗体 paratope 并映射到结构上*
5.4. 使用结构特征训练抗体-抗原 binding baseline*
5.5. 对候选抗体突变进行亲和力提升排序*
AI 疫苗设计:从抗原筛选到多表位疫苗
1. 疫苗设计基础
1.1. 传统疫苗、亚单位疫苗、多肽疫苗、mRNA 疫苗、病毒载体疫苗
1.2. 保护性抗原、免疫优势表位、保守表位与逃逸突变
1.3. B 细胞表位、CD8 T 细胞表位、CD4 T 细胞表位
1.4. 肿瘤个体化新抗原疫苗设计流程
2. 反向疫苗学与免疫信息学流程
2.1. MHC-I/MHC-II 表位预测
2.2. B 细胞表位预测
2.3. 保守性、变异位点与逃逸风险分析
3. 肿瘤新抗原疫苗
3.1. 体细胞突变、HLA typing 与新抗原生成
3.2. 突变肽-MHC binding prediction
3.3. TCR recognition potential 与免疫原性排序
3.4. 个体化 neoantigen vaccine ranking pipeline*
3.5. 结合 TCR-pMHC 模型筛选更可能被识别的新抗原*
4. PLM + 几何深度学习用于保护性抗原预测
4.1. 蛋白质语言模型在抗原筛选中的作用
4.2. 几何深度学习在抗原结构表征中的作用
4.3. 序列-结构多模态融合
4.4. “Integrating protein language and geometric deep learning models for enhanced vaccine antigen prediction” 专题:该工作提出将蛋白质语言模型与几何深度学习结合,用于保护性疫苗抗原预测。
4.5. PLGDL 模型输入、标签、训练任务与评价指标
4.6. 保护性抗原预测与普通 antigenicity prediction 的区别
4.7. 复现实战:构建简化版 protein language + structure graph antigen predictor*
5. 疫苗设计综合实战
5.1. 从病原体蛋白组中筛选候选保护性抗原*
5.2. 对候选抗原进行 MHC-I/MHC-II 表位预测*
5.3. 设计一套“AI vaccine candidate ranking”报告*
AI智能体全流程自动化实战
上下滑动查看
第一天上午:大语言模型基础与Prompt 工程
理论一、大语言模型(LLM)基础认知
LLM 发展脉络:GPT-1 到 GPT-5 / Claude 4 / DeepSeek
主流大模型能力对比(OpenAI GPT、Anthropic Claude、DeepSeek、Llama 等)
生物领域专用模型(ESM-3、AlphaFold 3、scGPT)
Token、Context Window、Temperature 核心概念
模型选择策略:不同科研任务如何选模型
二、Prompt 工程核心技术
基础设计原则:角色、任务、背景、约束、格式、示例
Zero-shot vs. Few-shot Prompting
高级技术:CoT 思维链、Self-Consistency、ToT、ReAct
生物科研场景Prompt 模板设计(基因功能/蛋白质/实验方案/文献)
实操
给定差异表达基因,依次使用基础Prompt、Few-shot Prompt 和 CoT Prompt,逐步推理基因功能与疾病关联基因功能注释结果
实操案例2:实验方案设计 Prompt 优化
设计CRISPR-Cas9 基因敲除方案,对比 Zero-shot、Few-shot、CoT 策略的输出质量结构化实验方案文档
实操案例3:Prompt 模板库构建
设计5 类生物科研模板,使用 Python 封装参数化调用,批量处理多基因/蛋白质prompt_templates.py
第一天下午:结构化输出与生物数据模式
理论一、为什么需要结构化输出
由于LLM 输出具有不确定性,而科研自动化对输出格式有严格要求,因此需要掌握三大技术路线:JSON Mode、Function Calling 和 JSON Schema
二、JSON Schema 与 Pydantic 模型设计
Schema 语法、Pydantic V2 模型、嵌套结构处理、生物数据 Schema 设计模式(基因/蛋白质/药物-靶点)
三、大模型结构化输出最佳实践
OpenAI Structured Outputs、Claude 工具使用、输出验证与容错、分层提取策略
实操
实操案例1:PubMed 文献结构化提取
定义Pydantic 模型,通过 API 批量处理 20 篇文献摘要,验证输出并处理异常结构化文献DataFrame
实操案例2:蛋白质-配体相互作用结构化记录
设计多层级Pydantic 模型,处理嵌套结构与 Optional 字段,实现自动验证与异常标记结构化结合数据
实操案例3:生物数据 ETL 流水线
将非结构化文本转化为结构化JSON 并写入数据库,完成 GenBank、UniProt、临床报告等多源数据处理bio_data_etl.py
第二天上午:AI 编程智能体 — Claude Code + Codex + MCP + Skill
理论
一、AI 编程智能体的崛起
讲解从Copilot、Cursor、Claude Code 到 Codex 的演进历程,分析 Agentic Coding 核心特征及生物科研应用价值
二、Claude Code 深度讲解
核心架构与能力、CLAUDE.md、MCP/Hooks/Memory/Worktree、多平台支持、模型选择策略
三、多模型配置— 接入 DeepSeek 等
成本优化、网络友好、合规要求;Claude Code / Codex CLI 配置方法;常用模型 API 对比;多模型切换策略
四、MCP 服务器配置
MCP 协议架构、生物科研常用 MCP Server、配置方法、自定义生物 MCP Server 开发
五、Skills 技能系统配置
内置Skills 列表、调用方式、创建自定义生物科研 Skill(rnaseq-pipeline / protein-analysis)
六、OpenAI Codex 概览
Codex 多形态产品线、核心特性、Claude Code vs. Codex 对比、互补使用建议
实操
实操案例1:Claude Code 安装配置 + DeepSeek 模型接入
安装Claude Code CLI,配置 DeepSeek 模型接入,创建 CLAUDE.md 项目说明文件,并测试多模型切换功能双模型环境配置
实操案例2:MCP Server 配置与生物工具接入
安装MCP Server 并完成配置,开发生物数据库专用 MCP Server,测试工具调用功bio_database.py
实操案例3:Skills 系统实战 — 生物分析技能包
使用内置Skills,创建自定义 RNA-seq 与蛋白质分析 Skill,并进行测试
实操案例4:OpenAI Codex 快速上手
安装OpenAI Codex CLI,配置 AGENTS.md 文件,执行测试任务,并配置 DeepSeek 作为后端模Codex 环境配置
实操案例5:AI 编程智能体最佳实践总结
高效Prompt 技巧、项目上下文管理、安全与质量、常见陷阱best_practices.md
第二天下午:Function Calling 与生物工具集成
理论
一、Function Calling 原理深度解析
工作流程、工具定义规范(JSON Schema)、单工具/多工具调用、错误处理与
二、生物信息学工具生态
生物数据库API(NCBI/UniProt/PDB/ChEMBL/KEGG)、Python 库(Biopython/RDKit/Scanpy)、工具封装模式
三、工具编排与安全边界
权限控制、成本与延迟优化、多工具协同执行策略
实操
实操案例1:基因查询智能助手
定义基因查询、序列获取、BLAST 比对 3 个工具,通过 Function Calling 实现工具路由,完成多轮对话交互
实操案例2:药物分子性质预测工具链
集成RDKit 与 ChEMBL 数据库,完成 SMILES 解析、分子描述符计算与药效团分析,实现多工具并行调用
实操案例3:多工具协同分析平台
输入疾病名称,依次查询疾病与基因的关联关系、进行通路分析、检索候选药物,最终生成全链路分析报
第三天上午:RAG 原理与生物文献知识库
理论
一、RAG(检索增强生成)原理
详解RAG 架构中从 Query 到检索、注入、生成的完整流程,讲解 Chunking、Embedding、向量数据库与检索策略,并介绍评估指标。
二、生物文献RAG 的特殊挑战
术语消歧、图表处理、长文档切分、基因名称实体识别、跨物种知识区
三、高级RAG 技术
Query 改写(Multi-Query/HyDE)、Re-ranking、Self-RAG、Graph RAG
实操
实操案例1:生物文献知识库搭建
从PubMed 批量下载文献,进行语义切分,使用医学 Embedding 模型生成向量,构建 ChromaDB 向量索引。
实操案例2:精准文献问答系统
构建RAG 查询管线,实现引用标注(标注 PMID 来源),支持多轮对话并完成历史注入与上下文压缩。
实操案例3:RAG 质量评估与优化
构建评估数据集,进行自动化评估,对比不同Chunk 大小、Embedding 模型与 Top-K 参数的效果RAG 评估报告
第三天下午:智能体框架入门—— LangChain 核心实战
理论
一、AI 智能体架构深度解析
Agent = LLM + Planning + Memory + Tools + Reflection;Agent 类型分类;Agent vs. Pipeline—
二、LangChain 框架核心概念
架构概览(langchain-core/community/langgraph)、核心组件、LangGraph 状态图
三、从零设计一个生物科研Agent
从需求分析出发,完成工具设计、状态定义与图构建,讲解Agent 设计原则
实操
实操案例1:生物序列分析 Agent
使用LangGraph 构建状态图,集成 Biopython 工具,实现“分析、反思、重做”的自循环逻辑
实操案例2:文献综述生成 Agent
从PubMed 检索文献并获取全文,采用 Plan-and-Execute 策略,输出结构化文献综述
实操案例3:实验数据处理 Agent
使用ΔΔCt 法处理 qPCR 数据,由 Agent 自动识别数据格式,完成统计检验并生成标准化图表
第四天上午:生物数据分析智能体实战
理论
一、生物信息学数据分析范式
RNA-seq、蛋白质组学、单细胞 RNA-seq、GWAS 流程;Agent 如何融入传统生信流程
二、Agent 在数据分析中的角色
数据质控智能体、分析策略智能体、结果解读智能体、可视化智能体
三、Agent 记忆与上下文管理
短期记忆、长期记忆、工作记忆;生物数据上下文的特殊考虑
实操
实操案例1:RNA-seq 差异表达分析智能体
构建多步骤Agent 状态图,集成 scanpy、pydeseq2、gseapy 等工具,实现自动质控并生成火山图、热图与通路
实操案例2:蛋白质结构分析 Agent
通过PDB API 获取蛋白质数据,进行结构可视化、结构域分析、功能预测,再由 LLM 进行解读并生成分析报告。
实操案例3:单细胞数据分析引导 Agent
构建对话式Agent,引导完成 Scanpy 标准分析流程,实现基于 LLM 与标记基因的细胞类型自动注释
第四天下午:LangGraph 深度实战与生物数据分析
理论
一、LangGraph 高级状态管理
复杂状态定义(TypedDict/Pydantic)、状态聚合与分支、子图(Subgraph)嵌套、状态持久化与断点续传
二、LangGraph 高级控制流
条件路由(conditional_edges)、循环与递归模式、Human-in-the-loop 集成、并行节点执
三、LangGraph 生物数据分析架构设计
多步骤分析流水线设计、工具集成模式、错误处理与重试机制、结果可视化集成
实操
实操案例1:多组学数据整合分析 Agent
使用LangGraph 构建多组学数据整合分析流水线,集成转录组与蛋白质组数据,通过条件路由选择分析策略,输出综合分析报告
实操案例2:实验方案优化循环 Agent
构建LangGraph 自循环优化 Agent,集成文献检索与实验参数推荐,实现“设计、评估、改进”迭代优化,引入 Human-in-the-loop 审核
实操案例3:生物信息分析工作流编排系统
使用LangGraph 子图构建模块化分析工作流,支持 RNA-seq/蛋白质组学/ChIP-seq 多流程切换,实现断点续传与结果缓存
第五天上午:多智能体系统与AutoGen 框架
理论
一、多智能体系统架构
协作模式:层级式/对等式/流水线式/辩论式;生物科研中的多智能体场景
二、AutoGen 框架核心
AssistantAgent/UserProxyAgent/GroupChat 架构;AutoGen vs. LangChain 对比
三、多智能体系统设计原则
Agent 职责划分、通信协议、冲突解决、成本控制
实操
实操案例1:药物发现多智能体讨论系统
设定药物化学家、药理学家、临床医生3 个角色,开展多轮讨论与观点碰撞,最终输出综合评估报告
实操案例2:多 Agent 文献协作阅读系统
设定检索员、阅读者A、阅读者B、综述员 4 个角色,以 Pipeline 模式协作完成文献阅读,并对比多 Agent 与单 Agent 的输出质量
实操案例3:实验设计评审委员会
模拟IACUC/IRB 评审流程,由伦理专家、统计专家、领域专家独立评分,主席汇总各方意见后给出最终评审结论
第五条下午:综合实战、前沿展望与课程总结
理论
一、AI 智能体前沿趋势
AlphaFold 3 + Agent、scGPT/Geneformer 基础模型、AI 药物发现、Self-Driving Labs、多模态智能体、安全与伦理
二、课程核心知识点回顾
LLM 四大范式总结(Prompt/结构化输出/Function Calling/RAG)、智能体框架总结、多智能体挑战总结
实操
Step 1:需求分析与架构设计
明确要解决的具体科研问题,设计Agent 架构,确定所需的工具组合
Step 2:编码实现
推荐方案A(Claude Code + LangGraph)/ B(AutoGen + Codex)/ C(Claude Code + MCP)
学习目标
AI合成生物学
本课程面向合成生物学、生物工程、微生物工程、生物信息学、代谢工程、药学、农业生物技术及相关交叉方向学员,围绕“人工智能驱动的合成生物学”展开。课程以生物元件设计、基因线路设计、基因组工程、代谢工程和生物传感器为主线,结合 Nature、Science、Nature Biotechnology、Nature Communications、Cell Systems 等顶级期刊和前沿开源项目,系统讲解 AI 如何进入合成生物学的 Design-Build-Test-Learn 闭环。
课程不做单一课,也不把重点放在零散代码训练上,而是采用“前沿概念讲授 + 顶刊案例图拆解 + 最后一章集中 pipeline 复现”的方式,让学员先建立全局认知,再通过成熟开源流程理解真实项目如何落地。
通过本课程,学员应能理解 AI 如何用于生物元件设计、基因线路设计、基因组工程、代谢工程和生物传感器开发,吃透传统合成生物学设计方法与 AI 方法之间的差异、互补关系和适用边界。学员将能够读懂顶刊案例中的模型输入输出、实验验证流程、DBTL 闭环、候选设计筛选逻辑和工程化约束;理解预测模型、生成模型、主动学习、贝叶斯优化、基础模型和 AI agent 在合成生物学中的不同角色;能够判断一个 AI 合成生物学项目需要什么数据、什么模型、什么验证指标,以及如何进入下一轮设计迭代。
AI+抗体设计
培训聚焦深度学习驱动的抗体设计为核心方向,以David Baker实验室核心设计方法、主流抗体大语言模型、AI抗体结构预测模型为教学核心,秉持理论夯实、实操落地、科研进阶、工程应用的培训原则。依托高性能服务器实操环境,循序渐进讲解行业主流软件、开源模型、代码实操、数据处理与模型调优,搭配十篇顶刊经典文献深度解析,全方位覆盖当下抗体设计领域前沿技术、研究热点与工业落地方案。助力零基础及进阶学员快速打通理论原理、代码实操、模型应用、科研创新全流程,熟练掌握AI抗体设计全套技术栈,可独立完成抗体结构预测、抗体亲和力优化、可开发性改造、抗体从头设计等科研实操任务,适配药物研发、生物工程、合成生物学等科研与工业应用场景。
AI+多肽设计
让学员更好的知道当下蛋白质设计的核心热点以及优势能独立完成蛋白结构可视化:用 PyMOL 加载复合物、识别结合界面、测量相互作用、渲染高清结构图。能使用 ESM2 完成序列评分,用 PepMLM 实现靶标定向短肽生成,并通过 Python 完成数据清洗、筛选与可视化。能用 AF2/Multimer 预测肽 - 蛋白复合物结构,解读 pLDDT/ipTM/PAE 指标,完成界面分析与质量评估。能用 LigandMPNN 基于固定骨架优化短肽序列,结合多指标完成候选肽筛选与成药优化方案设计。建立AI 短肽设计完整思维闭环:靶点选择→候选生成→性质筛选→结构评估→优化验证。具备独立解决实操问题的能力,能合理解读 AI 预测结果、规避模型局限,输出可实验验证的短肽候选。掌握跨工具联用能力,实现 ESM2、PepMLM、AF2、LigandMPNN、PyMOL 的流程化配合使用。
AI蛋白质设计
让学员系统掌握深度学习在蛋白质设计领域的技术体系、前沿模型与工程落地思路
吃透传统蛋白设计与 AI 方法的差异及互补逻辑。可独立完成蛋白质序列、结构、结合口袋的可视化与数据分析,学会AlphaFold2/3、ESMFold等结构预测模型,能运用 Rosetta、ABACUS 完成传统设计,熟练操作 ProteinMPNN、ESM-IF、DenseCPD 等深度学习模型开展序列设计、侧链优化与蛋白稳定性改造,并复现顶刊相关应用案例。熟练掌握扩散模型、图神经网络在蛋白骨架 / 全原子设计中的应用,可基于 RFDiffusion 系列、FrameDiff、Chroma 等模型实现结合蛋白、酶、核酸结合蛋白、靶向配体蛋白的从头设计,完成表位筛选、结构生成、可设计性评估与候选分子排序。理解酶设计与改造核心原理,能结合 Theoyzme 催化基序、几何约束完成酶骨架与活性位点设计,使用 EvolvePro 等工具结合主动学习、突变效应预测开展 AI 辅助酶改造,搭建突变库并完成方案设计。掌握ESM 系列、ProGen、ZymCTRL等蛋白质语言模型,理解模型架构与表征逻辑,可完成序列 Embedding 提取、零样本突变打分、条件序列生成、模型微调,并实现语言模型与结构模型、改造模型的联动使用。能够基于 GNN、CNN、几何深度学习搭建蛋白预测与设计模型,完成模型训练、效果调优,规避数据泄露、过拟合等常见问题。
AI构建虚拟细胞
技术栈回顾:从数据→状态→调控→动态→药物→疾病→孪生→临床• 前沿趋势:大模型、多模态、空间组学、虚拟敲除• 职业发展:计算生物学人才需求与能力路径配套资源
• 课程PPT(理论讲解)• 实操代码包(Jupyter Notebook)• GPU服务器账号(云端实操)• 数据集(公开单细胞/空间数据)• 参考文献(最新顶刊论文,基本是2026、2025新文章+少量经典文章)
AI驱动计算免疫学
让学员系统掌握人工智能在计算免疫学中的核心热点与优势,能独立完成免疫分子结构可视化:用 PyMOL/Mol* 加载 pMHC、TCR-pMHC、抗体-抗原复合物,识别结合界面、测量相互作用、渲染高清结构图。能使用蛋白质语言模型(ESM、ProtT5)提取序列表征,用 DeepTCR 完成受体组聚类与抗原特异性分类,用 PanPep 实现少样本 TCR-抗原结合预测,并通过 Python(NumPy/Pandas/PyTorch)完成免疫数据清洗、划分、负样本构造与模型训练。能用 AlphaFold‑Multimer / tfold 预测 TCR-pMHC 或抗体-抗原复合物结构,解读 pLDDT / PAE / DockQ 等质量指标,完成界面残基分析与结合模式评估。能用图神经网络(GCN / GAT / EGNN)构建原子级 TCR-pMHC 图,优化抗原识别与亲和力排序。建立 AI 驱动免疫设计的完整思维闭环:抗原筛选 → 表位/MHC结合预测 → TCR/BCR特异性识别 → 结构验证 → 候选排序 → 疫苗/抗体优化方案。具备独立解决实操问题的能力,能合理解读 AI 预测结果、规避数据泄漏与过拟合风险,输出可实验验证的免疫候选分子(新抗原、特异性 TCR、优化抗体)。掌握跨工具联用能力,实现 IEDB/VDJdb 数据库 → ESM/ProtT5 → DeepTCR/PanPep → AlphaFold-Multimer → PyMOL 的流程化配合使用。
AI智能体全流程自动化实战
本培训面向生物领域科研人员,旨在通过5天系统化学习,使学员系统掌握 AI 智能体的核心技术与实战能力。在知识层面,帮助学员理解大语言模型的工作原理与能力边界,建立 Prompt 工程、结构化输出、Function Calling、RAG 四大应用范式的系统认知,理解智能体架构及多智能体协作模式。在技术层面,使学员熟练使用 Claude Code、Codex 等 AI 编程智能体工具,掌握 MCP 服务器搭建与 Skills 技能系统配置,能够基于 LangChain/LangGraph 框架构建具有状态管理、条件路由、人机协同等高级控制流的生物数据分析智能体,能够搭建生物文献 RAG 知识库实现精准问答与引用溯源,掌握 AutoGen 多智能体框架以设计多角色协作系统。在实战层面,使学员能够独立完成 RNA-seq 差异分析、蛋白质结构分析、单细胞数据注释等生物数据分析智能体的开发,能够将 GenBank、UniProt、临床报告等多源非结构化数据转化为结构化数据并构建 ETL 流水线,能够集成物数据库 API 构建多工具协同分析平台。在综合素养层面,帮助学员了解AI 生物科研前沿趋势,掌握智能体系统的可靠性设计方法,最终具备独立设计并实现个人定制化生物科研智能体项目的完整能力。
授课讲师
AI合成生物学
主讲教师来自清华大学,兼具学术研究与产业应用背景,,来自国内顶尖生命科学与人工智能交叉研究团队。其研究方向与本课程“AI 驱动的合成生物学”高度契合,能够从前沿算法、真实科研案例和产业转化应用三个层面,系统讲解人工智能如何结合生物元件设计、基因线路构建、代谢工程优化与 DBTL 闭环。主讲教师及所在团队相关研究成果已发表于 PNAS、Angew. Chem. Int. Ed.、Nature、Science 等国际知名期刊,团队累计发表论文 300 余篇,具备扎实的科研积累与前沿课程开发基础。
AI辅助抗体设计
主讲老师在学术界和工业界都有丰富算法开发和应用经验,博士毕业于国内顶尖课题组,从事蛋白质结构预测和蛋白质设计的研究工作,相关工作成果已在Cell Systems、Angew. Chem. Int. Ed.、JCIM等国际知名期刊发表论文。目前在知名药企担任高级研究员,主导AI驱动的大分子药物设计平台开发与团队管理。
AI多肽设计与大模型设计
主讲老师在学术界和工业界都有丰富算法开发和应用经验,毕业于南开大学院士课题组,从事AI多肽设计、抗菌肽设计以及蛋白质设计的研究工作,相关工作成果已在New England、Plos one等国际知名期刊发
AI蛋白质设计
主讲老师在学术界和工业界都有丰富算法开发和应用经验,来自国内超顶尖课题组,主要从事蛋白质结构预测和蛋白质设计的研究工作,相关工作成果已在PNAS、Angew. Chem. Int. Ed.、Nature、Science等国际知名期刊发表,课题组已发表文献300余篇。
AI构建虚拟细胞
主讲老师来自浙江大学,主要研发方向为组学算法开发与虚拟细胞建模,以第一作者(含共同)发表高水平期刊会议论文数篇,包括Nature Communications,ISBI等,承担各层次研发课题3项,领导共创开源社区搭建,github star数百,具有丰富的科技成果转化落地经验,讲课一致受到学员高度评价。
人工智能驱动的计算免疫学
主讲老师毕业于清华大学,致力于AI for Science(AI4S)领域的前沿研究,深耕生物信息学与计算免疫学。在腾讯AI Lab等头部大厂拥有丰富的算法落地经验。研究成果丰硕,多篇论文发表于ICLR、KDD、AAAI、BIBM等人工智能国际顶级会议,以及《Nature Communications》、《Analytical Chemistry》、《Expert Systems with Applications》等领域内顶级学术期刊。
AI智能体驱动生物医学
讲师介绍:AI应用算法工程师,长期专注于大模型应用部署、Agent系统搭建、企业知识库接入、多平台协同与自动化流程设计,拥有丰富的一线项目实施与交付经验。曾参与多类智能助手、业务自动化平台与科研辅助系统的方案设计与落地,擅长将大模型能力与真实业务流程结合,快速构建可运行、可扩展、可维护的Agent应用。
授课时间
AI合成生物学
2026.8.15-2026.8.16(09:00-11:30--13:30-17:00)
2026.8.18-2026.8.19(19:30-22:30)
2026.8.22-2026.8.23(09:00-11:30--13:30-17:00)
共计5天课程 通过腾讯会议直播 线上实操 提供全部录播
AI多肽设计与大模型设计授课时间
2026.7.18-2026.7.19(09:00-11:30--13:30-17:00)
2026.7.21-2026.7.22 (19:00-22:00)
2026.7.25-2026.7.26 (09:00-11:30--13:30-17:00)
共计5天课程 通过腾讯会议直播 线上实操 提供全部录播
AI蛋白质设计设计授课时间
2026.8.13-2026.8.14 (19:00-22:00)
2026.8.22-2026.8.23 (09:00-11:30--13:30-17:00)
2026.8.25 -2026.8.26(19:00-22:00)
2026.8.29-2026.8.30 (09:00-11:30--13:30-17:00)
共计6天课程 通过腾讯会议直播 线上实操 提供全部录播
AI抗体设计授课时间
2026.9.5-2026.9.6 (09:00-11:30--13:30-17:00)
2026.9.9-2026.9.10(19:00-22:00)
2026.9.12-2026.9.13 (09:00-11:30--13:30-17:00)
共计5天课程 通过腾讯会议直播 线上实操 提供全部录播
AI构建虚拟细胞授课时间
2026.7.23-2026.7.24 (19:00-22:00)
2026.7.28 -2026.7.29(19:00-22:00)
2026.8.1-2026.8.2 (09:00-11:30--13:30-17:00)
2026.8.4 -2026.8.5(19:00-22:00)
共计5天课程 通过腾讯会议直播 线上实操 提供全部录播
人工智能驱动的计算免疫学授课时间
2026.8.8 -2026.8.9(09:00-11:30--13:30-17:00)
2026.8.11 -2026.8.12(19:00-22:00)
2026.8.15-2026.8.16 (09:00-11:30--13:30-17:00)
2026.8.18 -2026.8.19(19:00-22:00)
共计5天课程 通过腾讯会议直播 线上实操 提供全部录播
AI智能体驱动生物医学授课时间
2026.8.22-2026.8.23 (09:00-11:30--13:30-17:00)
2026.8.25 -2026.8.26(19:00-22:00)
2026.8.29-2026.8.30 (09:00-11:30--13:30-17:00)
共计5天课程 通过腾讯会议直播 线上实操 提供全部录播
课程费用
AI合成生物学,AI多肽设计与大模型设计、AI蛋白质设计、AI抗体设计、AI构建虚拟细胞,人工智能驱动的计算免疫学应用实战:
公费价:每人每班¥6880元 (含报名费、培训费、资料费、提供课后全程回放资料)
自费价:每人每班¥6580元 (含报名费、培训费、资料费、提供课后全程回放资料)
AI智能体驱动生物医学
公费价:每人每班¥5000元 (含报名费、培训费、资料费、提供课后全程回放资料)
自费价:每人每班¥4500元 (含报名费、培训费、资料费、提供课后全程回放资料)
重磅优惠:
报二送一(同时报名两个班免费赠送一个学习名额赠送班任选)
优惠1:
两班同报:10880元 (可学习三个直播课)
三班同报:14880元 (可学习四个直播课)
四班同报:18880元 (可学习六个直播课)
特惠一:24880元 (可免费学习一整年本单位举办的任意课程)
特惠二:28880元(可免费学习两整年本单位举办的任意课程)
优惠2:提前报名缴费可享受300元优惠(仅限十五名)
报名学习课程可赠送往期课程回放(报多少赠多少)
(可点击跳转详情链接):
回放一:本课程为视频课!机器学习生物医学培训!
回放二:本课程为视频课!单细胞空间转录组培训!
回放三:本课程为视频课!比较基因组学培训!
回放四:本课程为视频课!机器学习蛋白质组学培训
回放五:本课程为视频课!机器学习微生物组学培训
回放六:本课程为视频课!蛋白质晶体结构解析培训
回放七:本课程为视频课!CRISPR-Cas9基因编辑培训
回放八:本课程为视频课!机器学习代谢组学培训!
回放九:本课程为视频课!深度学习基因组学培训!
培训特色及福利
1、课程特色--全面的课程技术应用、原理流程、实例联系全贯穿
2、学习模式--理论知识与上机操作相结合,让零基础学员快速熟练掌握
3、课程服务答疑--主讲老师将为您实际工作中遇到的问题提供专业解答
授课方式:通过腾讯会议线上直播,理论+实操的授课模式,老师手把手带着操作,从零基础开始讲解,电子PPT和教程开课前一周提前发送给学员,所有培训使用软件都会发送给学员,有什么疑问采取开麦共享屏幕和微信群解疑,学员和老师交流、学员与学员交流,培训完毕后老师长期解疑,培训群不解散,往期培训学员对于培训质量和授课方式一致评价极高!
学员对于培训给予高度评价
报名咨询方式(请二维码扫描下方微信)
联系人:许老师
电话:15638270801(微信同号)
引用本次参会学员的一句话:
发现真的是脚踏实地的同时 需要偶尔仰望星空非常感谢各位对我们培训的认可!祝愿各位心想事成!