2026年年初,我在海外校友峰会上做了一场技术分享,题目叫《从筛选抗体,到AI按需定制设计抗体》。讲完之后加好友的人比想象中多,大家都在问同一个问题:PPT和讲稿能不能公开。这篇就把当时的演讲稿和PPT核心页面整理成了完整的文字实录,现场来不及展开的技术细节、没写进slides的背景推演,也一并补在这里。如果你正在做抗体发现,或者正打算给团队引入AI设计管线,这篇内容应该能帮你看清楚这套方法论到底走到了哪一步。
1. 为什么这个时间点,偏偏要讲“AI设计抗体”
1.1 这场分享是怎么选出来的
年会筹备期间,主办方给的主题方向是“前沿技术如何改变生物医药”。我原本准备了两版方案,一版讲通用大模型在药物研发里的应用,另一版就是这个抗体AI设计。最后我放弃了前者,原因很简单:通用大模型的话题太宽,而台下观众里有相当比例是做药物研发、生物技术投资和临床转化的,抗体是他们最熟悉的工具。与其说一个大家都在讲的宏观趋势,不如拆一个正在发生剧烈变化的垂直领域。
当时我给自己定了个目标,25分钟内必须讲清楚三件事:传统抗体筛选的问题到底出在哪里,AI设计抗体在技术上是怎么实现的,以及一个真实项目从设计到拿到先导分子的完整路径。后来现场超时了3分钟,问题最多的部分果然是第三块。大家其实不缺概念,缺的是“到底怎么操作”的细节。
1.2 分享前我做过的两个小调研
为了讲得有依据,我在准备阶段做了两件功课。
第一件事是摸底传统抗体发现的真实时间成本。我联系了几位在大型药企里负责抗体发现的朋友,问同一个问题:从拿到靶点到拿到一个可以进入临床前评价的先导抗体,平均要多长时间?答案集中在6到12个月。运气好的项目4个月能跑完,复杂膜蛋白靶点拖到18个月的也不少见。这里还没算上后续亲和力成熟、人源化改造、可开发性优化那几个月的额外时间。换句话说,传统方法不是不出活,而是时间账单越来越难看。
第二件事是调研AI设计抗体的落地情况。我统计了过去公开报道里进入临床前研究的AI设计抗体项目,发现一个明显变化:前两年AI基本只做辅助打分,帮实验团队从几百个候选里排序;而最近一年,已经开始出现重链和轻链都由算法生成、随后直接进入动物实验阶段的案例。这说明“按需设计”已经不是一个宣传词,而是有真实项目在走通。
做完这两个调研,我基本确定这个题目选对了。
2. 传统抗体筛选究竟卡在哪里
2.1 三条经典技术路线的成败得失
要在25分钟内讲清楚传统筛选的瓶颈,得先帮观众把技术谱系梳理明白。当前主流单抗发现平台就三条路线:杂交瘤技术、噬菌体展示、单B细胞分选。
杂交瘤技术是最经典的路子,免疫动物后取脾脏B细胞和骨髓瘤细胞融合,筛出能稳定分泌目标抗体的杂交瘤克隆。它的优点是抗体经过体内亲和力成熟,天然接近人体真实应答,免疫原性风险相对低;缺点是通量低、周期长,一个完整流程往往要半年以上,而且鼠源抗体后续必须做人源化改造。
噬菌体展示是过去二十年最主流的高通量平台,把庞大的抗体基因文库展示在噬菌体表面,通过亲和淘选不断富集特异性克隆。它最大的优势是文库容量大,天然库、合成库、免疫库都能做;短板同样明显——淘选过程对操作经验极度敏感,洗脱条件稍微不对,高亲和力克隆就丢了。
单B细胞分选是近期兴起的路线,从免疫动物或康复者外周血里直接分选抗原特异性B细胞,再单细胞测序拿到抗体基因。它的优势是保留了天然的轻重链配对信息,适合应对紧急病原体;限制是对样品质量、流式分选条件和单细胞平台依赖度都很高。
三条路线放在一张表里看更直观:
| 技术路线 | 典型周期 | 主要优势 | 主要短板 |
|---|---|---|---|
| 杂交瘤 | 6-12个月 | 天然配对、亲和力成熟好 | 通量低、后续人源化成本高 |
| 噬菌体展示 | 3-6个月 | 文库通量大、人源化库可用 | 淘选经验依赖强、易丢高亲和力克隆 |
| 单B细胞分选 | 2-5个月 | 保留天然配对、适合快速应急 | 依赖样品质量与单细胞平台 |
2.2 我总结的“三座大山”
这三条路线虽然技术细节不同,但本质上都逃不开三座大山。
第一座是时间山。每轮筛选、克隆化、表达、测活就要一周,一个完整流程等于无数个一周的叠加。我见过一个针对某受体蛋白的项目,光亲和力成熟就做了四轮,每轮三个月的循环,一年就这样过去了。
第二座是成本山。动物免疫、细胞培养、基因合成、表达纯化、SPR检测,每一环都在烧钱。一个靶点的早期发现成本轻松落在几十万到上百万人民币区间,如果算上失败项目的沉没成本,账更难看。
第三座是运气山,这一点最容易被低估。即使你的筛选流程走通了,拿到的先导抗体也未必适合往下走。亲和力合格但表达量低,或者热稳定性差、聚体严重,这样的分子我见过太多。某次针对一个G蛋白偶联受体的胞外表位筛选,噬菌体淘选了三轮后拿到的阳性克隆,在哺乳动物细胞里表达量只有0.5 mg/L,后续换了载体、改了信号肽才勉强提到15 mg/L。筛得出、产不出,就是这个行业里最典型的隐性浪费。
这三座山的本质问题是同一个:传统流程依赖“从多样性里找答案”,而多样性本身就是一种运气。你要从几百万个分子里大海捞针,捞到了算运气好,捞不到就得再来一轮。
3. AI按需定制设计抗体的技术逻辑拆解
3.1 生成模型真正在生成什么
很多观众第一次接触AI设计抗体时,有个最普遍的误解:觉得AI是直接写出一段氨基酸序列的“码字机器”。实际完全不是这样。
AI设计抗体的核心链条是:表位-结构-序列。先拿到靶点蛋白的结构信息,锁定想要结合的抗原表位区域,然后用生成模型去生成能够在这个表位表面形成稳定结合的CDR序列——CDR是抗体可变区里的互补决定区,直接决定抗原结合特异性。
换句话说,生成模型做的不是凭空填字母,而是从结构约束出发反推序列。这就像你写一篇文章,不是对着空白页写,而是先确定主题、限定字数、再逐段落笔。CDR区通常有三段重链CDR和三段轻链CDR,它们共同构成一个空间表面去贴合抗原;而框架区提供结构支撑,直接影响抗体的稳定性和可开发性。
我在这里特别想强调一个实战技巧:真正成熟的AI抗体设计,绝不会只优化CDR的亲和力,而是把框架区的稳定性也放进优化目标。只盯着CDR的团队,做出来的序列往往第一轮合成就降解了。
3.2 三个关键能力缺一不可
一个能用、能打、能进实验室的设计管线,至少要有三个不可替代的能力。
表位锁定能力排在第一位。你要让模型清楚自己该结合哪块表面。抗原表位有可能是线性表位、构象表位,也可能是翻译后修饰调控的位点。输入的表位定义错了,模型再强也会给出一个亲和力很高、但结合在错误位点的“假阳性”抗体。
第二个能力是可开发性约束。高亲和力不等于成药。一个序列即使结合力好,如果热稳定性差、等电点极端、有潜在的糖基化位点,或者疏水patch太大,后续工程化阶段一定返工。真正专业的设计管线,会在生成阶段就把这些成药性指标作为约束条件一起优化,而不是等实验阶段再补救。
第三个能力是多样化生成。这也是我从实战中越来越看重的一条。如果AI生成100条序列,最后发现它们共享同一个祖先序列框架,等于只做了一次尝试。真正的生成模型必须保证足够的序列多样性,让同一个表位能跳出多种完全不同的结合方式,这样下游实验才有真正的筛选空间。
3.3 “淘金”和“炼金”的本质差别
传统筛选是在天然或合成文库这个“矿脉”里淘金,金子在矿里,你只管淘得够不够快、够不够准。AI设计是直接按配方“炼金”,从靶点结构和成Byte药性需求出发,在生成空间里反向搜索。
但炼金有一个逃不开的问题:你炼出来的金,成色到底够不够?AI给出100条序列,不代表每条都能在实验里兑现。所以在我的PPT里,画了一张从设计到验证、再到反馈更新的闭环图。现场反馈最好的就是这一页,因为几乎所有人都经历过序列预测和实验结果对不上的痛苦。闭环的意义就在于,它把“预测得准不准”变成了一个持续学习的系统,而不是一次性的赌注。
4. 一个膜蛋白靶点的AI设计抗体完整实操流程
4.1 靶点结构获取与表位锁定
用AI设计抗体的第一步,绝不是让模型开始生成,而是尽可能地确认表位。
我当时分享的这个项目,靶点是某膜蛋白受体。我们先是拿到了靶点与小分子配体的共晶结构,又用结构预测模型补全了胞外结构域的柔性区域。综合分析后,我们把结合位点锁定在受体二聚化界面的一个构象表位上——遮挡这个表位就能阻断下游信号通路。
这里有一个我特别想让做实验的观众理解的排序逻辑:表位决定功能,亲和力决定强度,序列决定可实现性。所以第一步把表位锁对,比模型生成了多少条漂亮序列重要得多。我们那个项目在表位定义上反复核对了3周,最后才确定氨基酸范围内的关键残基清单。
4.2 序列生成与筛选打分
进入计算阶段,实操路径是这样的:先输入表位残基和框架选型,比如在重链上选择某个常用的种系框架,再用生成模型产出1000条候选CDR序列。每条序列都做结构建模、相互作用指纹打分、可开发性过滤。最后通过三档漏斗,从1000条压到50条候选,再从50条里择优选出10条进入基因合成。
评分环节是我的重点提醒区。不要只看一个综合分数。我把打分拆成了可解释的得分卡,包括残基接触数、氢键数量、疏水埋藏面积、形状互补度和框架稳定性五个维度。有的候选综合分高,但疏水埋藏不足,结合并不牢靠;有的分数居中,但序列多样化贡献明显,值得保留。
最终选出的10条不一定分数最高,而是在打分卡上覆盖了不同的结合模式。宁可多花一点合成费用,也要让生物物理实验看到不同的结合策略。
4.3 湿实验闭环与反馈迭代
设计做完,真正见真章的是湿实验。那10条序列用哺乳动物细胞表达,第一天转染、第五天收上清、第六天做SPR初筛。
结果比我们预计的乐观一些:4条表达量超过50 mg/L且折叠正确,其中2条亲和力在纳摩尔以下,阻断活性也过关,直接进入后续的人源化改造;另1条虽然亲和力合格,但在细胞水平上表现出明显的非特异性结合——这一类坑,计算打分阶段没有完全暴露,最后是实验手段揪出来的。
这里要重点说闭环迭代的价值。我们把这一轮实验数据映射回模型的训练集,记录下序列特征与表达量、亲和力、非特异性之间的对应关系,然后让模型重新生成第二代序列。第二轮的表达水平整体上了一个台阶,设计成功率明显改善。AI管线和传统筛选之间最本质的区别就在这:传统筛选做完就结束了,而AI设计能“记住”失败,每次实验都在给模型补充新的约束条件。
5. 现场问答实录:被问得最多的五个问题
5.1 Q1:AI真的能设计出可以进入商业开发的抗体吗?
我的回答是:可以,但要分阶段理解。AI完全能生成用于临床前研究的先导抗体分子,这是已经被多个项目验证过的事实。但从先导分子走到上市药物,中间还有人源化、亲和力成熟、CMC工艺、安全性评价一整条长链路,这跟传统抗体项目没有任何区别。AI解决的是起跑线问题,不是终点线问题——它让你不再花6个月在文库淘选上,而是把时间留给真正有科学深度的优化环节。
5.2 Q2:需要多大的算力和多少数据?
这个问题被问得最多。说实话,没有外界渲染的那么吓人。单项目级别的抗体生成和打分,一张中端GPU就能在一个晚上跑完一轮。真正贵的是人力和数据整理时间。如果你手上有上千条历史抗体的序列、亲和力数值、表达量产率、热稳定性记录,并且愿意花时间去标准化,那你已经有条件进入AI设计。数据不在于多,而在于可对比。
5.3 Q3:AI生成的序列,专利申请怎么办?
AI生成序列的知识产权问题,不同法域政策差异很大。我的建议是两条:第一,尽早咨询有生物信息学背景的专利律师,不要拖到分子拿到手才去想;第二,把AI生成过程的可复现性记录做到“黑匣子”级别——输入表位、模型版本、采样参数、评分标准全部可回溯,因为审查阶段最怕解释不清楚技术方案的充分性。另外,别只申请单条序列的权利要求,要把保护范围尽量扩展成结构基序和结合表位层面的权利要求,否则等后续优化几次,原序列就没用了。
5.4 Q4:AI设计会不会替代实验科学家?
我给现场做了一个反向表述:AI首先会淘汰的是不做记录的实验习惯。过去做实验靠“手感”,哪个批次状态好、哪条曲线可信,都装在老科学家的脑子里;现在这些信息必须结构化地为模型所用。一个合格的计算生物学家得看得懂SPR图谱,一个合格的湿实验科学家也得理解扩散模型生成序列的基本原理。这个领域真正稀缺的,不是纯计算人才,也不是纯实验人才,而是两端都懂一点、能当翻译员的人。
5.5 Q5:现在才入局,还来得及吗?
来得及,但窗口正在关闭。这个判断基于一个类比:过去10年,单抗发现的主流从杂交瘤过渡到噬菌体展示,当时晚入局的团队花了三倍成本才补上平台能力。现在同样的迁移正发生在AI设计这条路径上。未来五年内,AI设计抗体会从少数团队的竞争壁垒变成行业标准管线。谁先攒下完整的数据闭环,谁就有了长期竞争力。晚动手的团队面临的不是“做不出来”,而是“成本比别人高一个量级”。
6. 避坑指南:传统筛选团队转向AI设计的四条经验
6.1 数据标准化是第一生命线
我见过不止一个团队拿着几千条历史数据冲进AI设计,结果第一轮训出的模型泛化能力差得离谱。原因高度一致:历史数据里的亲和力数值来自不同平台、不同批次、不同温育时间,甚至单位和检测模式都不一样。把这些数据直接丢进训练集,等于喂给模型一套自相矛盾的“事实”。正确的做法是先花时间做数据标准化,把所有亲和力数据映射到共同的检测协议下,再谈建模。数据整理听着不性感,但它决定模型的全部上限。
6.2 计算和实验必须双责任人
AI设计项目最容易死在交接处。计算团队交付100条序列,实验团队表达了20条,然后各自觉得是对方的流程有问题。我们的做法是每个项目同时设计算组和实验组两个接口人,每周强制同步一轮,讨论什么序列值得合成、什么结果值得反馈。上一节提到的那个膜蛋白项目第二轮能快速收敛,靠的就是这个机制,不是什么玄学。
6.3 别让打分模型替实验做“绝对筛选”
再好的打分模型都会有偏差。我的原则很明确:计算阶段只做安全性过滤,帮实验省掉那些明显表达不了、免疫原性风险过高的候选;真正的胜负手,永远交给实验验证。也不要追求单条序列高分,一张覆盖多种结合模式的候选名单,比十条长得差不多的“高分”序列更有价值。
6.4 先拿难靶点练兵,别碰容易靶点
转AI设计的团队最容易犯的错,是先拿一个传统筛选已经能做好的容易靶点做验证。容易靶点做不出差距,也看不出管线哪里薄弱。去找一个过去用传统筛选失败过的靶点,让AI团队正面挑战一次。如果AI能给出一版传统方法给不出的先导抗体,整个团队才会真正从心底相信这场范式转移。那一瞬间带来的团队信心,比任何KPI都管用。
最后说一个PPT里没写的小细节:那场分享结束后的晚宴上,有两位做临床很多年的朋友跟我说,他们真正关心的不是AI能设计出多少条序列,而是这些序列能不能在高难度靶点上稳定复制成功。我个人把这句话一直留着,它比任何技术指标都更能提醒我,这个领域离“坐实”还很远,但也正因为如此,才值得继续铺管线、攒数据、踩坑。