虎嗅

AI设计抗体挑战赛:超越传统实验,但远未封神

AI抗体设计“大考”揭秘:光环褪去后,它到底行不行?

大家好,我是你们的财经记者兼经济学者。今天我们要聊的,不是股市的涨跌,而是生物医药界最近最火、也最容易被“吹过头”的一个话题:AI能不能直接“造”出治病救人的抗体药?

过去两年,只要提到AI制药,大家听到的都是“颠覆”、“革命”、“一夜成名”。特别是AlphaFold(蛋白质结构预测工具)横空出世后,整个行业都沸腾了。很多公司宣称:只要给AI一个抗原(比如病毒),它就能在电脑里直接设计出高亲和力的抗体,省去了传统实验室里那些耗时耗力、像大海捞针一样的筛选过程。

但是,最近《Nature Biotechnology》(生物技术领域的顶级期刊)上发了一篇重磅文章,搞了一场名为“AIntibody Challenge”(抗体AI挑战赛)的“全真模拟考”。这场考试没有滤镜,没有作弊,29家顶尖机构、511条AI设计的抗体序列,全部合成出来做真实实验。

结果如何?一句话总结:AI确实有两把刷子,在某些环节能帮大忙,但离“无所不能”还差得远,而且不同AI模型之间的差距,比你想的要大得多。

下面,我用大白话把这场“大考”的成绩单拆解成五个方面,带你看看AI抗体设计的真实水平。

---

1. 考试怎么考的?——不是“开卷”,而是“盲测”

首先,我们要搞清楚这场考试为什么重要。以前很多AI论文的效果很好,是因为它们用的是“回顾性数据”。打个比方,这就好比老师把答案告诉你了,让你去猜题,你当然猜得准。但真实的药物研发是“前瞻性”的:你手里只有原料(测序数据),不知道最终结果,你得靠本事去预测。

这次“AIntibody Challenge”效仿了著名的蛋白质结构预测竞赛(CASP),采用了盲法前瞻性设计。

  • 考题设定:选用了研究最透彻的SARS-CoV-2受体结合域(RBD)作为靶点。
  • 三个任务:

1. 修修补补(亲和力成熟):给你一堆已有的抗体数据,让你微调一下,让它结合得更紧。这对应工业界后期的优化环节。

2. 海选冠军(簇内排序):给你几千条序列,让你挑出里面最好、最能成药的那一条。这对应高通量筛选后的候选分子挑选。

3. 无中生有(库外设计):让你完全跳出已有数据库,设计全新的抗体序列。这是最难的“从头设计”。

  • 评分标准:不光看“抓得紧不紧”(亲和力),还要看“能不能成药”(可开发性)。比如,这个抗体会不会自己抱团(聚集)?会不会不稳定(热稳定性)?会不会乱抓其他东西(多特异性)?如果一项不合格,哪怕结合得再紧,也可能被直接淘汰。

核心逻辑:这次考试杜绝了“事后诸葛亮”,所有AI提交的序列,主办方统一合成,统一做实验。这才是检验AI真实能力的“金标准”。

---

2. 高光时刻:在“微调”环节,AI确实能省钱省时间

在三个任务中,AI表现最亮眼的是任务1:亲和力成熟。

这就好比你已经有一个不错的初稿(亲本抗体),AI的任务是帮你润色,让它更完美。

  • 成绩:Aureka公司的结构感知模型设计出的抗体,亲和力提升了约2000倍,达到了95 pM(皮摩尔级别,数值越小结合越强)。这个成绩和传统实验筛选出来的最优抗体(113 pM)几乎打平,甚至在统计学上看不出差别。
  • 意外发现:一个不用复杂深度学习、只用简单统计方法(ProBioGen)的团队,也拿到了第三名。这说明,只要有足够多的真实数据,简单的统计规律也能发挥巨大作用。
  • 工业价值:在这个环节,AI确实能帮上忙。传统实验筛选一轮可能需要2-3周,AI如果能提前筛选出几个高潜力候选,就能大幅压缩研发周期,降低试错成本。

通俗解读:如果让AI去“精修”一个已经不错的产品,它做得很好。这就像让AI帮你修改一篇已经写好的作文,它能挑出错别字、优化语句,效果立竿见影。

---

3. 尴尬时刻:在“海选”环节,AI还不如随机扔骰子

这是整篇文章最颠覆认知、也最让行业尴尬的部分。

在任务2:簇内预测中,AI的表现惨不忍睹。

  • 残酷现实:研究人员发现,如果你不靠AI,而是从几千条序列里随机挑一条,有39%的概率能挑出比“对照组”更好的抗体。
  • AI的失败:绝大多数AI模型的表现,低于这个随机基线。也就是说,AI挑出来的“优等生”,还不如闭着眼睛随便挑一个。
  • 唯一亮点:26支队伍里,只有华盛顿大学(WashU)一支队伍超过了随机基线。
  • 泛化能力差:同一个AI算法,在A组数据里是冠军,换到B组数据里就变成“吊车尾”。这说明AI并没有真正理解抗体的规律,只是记住了特定数据的特征。

通俗解读:这就像让AI去高考阅卷。如果题目是它以前做过的(微调),它很厉害;但如果题目是全新的、需要它从一堆答案里找出唯一正确的(海选),它反而不如一个随机乱猜的学生。这暴露了当前AI在亲和力预测上的巨大短板——它很难仅凭序列就精准判断结合强弱。

---

4. 陷阱时刻:在“创新”环节,AI造出了“漂亮但致命”的分子

在任务3:库外全新CDR设计中,AI展示了它的想象力,但也暴露了它的“药化陷阱”。

  • 最强选手:Xencor公司的蛋白语言模型设计出了一个结合力极强的抗体(2.9 pM),全场最强。
  • 致命缺陷:这个“冠军”抗体在疏水性色谱柱上无法洗脱。在药物开发中,这意味着它极易聚集,在生产过程中会出问题,属于严重致命缺陷。
  • 评分漏洞:因为挑战赛的加权计分规则允许其他指标抵消单项失败,它才拿了第一。但在真实的药物开发中,这种分子会被直接扔进垃圾桶。
  • 创新有限:很多所谓的“全新设计”,其实只是在已有序列基础上做了少量保守突变,真正意义上“无中生有”的创新很少。

通俗解读:AI就像一个很有才华但缺乏工程经验的艺术家。它能画出非常惊艳的画(高亲和力),但用的颜料有毒、画布容易烂(成药性差)。在艺术展览上它能拿奖,但要是让你把它挂在家里当装饰,它可能会把墙弄坏。这说明,高亲和力不等于好药,AI目前还不懂“生物物理风险”。

---

5. 行业启示:别迷信“万能模型”,AI是助手不是替代者

这场“大考”给整个生物医药行业敲响了警钟,也给出了务实的建议。

  • 没有“通杀”模型:
  • 做微调,结构感知模型+语言模型组合最好;
  • 做海选,传统机器学习甚至随机挑选都可能有奇效;
  • 做创新,蛋白语言模型相对较好,但必须严格验证。
  • 结论:不要指望一个AI模型解决所有问题。工业界应该采用“组合策略”,把AI当作“高效候选生成器”,而不是“最终决策者”。
  • 湿实验不可少:
  • 计算打分不能替代真实的实验检测。AI给出的高亲和力序列,往往伴随着聚集、多特异性等风险。
  • 金标准:真正的验证永远是盲法前瞻性 + 全部实验验证。
  • 下一代的改进方向:
  • 取消预先提供的亲和力标签,模拟更早期的发现过程;
  • 设置“成药性一票否决”,杜绝“高分低能”;
  • 拓展更多抗原靶点,检验AI的跨物种、跨靶点能力。

总结:

AI抗体设计不是“已经实现的革命”,而是站在转折点。

它已经拿到了入场券,在局部优化场景下能显著赋能药物研发,节约时间和成本。

但距离“输入抗原,直接输出临床级抗体”的终极理想,还隔着巨大的生物现实鸿沟。

对于投资者和从业者来说,去泡沫是当务之急。不要轻信那些“AI完全替代实验”的宣传,要看清AI在特定环节的真实价值。未来的赢家,将是那些懂得如何将AI与湿实验完美结合,而不是盲目崇拜算法的团队。