虎嗅

AI를 활용한 항체 설계 경진대회: 기존 실험 방식을 뛰어넘었지만, 아직 완벽하지는 않다

原文:AI设计抗体挑战赛:超越传统实验,但远未封神

AI 항체 설계의 “대규모 시험” 결과 공개: 환상이 사라진 후, 과연 AI는 실제로 유용할까?

안녕하세요, 여러분의 금융 전문 기자이자 경제학자입니다. 오늘 우리가 이야기할 주제는 주가의 상승과 하락이 아니라, 생명공학 분야에서 최근 가장 화제가 되면서도 과장되기 쉬운 주제인 “AI가 직접 질병을 치료하는 항체를 만들 수 있을까?”입니다.

지난 2년 동안 AI 제약에 대해 이야기할 때마다 사람들은 “혁신”, “혁명”, “하룻밤에 유명해짐”과 같은 표현을 들었습니다. 특히 AlphaFold(단백질 구조 예측 도구)가 등장한 이후로 이 분야는 뜨거워졌습니다. 많은 회사들이 AI에게 항원(예: 바이러스)을 제공하면, AI가 컴퓨터에서 고친화력의 항체를 직접 설계해줄 수 있다고 주장했으며, 이는 전통적인 실험실에서의 시간과 노력이 많이 드는 선별 과정을 생략할 수 있다는 것을 의미했습니다.

하지만 최근 《Nature Biotechnology》(생명공학 분야의 최고 권위 있는 학술지)에는 “AIntibody Challenge”(항체 AI 챌린지)라는 이름의 실제 시뮬레이션 시험 결과가 발표되었습니다. 이 시험에는 필터도, 부정행위도 없었으며, 29개의 최고 수준 기관이 참여하여 511개의 AI가 설계한 항체 서열을 모두 합성하여 실제 실험을 진행했습니다.

그 결과는 어땠을까요? 한마디로 요약하자면, AI는 분명히 일부 분야에서는 유용하지만 “모든 것을 할 수 있는” 수준에는 아직 이르지 못했으며, 다양한 AI 모델 간의 차이도 예상보다 훨씬 큽니다.

이제 이 “대규모 시험”的 결과를 다섯 가지 측면으로 자세히 살펴보겠습니다.

---

1. 시험은 어떻게 진행되었나요? – “개방형”이 아니라 “맹목적 평가”

먼저, 이 시험이 왜 중요한지 이해해야 합니다. 이전의 많은 AI 관련 논문들이 좋은 결과를 보인 이유는 “회고적 데이터”를 사용했기 때문입니다. 예를 들어, 선생님이 정답을 알려주고 그에 맞춰 문제를 추측하게 하는 것과 같습니다. 하지만 실제 약물 개발은 “전향적”인 과정입니다. 즉, 우리에게는 원료(서열 데이터)만 있을 뿐 최종 결과는 알 수 없으며, 실제로 예측해야 합니다.

이번 “AIntibody Challenge”는 유명한 단백질 구조 예측 경진대회(CASP)를 모방하여 맹목적 전향적 설계 방식을 사용했습니다.

  • 시험 문제 설정: 가장 잘 연구된 SARS-CoV-2 수용체 결합 도메인(RBD)을 타겟으로 했습니다.
  • 세 가지 과제:

1. 친화력 향상: 기존의 항체 데이터를 바탕으로 미세 조정하여 더욱 단단하게 결합하도록 합니다. 이는 산업계의 후기 최적화 단계에 해당합니다.

2. 우수 항체 선별: 수천 개의 서열 중에서 약물로 개발할 수 있는 최고의 항체를 선별합니다. 이는 고처리량 선별 후의 후보 분자 선정 과정에 해당합니다.

3. 새로운 항체 설계: 기존 데이터베이스를 전혀 사용하지 않고 완전히 새로운 항체 서열을 설계합니다. 이는 가장 어려운 “최초 설계” 과정입니다.

  • 평가 기준: 단지 “결합력”만이 아니라 “약물로 개발 가능성”도 고려됩니다. 예를 들어, 해당 항체가 스스로 뭉치거나 불안정하거나 다른 물질에 결합하는지 등입니다. 한 가지 기준도 충족하지 못하면, 결합력이 아무리 높아도 바로 탈락합니다.

핵심 논리: 이 시험은 “사후에 판단하는” 것을 방지했으며, 모든 AI가 제출한 서열은 주최측이 일괄적으로 합성하고 실험을 진행했습니다. 이것이 AI의 실제 능력을 검증하는 “진정한 기준”입니다.

---

2. 눈에 띄는 성과: “미세 조정” 과제에서 AI는 실제로 비용과 시간을 절약할 수 있음

세 가지 과제 중에서 AI가 가장 두드러진 성과를 보인 것은 1번 과제: 친화력 향상이었습니다.

이는 이미 어느 정도 완성된 초안(기존 항체)을 AI가 다듬어 더욱 완벽하게 만드는 과정입니다.

  • 성과: Aureka사의 구조 인식 모델이 설계한 항체는 친화력이 약 2000배 향상되어 95 pM(피모) 수준에 도달했습니다. 이는 전통적인 실험을 통해 선별된 최고의 항체(113 pM)와 거의 차이가 없었으며, 통계적으로도 구별할 수 없었습니다.
  • 놀라운 발견: 복잡한 딥러닝을 사용하지 않고 단순한 통계 방법(ProBioGen)만을 사용한 팀도 3위를 차지했습니다. 이는 충분한 실제 데이터가 있으면 간단한 통계적 규칙도 큰 역할을 할 수 있음을 보여줍니다.
  • 산업적 가치: 이 과정에서 AI는 실제로 도움이 될 수 있습니다. 전통적인 실험으로 한 번의 선별에 2-3주가 걸릴 수 있지만, AI가 미리 몇 개의 유망한 후보를 선별하면 개발 주기를 크게 단축하고 실패 비용을 줄일 수 있습니다.

쉬운 설명: 이미 어느 정도 완성된 제품을 AI에게 “정교하게 다듬게” 하면, AI는 매우 잘 해냅니다. 이는 마치 AI에게 이미 쓰인 글을 수정하게 하는 것과 같아서, 오류를 찾아내고 문장을 최적화할 수 있습니다.

---

3. 당황스러운 결과: “선별” 과제에서 AI는 무작위로 선택하는 것만 못함

이것은 전체 기사에서 가장 충격적이고 업계에 당혹스러운 부분입니다.

2번 과제: 우수 항체 선별에서 AI의 성능은 매우 낮았습니다.

  • 현실: 연구자들은 AI를 사용하지 않고 수천 개의 서열 중에서 무작위로 하나를 선택하면 39%의 확률로 “대조군”보다 더 좋은 항체를 찾을 수 있다는 것을 발견했습니다.
  • AI의 실패: 대부분의 AI 모델의 성능은 이 무작위 기준보다 낮았습니다. 즉, AI가 선별한 “우수한 항체”도 무작위로 선택한 것만큼이나 좋지 않았습니다.
  • 유일한 밝은 점: 26개 팀 중에서 워싱턴대학(WashU)만이 무작위 기준을 넘었습니다.
  • 일반화 능력 부족: 같은 AI 알고리즘이 A그룹 데이터에서는 우승했지만, B그룹 데이터에서는 최하위였습니다. 이는 AI가 항체의 규칙을 진정으로 이해하지 못하고 단지 특정 데이터의 특성만 기억했음을 의미합니다.

쉬운 설명: 이는 마치 AI에게 대학 입시 시험 채점을 맡기는 것과 같습니다. 만약 문제가 이전에 해본 적이 있는(미세 조정) 경우에는 잘하지만, 완전히 새로운 문제(선별)에서는 무작위로 선택한 학생만큼도 못합니다. 이는 현재 AI가 친화력 예측에서 큰 한계를 가지고 있음을 보여줍니다. 즉, 서열만으로는 결합력을 정확하게 판단하기 어렵습니다.

---

4. 문제점: “혁신” 과제에서 AI는 “아름답지만 위험한” 분자를 만들어냄

3번 과제: 새로운 항체 설계에서 AI는 상상력을 보여주었지만, “약리학적 문제”도 드러냈습니다.

  • 가장 강력한 모델: Xencor사의 단백질 언어 모델이 매우 강력한 결합력(2.9 pM)의 항체를 설계했습니다.
  • 치명적인 결함: 이 “우승자” 항체는 소수성 크로마토그래피 컬럼에서 세척이 불가능했습니다. 약물 개발에서 이는 쉽게 뭉치게 되어 생산 과정에서 문제가 발생할 수 있으며, 이는 심각한 결함입니다.
  • 평가의 한계: 챌린지의 가중 점수 방식 때문에 다른 지표가 단일 실패를 상쇄할 수 있어 1위를 차지했지만, 실제 약물 개발에서는 이러한 분자는 바로 폐기됩니다.
  • 혁신의 한계: 많은 “새로운 설계”는 기존 서열을 기반으로 한 소수의 보수적 변이에 불과하며, 진정한 의미에서의 “최초 설계”는 거의 없습니다.

쉬운 설명: AI는 재능은 있지만 공학적 경험이 부족한 예술가와 같습니다. 매우 놀라운 그림(높은 친화력)을 그릴 수 있지만, 사용한 색소가 유해하거나 캔버스가 쉽게 손상될 수 있습니다. 예술 전시회에서는 상을 받을 수 있지만, 집에 걸어서 장식으로 사용하면 벽을 망가뜨릴 수 있습니다. 이는 높은 친화력이 반드시 좋은 약물을 의미하는 것은 아니며, AI는 아직 “생물물리학적 위험”을 이해하지 못합니다.

---

5. 업계에 주는 교훈: “만능 모델”에 대한 맹신을 버리세요, AI는 도구일 뿐 대체자가 아닙니다

이 “대규모 시험”은 생명공학 업계에 경고를 주었으며 실용적인 조언도 제공했습니다.

  • 만능 모델은 없습니다:
  • 미세 조정에는 구조 인식 모델과 언어 모델의 조합이 가장 좋습니다.
  • 선별에는 전통적인 머신러닝이나 무작위 선택도 효과적일 수 있습니다.
  • 혁신에는 단백질 언어 모델이 상대적으로 좋지만, 엄격한 검증이 필요합니다.
  • 결론: 하나의 AI 모델로 모든 문제를 해결할 것으로 기대하지 마세요. 산업계는 “조합 전략”을 사용해야 하며, AI를 “효율적인 후보 생성자”로 활용해야지 “최종 결정자”로 여기면 안 됩니다.
  • 실제 실험의 필요성: 계산 기반의 평가는 실제 실험 결과를 대체할 수 없습니다. AI가 제공하는 높은 친화력의 항체 서열은 종종 뭉치거나 다른 문제를 동반합니다.
  • 진정한 기준: 실제 검증은 맹목적 전향적 설계 + 모든 실험을 통한 검증입니다.
  • 차세대 개선 방향: 사전에 제공된 친화력 정보를 없애고, 더 이른 발견 과정을 모방해야 합니다.
  • “약물로 개발 가능성”을 필수적인 평가 기준으로 삼아 “높은 점수로 인한 오류”를 방지해야 합니다.
  • 더 많은 항원 타겟을 대상으로 AI의 종간, 타겟 간 능력을 검증해야 합니다.

결론:

AI 항체 설계는 “이미 완성된 혁신”이 아니라 전환점에 있습니다. AI는 이미 약물 개발에 상당한 도움을 주며 시간과 비용을 절약할 수 있습니다. 하지만 “항원을 입력하면 바로 임상 수준의 항체를 출력하는” 최종 목표까지는 아직 갈 길이 멉습니다.

투자자와 업계 종사자들에게는 과장된 기대를 버리는 것이 시급합니다. “AI가 실험을 완전