虎嗅

한 에이전트 논문이 생산의 진실을 밝혔다: 능력은 결합될 수 있지만, 실행은 반드시 표준화되어야 한다

原文:一篇Agent 论文揭开了生产真相:能力可以耦合,执行必须标准化

안녕하세요! 저는 여러분의 금융 및 비즈니스 뉴스 분석 전문가입니다. 오늘은 위챗 공식 계정 ‘AIGC from 0 to 1’에서 발표된 기사를 살펴보겠습니다. 제목에는 “논문”, “에이전트(Agent)”, “가중치(weight)”와 같은 전문적인 용어들이 포함되어 있지만, 이 기사는 사실 매우 직관에 반하는 업계의 진실을 밝혀줍니다.

여러분이 쉽게 이해할 수 있도록 이 긴 기사를 “핵심 요약”과 “다섯 가지 측면의 이해하기 쉬운 설명”으로 나누어서 설명드리겠습니다.

---

📝 핵심 내용 요약: 이 뉴스를 한마디로 이해하기

핵심 메시지:

과거에는 AI 에이전트를 더 똑똑하게 만들기 위해서는 더 강력한 “뇌”(모델)를 사용하거나, 그 뇌에 더 좋은 “손과 발”(하네스(Harness), 즉 실행 프레임워크/힌트/도구 체인)을 제공하는 것이 필요하다고 생각했습니다. 하지만 최신 WHALE 논문에 따르면, 이 두 가지를 따로 개선하는 것이 아니라 교대로 최적화해야 가장 좋은 결과를 얻을 수 있습니다.

하지만 (중요한 점):

기술적으로는 함께 개선하는 것이 가장 효과적이지만, 실제 기업 환경에서는 이를 무제한으로 진행할 수 없습니다. 왜냐하면 “뇌”와 “손과 발”이 너무 잘 맞물리게 되면 (심층적으로 결합되면), 나중에 뇌나 손과 발을 바꾸려고 할 때 비용이 엄청나게 들기 때문입니다. 이를 “결합 세금(coupling tax)”이라고 합니다.

결론:

능력은 결합될 수 있지만, 실행은 표준화되어야 합니다. 기업은 AI를 끊임없이 변하는 실험실 제품이 아닌 완전한 “소프트웨어 제품”으로 취급하고 관리해야 합니다.

---

🔍 AI 에이전트의 생산 진실을 다섯 가지 측면에서 이해하기

1. 왜 “뇌만 훈련시키거나” “힌트만 수정하는 것은 효과가 없을까? (WHALE의 핵심 논리)

간단한 비유:

모델을 새로 졸업한 똑똑한 대학생이라고 상상해 보세요. 하네스는 그의 도구 상자와 작업 흐름입니다.

  • 과거의 방식:
  • 대학생(모델)만 훈련시키거나 (미세 조정), 도구 상자(하네스)가 얼마나 좋은지는 신경 쓰지 않았습니다. 결과: 대학생은 똑똑하지만 도구가 나쁘어서 제대로 활용할 수 없었습니다.
  • 도구 상자만 최적화하거나 (힌트 수정, 검색 기능 추가), 대학생의 능력은 신경 쓰지 않았습니다. 결과: 도구 상자는 완벽하지만 대학생의 능력이 부족했습니다.
  • WHALE의 새로운 발견:
  • 도구 상자를 고정하고 대학생만 훈련시키면, 대학생은 그 나쁜 도구를 어떻게 사용할지만 배우게 됩니다.
  • 대학생을 고정하고 도구 상자만 수정하면, 도구 상자는 그 대학생의 단점에 맞게 특별히 설계됩니다. 더 똑똑한 새로운 대학생으로 바꾸려고 하면, 원래의 도구 상자가 오히려 제약이 됩니다.
  • 올바른 방법:
  • 교대로 최적화: 먼저 뇌를 훈련시킨 다음 새로운 뇌의 특성에 맞게 도구 상자를 조정하고, 다시 뇌를 훈련시킨 다음 도구 상자를 조정하는 식으로 반복합니다. 이런 방식으로 정확도가 4~24% 향상됩니다.

💡 기자의 코멘트:

이는 집을 리모델링하는 것과 같습니다. 최고의 소파(모델)만 구입하고 콘센트 위치(하네스)는 신경 쓰지 않거나, 콘센트만 수정하고 소파의 편안함은 신경 쓰지 않으면 안 됩니다. 두 가지는 서로 조화를 이루어야 하지만, 그 과정은 동적이어야 합니다.

2. 실험실에서의 “높은 점수”가 실제 생산 환경에서는 “재앙”이 될 수 있는 이유는 무엇일까? (목표 함수의 차이)

간단한 비유:

  • 논문의 목표: 시험 점수만 높으면 됩니다. 5점을 더 얻으면 승리입니다.
  • 기업의 목표: 수익을 올리고, 비용을 절약하며, 문제가 발생하지 않도록 하는 것입니다.

구체적인 차이:

논문에서는 5점을 더 얻기 위해 코드를 몇 번 더 실행하면 됩니다. 하지만 기업 환경에서는 이 5점이 다음과 같은 결과를 가져올 수 있습니다:

  • 비용 증가: 더 많은 서버와 더 긴 훈련 시간이 필요합니다.
  • 위험 증가: 새로운 조합으로 이전에는 없었던 버그가 발생할 수 있으며, 이를 수동으로 수정해야 합니다.
  • 유지보수의 악몽: 5점을 얻기 위해 코드에 10개의 패치를 추가합니다. 6개월 후에는 그 패치를 삭제할 수 없게 됩니다. 왜냐하면 삭제하면 시스템이 망가질 수 있기 때문입니다.

💡 기자의 코멘트:

학계는 “최고의 성능”을 추구하지만, 산업계는 “안정적인 효용성”을 추구합니다.

이것이 바로 많은 AI 모델이 순위에서 높은 점수를 얻지만 실제 기업에서는 제대로 작동하지 않는 이유입니다. 기업은 총 비용(이익 - 훈련 비용 - 유지보수 비용 - 위험 비용)을 고려하기 때문입니다. 5%의 성능 향상을 위해 유지보수 비용이 두 배로 증가한다면, 그 거래는 비효율적입니다.

3. “결합 세금(coupling tax)”이란 무엇이며, 왜 모델 자체보다 더 비쌀까?

간단한 비유:

“결합(coupling)”은 두 부품이 너무 단단히 맞물려서 분리할 수 없는 것입니다.

“결합 세금”은 그 중 하나를 분리하려고 할 때 지불해야 하는 높은 비용입니다.

상황 예시:

AI 시스템이 모델 A와 프레임워크 B로 구성되어 있고, 둘이 잘 작동한다고 가정해 보세요.

  • 모델 A는 프레임워크 B의 특정 형식에 익숙해져 있습니다.
  • 프레임워크 B의 오류 처리 논리는 모델 A의 특성에 맞게 설계되었습니다.
  • 이제 문제가 생겼습니다: 더 저렴하거나 더 강력한 모델 C로 업그레이드하려고 합니다.
  • 프레임워크 B의 많은 논리가 모델 C에서는 작동하지 않습니다.
  • 프레임워크 B를 다시 작성하거나 모든 도구 인터페이스를 재조정해야 합니다.
  • 이 과정은 매우 어렵고 오류가 발생하기 쉽습니다.

더 심각한 것은 “기술 부채(technical debt)”입니다:

시간이 지남에 따라 여러 작은 문제를 수정하기 위해 시스템에 많은 패치가 쌓입니다:

  • 모델의 출력이 불안정하다면 해석기를 추가합니다.
  • 해석이 실패하면 재시도 메커니즘을 추가합니다.
  • 재시도가 무한 반복된다면 종료 규칙을 추가합니다.

결국 어떤 코드가 실제로 유용한지 아무도 모르고, 아무도 그 코드를 삭제할 수 없습니다. 이것이 바로 “성능 이점”이 “기술 부채”로 변하는 것입니다.

💡 기자의 코멘트:

MLOps(머신 학습 운영)는 모듈화와 교체 가능성을 강조합니다. 이는 “결합 세금”을 줄이기 위함입니다. 모델을 바꿀 때마다 전체 시스템을 다시 작성해야 한다면, 그 시스템은 취약해집니다.

4. 미래의 AI 시스템은 어떤 모습일까? “하네스(Harness)”는 어떻게 변할까?

기사는 흥미로운 예측을 제시합니다: 하네스는 사라지지 않을 것이지만, 분리될 것입니다.

첫 번째 유형: 인지형 하네스(cognitive Harness): 모델의 단점을 보완하기 위해 작성된 패치들입니다. 예: “모델이 작업을 완료하지 않았다면 계속하라고 알려주거나, 모델이 잘못된 말을 했다면 다시 읽게 하라”는 기능들입니다.

  • 추세: 모델이 점점 더 똑똑해지면서 (예: GPT-5, Claude 4), 이러한 “보조 도구들”은 더 이상 필요 없어질 것입니다. 오히려 부담이 될 수도 있습니다. 왜냐하면 새 모델은 스스로 어떻게 해야 할지 알기 때문입니다.
  • 예: 이전에는 모델이 문맥을 잊는 경우가 많았기 때문에 엔지니어가 “문맥 재설정” 기능을 추가했습니다. 하지만 이제는 모델이 강력해져서 이 기능이 오히려 방해가 될 수 있습니다.

두 번째 유형: 시스템형 하네스(systemic Harness): 모델의 똑똑함과는 관계없이 보안, 권한, 상태 관리와 같은 기능들입니다.

  • 이 AI는 데이터베이스를 삭제할 권한이 있을까요?
  • 방금 어떤 코드를 수정했나요?
  • 멈추었다면 어떻게 복구할까요?
  • 누가 이 작업을 승인했나요?
  • 추세: 모델이 더 강력해질수록 할 수 있는 일이 많아지지만 (예: 생산 환경 직접 조작, 결제 인터페이스), 위험도 커집니다. 따라서 이러한 “보안 장치”와 “상태 관리자”는 더 견고하고 표준화되어야 합니다.

💡 기자의 코멘트:

과거에는 AI가 “올바르게 작동하는지”에만 관심을 가졌지만, 미래에는 AI가 “신뢰할 수 있게 작동하는지”에도 관심을 가져야 합니다.

지능은 변할 수 있지만, 권한과 상태는 변해서는 안 됩니다. 이것이 바로 Anthropic과 같은 회사들이 “대화”, “실행 환경”, “모델”을 분리하여 관리하는 이유입니다.

5. 기업에게 실질적인 조언: “무한한 진화”를 추구하지 말고 “버전 출시”를 추구하라

핵심 전략: WHALE-lite (경량화된 결합 최적화)

AI 시스템을 생물처럼 “영원히 진화시키려고” 하지 마세요. 기업은 “동결-검증-출시” 프로세스를 채택해야 합니다:

1. 개발 단계 (결합 허용):

  • 모델과 프레임워크를 함께 조정하여 최적의 조합을 찾습니다.
  • 이 단계에서는 힌트를 자유롭게 수정하고, 도구를 바꾸며, 모델을 미세 조정할 수 있습니다.

2. 동결 단계 (패키징):

  • 결과가 만족스러우면 이 조합을 버전(v1.0)으로 동결합니다.
  • 이 버전에는 모델 가중치, 프레임워크 코드, 힌트, 도구 인터페이스, 권한 정책, 샌드박스 환경이 포함됩니다.

3. 출시 단계 (표준화):

  • 이 “에이전트 릴리스(Agent Release)”를 생산 환경에 배포합니다.
  • 중요한 점: 온라인에 배포되는 것은 단순한 모