虎嗅

**기본 모델은 죽었다. (The Base Model Is Dead.)** 금융 뉴스 웹사이트에 적합한 자연스러운 한국어 헤드라인입니다. 한국 언론의 관용적 표현과 문법을 사용하였으며, 의미는 정확하게 전달되었습니다. 서브타이틀이나 설명은 포함되어 있지 않습니다.

原文:The Base Model Is Dead。

핵심 내용 요약

이 기사는 대형 모델 훈련 논리의 중대한 변화에 대해 다룹니다. 과거에는 기본 모델(Base Model)에 초점을 맞추어 가능한 한 많은 인간 지식을 흡수하도록 했지만, 이제 기본 모델의 역할이 바뀌었습니다. 더 이상 “지식의 저장소”가 아니라 “기초적인 스킬 도구 상자”로서 Python, 코드 구조와 같은 “원자적인 능력”을 제공하는 역할을 하며, 모델의 최종적인 복잡한 기능(소프트웨어 개발, 장기적인 작업 해결 등)은 강화 학습(RL)과 새로 등장한 중간 훈련(Mid-training)을 통해 이루어집니다. 또한, 사전 훈련 데이터도 “대량의 웹 페이지 혼합물”에서 “목표에 맞춘 정밀한 데이터”로 변화했으며, 훈련 단계의 경계도 점점 모호해지고 있습니다. 전체적으로는 “감독 학습을 통한 기초 다지기 + RL을 통한 응용 능력 향상”이라는 두 단계로 간소화되었습니다.

1. 기본 모델: “슈퍼 도서관”에서 “기초 도구 상자”로

과거의 기본 모델은 인터넷, 위키백과, 책 등을 모두 담은 슈퍼 도서관과 같았습니다. GPT-3 시대에는 사전 훈련 데이터의 85%가 웹 페이지와 위키에서 유래했으며, “사전 훈련이 잘 되면 모델도 더 강해진다”고 여겼습니다. 당시 후처리 훈련은 대화 스타일을 미세 조정하는 데에만 사용되었고, RL(강화 학습)의 역할은 매우 제한적이었습니다.

하지만 이제 기본 모델의 목표는 복잡한 작업을 직접 수행하는 것이 아니라 원자적인 능력(Python 문법, 코드 구조, Git 사용, API 호출 등)을 습득하는 것입니다. 마치 요리를 배우는 것과 같아서, 기본 모델은 채소를 자르고, 팬을 돌리며, 소스를 섞는 방법을 가르치고, 이후의 RL이 이러한 단계들을 조합하여 완성된 요리를 만드는 법을 배우게 합니다. 기본 모델은 “모든 것을 아는” 것에서 “기초적인 스킬을 다룰 수 있는” 것으로 변화했으며, 이제는 복잡한 기능을 위한 “출발점”이 되었습니다.

2. 사전 훈련 데이터: “혼합물”에서 “정밀한 데이터”로

과거에는 사전 훈련 데이터가 웹 페이지로 구성되어 있었으며, 그 비중이 85%를 차지했습니다. 하지만 이제 웹 페이지의 비중은 15%로 줄어들고 코드가 가장 큰 데이터 소스가 되었습니다. 왜냐하면 모델 회사들이 모델에 필요한 능력(프로그래밍, 추론, 장기적인 작업 등)을 명확히 알고 있어서 그에 맞는 데이터를 제공하기 때문입니다.

또한 합성 데이터의 중요성이 커졌습니다. 이제는 인터넷에서 실제 데이터를 수집하는 것이 아니라, 작업에 맞게 설계된 데이터를 사용합니다. 예를 들어, 일반적인 코드를 “버그 찾기 + 수정 + 도구 호출 + 연속적인 작업 수행”의 훈련 샘플로 변경하여 모델이 사전 훈련 단계에서부터 실제 작업 상황에 노출되도록 합니다. 이는 단순히 지식을 배우는 것이 아니라 “지식을 어떻게 사용하는지”를 배우는 것입니다. 마치 과거에 단어만 외우던 것과 달리, 이제는 “단어 + 예문 + 상황 대화”를 함께 배우는 것이 더 실용적입니다.

3. RL과 후처리 훈련: “미세 조정”에서 “능력 증폭기”로

과거에는 후처리 훈련이 모델의 대화 능력을 약간 개선하는 데만 사용되었습니다. 하지만 이제 RL은 능력 향상의 핵심이 되었습니다. RL이 잘 수행되면 사전 훈련된 모델도 크게 강화될 수 있습니다. 업계 전문가들에 따르면, 사전 훈련과 후처리 훈련에 필요한 컴퓨팅 자원의 비용이 거의 같아졌다고 합니다.

이는 모델의 최종적인 능력이 더 이상 사전 훈련만으로 결정되지 않으며, 후처리 훈련과 RL이 “상한선을 결정하는” 요소가 되었다는 것을 의미합니다. 마치 원시 주택(기본 모델)을 구입한 후에 인테리어를 하는 것처럼, 과거에는 적은 비용으로도 가능했지만, 이제는 인테리어 비용이 주택 구매 비용과 거의 같아졌으며, 인테리어의 질이 주택의 사용 편안함을 직접 결정합니다.

4. 중간 훈련: 사전 훈련과 후처리 훈련 사이의 “중간 단계”

과거에는 사전 훈련이 “정적인 지식”(웹 페이지, 책)을 기반으로 했고, 후처리 훈련은 “동적인 작업”(추론 단계, 에이전트 상호작용, 도구 호출)으로 갑자기 변화했습니다. 이로 인해 데이터 스타일의 차이가 커져 모델이 적응하기 어려웠습니다. 특히 MoE(다중 전문가 모델)의 경우, 각 전문가의 역할이 고정되어 있어 데이터 변경으로 인해 문제가 발생했습니다.

중간 훈련은 이러한 문제를 해결하기 위한 것입니다. 사전 훈련과 후처리 훈련 사이에 전환 단계를 추가하여 모델이 장기적인 상황, 추론 데이터, 작업 시나리오에 미리 적응할 수 있도록 합니다. 마치 초등학교를 졸업하고 바로 대학에 진학하면 적응하기 어려운 것처럼, 중간 훈련은 이러한 전환을 원활하게 도와줍니다.

5. 훈련 패러다임의 간소화: “두 단계로 대형 모델을 만들기”

이제 전체 훈련 과정은 두 가지 주요 단계로 간소화될 수 있습니다:

  • 첫 번째 단계: 감독 학습: 기본 모델에 지식과 기초적인 스킬(원자적인 능력)을 가르칩니다 (예: 단어 인식, Python 사용, 논리 이해).
  • 두 번째 단계: 강화 학습: 모델이 실제 환경에서 시행착오를 통해 기초적인 스킬을 조합하여 복잡한 문제를 해결하도록 합니다 (예: 소프트웨어 개발, 의사 결정).

과거의 여러 단계(사전 훈련, 중간 훈련, 후처리 훈련) 간의 경계가 점점 모호해지고 있으며, 핵심은 “먼저 기초를 다지고, 그 다음에 응용을 연습하는 것”입니다. 이는 더 명확한 논리적 절차입니다.

결론: 기본 모델은 사라진 것이 아니라, 단지 역할이 변했습니다

기사 제목인 “The Base Model Is Dead”는 과장된 표현이지만, 기본 모델의 위치는 실제로 “핵심”에서 “출발점”으로 바뀌었습니다. 기본적인 스킬이 없으면 후처리 훈련도 의미가 없습니다. 하지만 이제는 “RL을 사용하여 기초적인 스킬을 복잡한 능력으로 어떻게 변환할 것인가”에 더 많은 관심이 집중되고 있습니다. 이것은 대형 모델 산업이 “지식의 양을 추구하는” 것에서 “응용 능력을 추구하는” 것으로의 중요한 변화를 의미합니다.