虎嗅

535B 대형 모델, 3개월간 “생방송” 훈련: 코드, 데이터, 손실률(Loss) 전부 공개; 앤드류 유(Andrew Ng)가 공개적으로 지지 발표

原文:535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

핵심 내용 요약

Marin은 스탠퍼드 대학교가 주도하는 오픈 베이스 모델 프로젝트로, 현재 총 5,350억 개의 파라미터를 가진 하이브리드 전문가(MoE) 모델을 훈련 중입니다. 이 프로젝트의 가장 큰 특징은 파라미터의 규모가 아니라 훈련 과정의 전면적인 투명성에 있습니다. 실험 가설, 코드 설정, 훈련 곡선, 실패 기록 등 모든 내용이 실시간으로 인터넷에 공개되며, 훈련 중에 실패하더라도 이를 숨기지 않습니다. 이 프로젝트는 AI 업계가 직면한 핵심 문제를 해결하고자 합니다: 컴퓨팅 파워가 점점 집중되고 훈련 방식이 점점 폐쇄적으로 변하는 상황에서, 오픈 소스 소프트웨어처럼 모든 사람이 기초 모델의 연구와 개발에 참여할 수 있을지를 모색합니다. 앤드류 응(Andrew Ng)은 Marin을 “AI의 개방성을 지키는 소중한 사례”라고 평가하지만, 최종 결과는 아직 확인되지 않았습니다.

1. 왜 Marin이 이렇게 주목받을까? 파라미터의 크기가 아니라 “투명한 훈련 과정” 때문

많은 사람들이 Marin이 주목받는 이유를 5,350억 개의 파라미터 때문이라고 생각하지만, 실제로는 그 프로젝트의 개방성에 있습니다. 이전의 오픈 소스 모델들(예: Llama, Gemma)은 최종 모델의 가중치만 공개했을 뿐, 훈련에 사용된 데이터, 코드, 의사결정 과정은 비공개였습니다. BLOOM이나 OLMo와 같이 더 개방적인 프로젝트라도 훈련이 완료된 후에야 자료가 공개되었습니다.

Marin은 다릅니다. 연구실의 일상적인 과정을 실시간으로 공개합니다:

  • 실험 전에 GitHub에 “어떤 가설을 검증할 것인지”, “어떤 방법을 사용할 것인지”를 명확히 기재합니다;
  • 훈련 중에는 훈련 곡선(모델의 학습 성능)과 하드웨어의 상태를 실시간으로 공개합니다;
  • 훈련이 실패하거나 중간에 방법을 변경하더라도 그 과정을 기록합니다.

이는 마치 요리사가 요리하는 과정을 생중계하는 것과 같습니다. AI 업계에서는 대형 모델의 훈련 방식과 과정이 기업의 핵심 비밀인 경우가 많기 때문에 매우 혁신적인 접근입니다.

2. 535억 개의 파라미터를 가진 MoE 모델: 크기는 크지만 실제로 사용되는 파라미터는 적음

Marin의 5,350억 개 파라미터는 총 파라미터이지만, 실제로 각 Token에 사용되는 파라미터는 약 230억 개에 불과합니다. 이것이 MoE(Mixed Expert) 모델의 특징입니다:

  • 모델 내에는 다양한 “전문가”들(수학을 담당하는 전문가, 코드를 작성하는 전문가, 대화를 담당하는 전문가 등)이 존재합니다;
  • 새로운 Token이 들어오면 “루팅 모듈”이 어떤 전문가가 처리할지 결정합니다(예: 수학 문제는 수학 전문가에게 전달됨);
  • 선택된 전문가만 작업을 수행하고, 나머지 전문가들은 휴식을 취합니다.

이러한 방식의 장점은 모델의 전체 용량이 크기 때문에 더 많은 정보를 학습할 수 있지만, 개별 Token의 계산 비용이 급격히 증가하지 않는다는 것입니다. 하지만 230억 개의 활성화된 파라미터가 230억 개의 일반 모델과 동일한 성능을 의미하는 것은 아닙니다. 공유 전문가나 루팅 모듈과 같은 요소들이 있기 때문입니다.

3. 이렇게 큰 MoE 모델을 훈련하는 데 기술적으로 어떤 어려움이 있었을까?

MoE 모델의 어려움은 파라미터의 수가 많은 것이 아니라 통신과 부하 분배에 있습니다:

  • 통신 문제: 다른 GPU에 있는 전문가들 간에 Token이 데이터를 주고받아야 하며, 이 과정이 느리면 훈련 속도가 느려집니다;
  • 인기 있는 전문가: 일상 대화를 처리하는 전문가들은 많은 Token을 받아서 GPU의 처리 능력을 초과하면 그 Token들이 버려지게 되어 훈련 결과에 영향을 미칩니다;
  • 수치 불안정성: 훈련 중에 모델의 학습 방향을 결정하는 그래디언트가 갑자기 변할 수 있습니다.

Marin 팀은 어떻게 이러한 문제들을 해결했을까요?

  • 소규모 모델로의 테스트: 먼저 1억 6천만에서 27억 7천만 개의 파라미터로 작은 모델을 훈련하며 문제를 발견하고, 이를 통해 대형 모델의 문제를 예측합니다;
  • 상황 길이 조정: 65,000개의 긴 상황 정보를 4,000개로 줄여 Token의 분포를 더 균일하게 만들어 인기 있는 전문가의 부담을 줄입니다;
  • logit z-loss 추가: 모델의 출력 변동을 제한하여 수치 불안정성을 방지합니다.

4. 이 프로젝트가 AI 업계에 어떤 의미가 있을까?

Marin의 가치는 가장 강력한 모델을 만드는 것이 아니라 폐쇄성을 깨고 더 많은 사람들이 대형 모델 연구에 참여할 수 있도록 하는 것에 있습니다:

  • 소규모 팀도 Marin의 훈련 과정을 통해 MoE의 통신 문제를 해결하는 방법이나 전문가의 부하를 조정하는 방법을 배울 수 있습니다;
  • 실패 기록의 공개가 성공보다 더 가치가 있습니다. 이전에는 성공한 모델만 공개되었지만, 실패 과정은 알 수 없었습니다;
  • AI 연구를 다시 “오픈 소스 협업”의 상태로 되돌리는 데 기여합니다. 마치 GitHub에서 모두가 함께 코드를 작성하는 것처럼, 이제는 모두가 대형 모델의 훈련 과정을 함께 관찰할 수 있습니다.

앤드류 응은 “연구 결과의 공개가 업계의 일반적인 상황이었다”고 말했으며, Marin은 이러한 상황을 다시 되돌리고자 합니다.

5. Marin이 이미 가장 강력한 모델인가? 아직은 이르다

파라미터의 규모와 계산량은 크지만, 아직 결론을 내리기에는 이릅니다:

  • 전문가의 역할 분담: 전문가들의 역할이 명확하지 않으면(예: 수학 전문가가 대화도 처리하는 경우), 많은 파라미터가 있어도 소용이 없습니다;
  • 훈련이 아직 완료되지 않았습니다: 현재는 예비 훈련만 시작되었으며, 중간 훈련과 최종 훈련을 거쳐야 실제 성능을 확인할 수 있습니다;
  • 공개 ≠ 성공: 훈련 중에 하드웨어 고장이나 데이터 문제로 인해 중간에 조정이 필요할 수 있으며, 심지어 실패할 수도 있습니다. 하지만 실패하더라도 공개된 기록은 귀중한 경험이 됩니다.

따라서 Marin의 가장 큰 가치는 훈련 과정에서 남긴 “훈련 일지”에 있으며, 3개월 후의 모델 가중치가 아닙니다.

마지막 말

Marin의 목표는 “가장 강력한 모델”을 만드는 것이 아니라 “가장 투명한 연구실”을 만드는 것입니다. 이 프로젝트는 AI 연구가 “소수 기업의 비밀”에서 “모든 사람이 참여할 수 있는 개방적인 과학”으로 변하는 것을 목표로 합니다. 최종 모델이 성공하든 실패하든, 이러한 시도 자체가 매우 의미가 있습니다.