핵심 내용 요약
8월 6일, AI 업계에서 두 가지 중대한 사건이 발생했습니다. 구글 DeepMind의 창립자가 자신이 개발한 모델(Gemini)의 성능 부진으로 CEO직을 사임했으며,的字节(字節)의 장일명(張一鳴)은 “대형 AI 모델의 정제 과정(디스틸링)”을 절대 하지 않겠다는 결정을 내렸습니다. 이 결정은 업계 내에서 분열을 야기했습니다. 어떤 이들은 이를 “명예를 위한 행동”이라고 비판하는 반면, 다른 이들은 “본질을 회복하는 조치”라고 칭찬합니다. 이 기사는 “디스틸링”的 본질, 字节의 결정 배경, 업계 내 논란, 그리고 중국 AI 기업들이 선택한 다양한 발전 경로에 대해 분석하며, 字节가 “비용이 많이 들고 험난한” 길을 선택했지만 바로 이러한 다양성이 중국 AI 생태계에 필요하다고 지적합니다.
상세 분석
1. “디스틸링”이란 무엇인가? 왜 모두가 이를 사용하는가?
“디스틸링”은 화학 실험이 아니라 AI 모델 훈련에 사용되는 방법으로, 크게 두 가지 유형이 있습니다:
- 자체 모델을 이용한 디스틸링: 자신의 대형 모델(GPT-4)을 이용해 소형 모델(GPT-3.5)을 훈련시키는 것으로, 업계에서 일반적인 방법이며 논란의 여지가 없습니다.
- 타사 모델을 이용한 디스틸링: 다른 회사의 모델(예: ChatGPT)의 출력 결과를 자신의 모델 훈련에 활용하는 것으로, 논란의 중심입니다.
예를 들어, 타사 모델을 이용한 디스틸링은 학생이 성적이 좋은 학생의 숙제를 베끼는 것과 같습니다. 즉시 모델의 순위를 높일 수 있지만, 실제 문제 해결 능력(추론 능력)을 습득하지 못할 수 있습니다. 왜 많은 사람들이 이 방법을 사용하는가? 그 이유는 효과가 빠르고 계산 자원을 절약할 수 있기 때문입니다. 예를 들어, DeepSeek는 80만 개의 R1 모델 데이터를 활용하여 소형 모델의 성능(AIME24 기준)을 OpenAI의 o1-preview보다 높이 올렸으며, 이때 계산 비용은 매우 낮았습니다.
하지만 이제 문제가 생겼습니다. 미국은 “타사 모델을 이용한 디스틸링”을 제재의 근거로 삼고 있으며, Anthropic은 중국 기업들이 가짜 계정을 사용해 데이터를 수집한다고 주장하고 있습니다. 심지어 IP와 접속 패턴을 통해 디스틸링 행위를 감지할 수 있다고 합니다.
2. 장일명의 “절대 디스틸링하지 않겠다”는 결정: 처벌을 두려워하는 것인가, 아니면 자신만의 원칙인가?
많은 사람들이 字节가 TikTok이 미국의 제재를 받을까 봐 이런 결정을 내렸다고 추측하지만, 기사는 반론을 제시합니다. 심지어 국내 오픈소스 모델(Kimi K3)조차도 디스틸링이 허용되지 않습니다. 이러한 모델들은 라이선스가 자유롭고 위험이 없으며, TikTok에 아무런 영향을 미치지 않습니다. 그렇다면 진짜 이유는 무엇일까요?
- 기술적 청결성: 字节는 지난해 “합성 데이터”가 포함되지 않은 모델을 오픈소스로 공개했으며, 이러한 데이터가 기존 모델의 성능에 영향을 미칠까 봐 우려하고 있습니다. 마치 실험을 할 때 깨끗한 시험관이 필요한 것처럼, 정확한 결과를 얻기 위해서입니다.
- TikTok의 전략: TikTok은 글로벌 최대의 해외 사업을 보유하고 있으며, 어떤 문제도 일으키지 않으려는 의도가 있습니다 (예전에 Project Seed가 OpenAI의 제재를 받은 적이 있습니다).
- 장일명의 개인적 판단: 장일명은 CEO직에서 물러난 후 AI 분야에 집중하고 있으며, Seed 팀의 평가에 참여하고 밤새워서 논문을 읽으며 싱가포르 교수에게 지도를 받았습니다. 이는 그가 새로운 기술을 습득하기 위한 결정이었습니다. 단기적으로는 뒤처질 수 있지만, 진정한 실력을 갖추고자 하는 것입니다.
3. 디스틸링은 “지름길”인가, “죽음의 길”인가? 업계 내 논란이 치열합니다
양측 모두 자신의 주장을 가지고 있습니다:
- 찬성론: 디스틸링은 효과적이며 자원을 절약할 수 있습니다. 청화대학의 연구에 따르면, 디스틸링된 모델의 성능이 기존 모델보다 뛰어납니다. Anthropic도 “디스틸링은 합법적인 훈련 방법”이라고 인정합니다.
- 반대론: 디스틸링은 모델의 성능을 제한할 수 있습니다. 옥스퍼드 대학의 연구에 따르면, 모델이 반복적으로 자신이나 타사의 데이터를 학습하면 “정보 손실”이 발생할 수 있으며, 이를 “모델 붕괴”라고 합니다.
- 중립적인 관점: AI 연구자 Lambert는 디스틸링은 단순한 모방에 불과하며, 강화 학습은 진정한 탐색 과정이라고 말합니다. 진정한 실력은 탐색을 통해 얻어지며, 이러한 능력은 타사의 API에서는 얻을 수 없습니다. 하지만 합성 데이터(다양한 교사, 혼합된 실제 데이터)를 잘 활용하면 문제가 발생하지 않을 수도 있습니다.
4. 중국 AI 기업들: 디스틸링에만 의존하지 않고, 진정한 실력을 갖추고 있습니다
기사는 세 가지 예를 들어 중국 AI 기업들이 디스틸링에만 의존하지 않고도 성공적인 결과를 내고 있다는 것을 보여줍니다:
- 智谱GLM-5.3: 디스틸링이나 추가적인 파라미터 설정 없이 강화 학습과 장문의 상황 정보를 활용해 성능을 향상시켰으며, 개발자들은 “기존 모델의 잠재력이 아직 충분히 발휘되지 않았다”고 말합니다.
- DeepSeek: 자체적인 대결을 통해 추론 능력을 향상시켰으며, OpenAI의 수석 연구원도 DeepSeek가 o1의 핵심 개념을 독립적으로 발견했다고 인정합니다.
- 阿里千问: 디스틸링 혐의를 받았지만, 오픈소스 모델로서 많은 기업들이 이를 기반으로 사용하고 있으며, 이는 그들의 기술력이 뛰어남을 의미합니다.
결론: 디스틸링에 대한 논란은 중국 AI에 대한 부정적인 인식에서 비롯된 것입니다. 디스틸링은 최대한 성장 속도에 영향을 미칠 뿐, 모델의 한계를 정하는 요소는 아닙니다.
5. 字节의 선택: 가장 험난한 길을 걷는 것이 역사를 바꾸는 계기가 될까?
字节는 현재 5조에서 10조 개의 파라미터를 가진 모델을 훈련하는 방안을 논의 중입니다. 이 길은 얼마나 힘든가요?
- 단기적인 비용: 량루보(梁汝波)는 해외 선두 모델과의 격차가 커지고 있다고 인정했습니다.
- 장기적인 가치: 만약 성공한다면, 字节는 글로벌 AI 분야에서 중요한 플레이어가 될 수 있으며, 중국 AI의 발전 역사를 바꿀 수도 있습니다. 실패한다면, 업계에 큰 교훈이 될 것입니다.
하지만 기사는 이러한 다양성이 긍정적인 변화를 가져올 것이라고 강조합니다. 중국 AI는 각기 다른 장점을 가진 기업들이 다양한 경로를 선택해야 하며, 장일명의 결정은 존중받아야 합니다. 이것을 업계의 표준으로 만들 필요는 없습니다.
마지막 말
디스틸링은 단순한 입장 표현이 아니라 기술적 도구입니다. 字节가 가장 험난한 길을 선택했지만, 이러한 “대세를 따르지 않는” 용기는 AI 혁신에 필수적입니다. 결과가 어떻게 되든, 중국 AI 생태계에 새로운 가능성을 열어주었습니다.