핵심 내용 요약
지스푸 AI(Zhipu AI)가 발표한 GLM-5.3 대형 모델은 “많은 파라미터를 쌓는” 전략을 따르지 않고(여전히 7,530억 개의 파라미터만 사용), “포스트 트레이닝 스케일링(post-training scaling)”을 통해 기존 모델의 잠재력을 극대화함으로써 성능이 크게 향상되었습니다. 이 방법은 더 긴 훈련 시간, 다양한 작업 시나리오, 대규모 강화 학습을 활용하는 것입니다. GLM-5.3은 엔드포인트 작업, 소프트웨어 공학, 전문 지식, 프로그래밍, 사이버 보안 등의 평가에서 뛰어난 성능을 보였으며, 특히 사이버 보안 측면에서는 일부 국제 최첨단 모델을 능가했습니다. 현재 대형 모델 시장의 가격 정책은 엄청난 대조를 보이고 있습니다: 해외 거대 기업들은 국내 모델의 위협에 대응하기 위해 가격을 낮추는 반면, 국내 모델들은 “가성비”에서 “수익화”로 전략을 바꾸고 있습니다. GLM-5.3의 미래는 포스트 트레이닝의 이점이 지속되는지, 오픈 소스화 후의 보안 관리가 제대로 이루어지는지, 그리고 프로그래밍 및 보안 역량을 바탕으로 개발자 생태계를 구축할 수 있는지에 달려 있습니다.
1. 업그레이드 논리: “수조 개의 파라미터 경쟁”을 추구하지 않고, 기존 모델의 성능을 정교하게 향상시킴
이전에는 대형 모델 업계에서 “파라미터의 양”을 비교하는 것이 유행했으며, 예를 들어 Kimi K3은 2.8조 개의 파라미터로 업계에 큰 반향을 일으켰습니다. 하지만 GLM-5.3은 이와 반대의 접근을 취했습니다. 기존 모델의 파라미터는 그대로 유지하면서, 성능 향상은 전적으로 “포스트 트레이닝”을 통해 이루어졌습니다. 이는 마치 같은 자동차 엔진에 더 긴 시간 동안의 조정과 테스트, 더 복잡한 환경에서의 연습, 그리고 더 지능적인 방식으로 운전 습관을 최적화하는 것과 같습니다. 지스푸 AI는 이를 “포스트 트레이닝 스케일링”이라고 부르며, 기존 모델의 잠재력이 아직 충분히 발휘되지 않았다고 강조합니다.
2. 성능의 하이라이트: 사이버 보안과 프로그래밍 능력
GLM-5.3은 여러 중요한 평가에서 두드러진 성과를 보였습니다:
- 실제 작업 수행 능력: Terminal-Bench 점수가 4.6에서 28.3으로 크게 상승했습니다(점수가 높을수록 성능이 좋음). 이는 일상적인 업무 처리 능력(보고서 작성, 표 생성 등)이 크게 향상되었음을 의미합니다.
- 프로그래밍 능력: 고난도 프로그래밍 테스트에서 Anthropic의 Claude Opus 4.8을 능가했으며, 생성된 코드의 질도 더 우수했습니다(작업당 평균 5만 개의 토큰으로, Opus의 절반에도 미치지 못함).
- 전문 지식 범위: GDPval-AA 점수가 1,769로 Kimi K3의 1,682를 넘어서었습니다. 이는 의사의 병력 작성, 엔지니어의 기술 문서 검토 등 44가지 전문 분야의 작업을 처리할 수 있음을 의미합니다.
- 사이버 보안 능력: 국제적인 취약점 추론 테스트에서 GPT와 Anthropic 모델을 능가했으며, 심각한 취약점을 찾는 능력도 크게 향상되었습니다. 지스푸 AI는 10개 이상의 보안 팀과 협력하여 실제 코드베이스에서 2,436개의 취약점을 발견했으며(그중 1,097개는 중고위험), 안드로이드, 윈도우 등 다양한 시스템을 대상으로 했습니다. 이는 해당 모델이 해커에게 쉽게 악용되지 않음을 의미합니다.
3. 가격 정책의 대조: 해외 기업은 가격을 낮추어 시장 점유율을 높이려 하고, 국내 기업은 가격을 올려 수익화를 추구함
최근 대형 모델의 가격 정책에는 큰 차이가 나타나고 있습니다:
- 해외 거대 기업들의 가격 인하: OpenAI는 GPT-5.6 Luna의 API 가격을 80% 낮추었으며(1백만 토큰당 1달러에서 0.2달러로), 구글과 Anthropic도 따라서 가격을 인하했습니다. 이는 국내 모델(Kimi K3, DeepSeek V4 등)이 사용자를 빼앗을까 두려워하는 것입니다.
- 국내 모델들의 가격 상승: DeepSeek V4-Pro는 피크 시간대에 가격이 4.5배로 상승했으며(Kimmi K3은 2~3배 상승하여 100원/백만 토큰), 지스푸 AI도 이전에 가격을 인상한 바 있습니다. 이는 국내 모델들이 더 이상 “저렴한 가격”으로 시장 점유율을 얻기보다는 수익화를 목표로 하고 있음을 의미합니다.
GLM-5.3의 경우 아직 가격 인상에 대한 정보가 없지만, 이전 가격(입력 8원, 출력 28원/백만 토큰)을 유지한다면 DeepSeek V4-Pro와 비슷한 수준이 될 것입니다. 이는 해외 기업의 가격 인하와 국내 기업의 가격 상승이라는 대조적인 상황에서 위치하고 있습니다.
4. 미래의 과제: 성공을 위한 세 가지 장애물
GLM-5.3의 “많은 파라미터를 쌓지 않고 포스트 트레이닝에 집중하는” 전략이 지속될 수 있는지는 다음 세 가지 문제에 달려 있습니다:
1. 포스트 트레이닝의 이점이 얼마나 오래 지속될까? 현재 포스트 트레이닝을 통해 빠른 성능 향상을 보이고 있지만, 언젠가는 그 한계에 도달할 것입니다. 그 후에는 어떻게 성능을 더 향상시킬 수 있을까요?
2. 오픈 소스화 후의 보안 관리가 제대로 이루어질 수 있을까? 지스푸 AI는 모델을 오픈 소스로 공개할 예정이지만, 더 많은 사람들이 사용함에 따라 보안 취약점의 위험이 커집니다. 이를 어떻게 관리할 수 있을까요?
3. 개발자 생태계를 구축할 수 있을까? 해외 기업들이 가격을 낮추고 국내 기업들이 가격을 올리는 상황에서, GLM-5.3은 프로그래밍 및 보안 역량을 바탕으로 개발자들을 유치해야 합니다. 개발자들이 이 모델을 대체할 수 없다고 느낀다면(예: 보안 관련 애플리케이션 개발에 필수적인 모델로 인식된다면) 성공할 수 있을 것입니다.
결론적으로, GLM-5.3은 대형 모델 업계에 “파라미터의 양보다 내부 기술에 집중하는” 새로운 방향을 제시합니다. 하지만 이 전략이 실제로 성공할 수 있을지는 향후의 기술적, 보안적, 상업적인 요소들에 달려 있습니다. 일반 사용자들에게는 더 안정적이고 지능적인 국내 모델을 사용할 수 있게 될 것입니다. 하지만 가격은 이전처럼 저렴하지 않을 가능성이 높습니다.