핵심 내용 요약
어제 실리콘밸리에서 일어난 세 가지 AI 관련 중대한 소식(구글의 Gemini 3.8 Flash 발표, 메타의 Muse Spark1.3 업데이트, 스타트업 Mostik의 WIRED 기고)은 겉보기에는 AI 모델의 성능 향상을 보여주는 것처럼 보이지만, 실제로는 AI 추론 비용의 “다차원적인 감소 혁명”을 의미합니다. 이는 “고급 기능의 대중화”에서 “무용한 작업의 감소”를 거쳐 “자연어를 건너뛰고 내부 데이터를 직접 전송하는” 방식으로 발전하고 있습니다. AI 경제학도 “토큰 기반의 요금 체계”에서 “실제 작업 비용 기반의 요금 체계”로 전환되고 있으며, 이에 따라 AI의 가격이 점점 저렴해지고 있습니다. 이러한 변화는 이전에는 비용적으로 부담스러웠던 많은 AI 응용 프로그램들이 미래에 실현될 가능성을 열어줍니다.
1. 구글: 고급 AI 기능을 “저렴한 패키지”에 담다
구글의 Gemini 3.8 Flash는 원래 “빠르고 저렴하지만 기능이 약한” 모델이었지만, 이번 업데이트를 통해 최고 수준의 AI 소프트웨어 엔지니어링 능력(예: DeepSWE 테스트에서 수십 단계의 코드 작업을 완료하는 것)을 저렴한 가격대에 포함시켰습니다.
- 성능: DeepSWE 테스트에서 74%의 점수를 기록하여 최고 수준의 Claude Opus5와 동등한 성능을 보였습니다.
- 비용: 작업을 완료하는 데 평균 2.36달러가 소요되는 반면, Claude는 11.84달러, GPT는 6.46달러가 필요합니다(각각 5배와 3배 비쌉니다).
이것이 중요한 이유는 무엇일까요? 에이전트(Agent) 시대에는 단순한 대화만으로는 충분하지 않고, 수십 단계에 걸친 연속적인 작업(예: 코드 작성, 연구 수행)이 필요합니다. 이러한 작업 비용의 차이는 기업이 AI를 사용할지 여부에 큰 영향을 미칩니다. 구글은 토큰 가격이 저렴하기 때문에 모델이 더 많이 생각할 수 있도록 허용하여 비용을 절약할 수 있다고 설명합니다.
2. 메타: AI의 오류를 줄이면 비용이 절약된다
메타의 Muse Spark1.3은 점수가 55%에서 75.4%로 크게 향상되었지만, 더 중요한 것은 도구 호출 횟수가 20% 감소하고 토큰 소비량이 25% 감소한 것입니다.
- 비용 절약의 원리: 에이전트 시대에는 오류가 비용을 가장 많이 소모하는 요인입니다. 예를 들어, AI가 요구 사항을 잘못 이해하여 파일을 여러 번 수정하거나 수십 번의 테스트를 반복하는 경우가 많습니다. Muse는 사용자의 의도를 더 빨리 파악하고, 자신이 모르는 부분에 대해 도움을 요청하며, 초기 제약 조건을 기억함으로써 무용한 작업을 줄입니다.
- 본질: 챗봇 시대에는 점수가 20점 상승하는 것이 인상적이지만, 에이전트 시대에는 “오류를 줄이는 것”이 “더 많은 작업을 하는 것”보다 비용 절약에 더 큰 도움이 됩니다.
3. Mostik: 모델들이 “대화”하지 않고 “데이터를 직접 전송”하여 비용을 20배 절약
Mostik은 기존의 상식을 깨는 방식을 사용했습니다. 두 AI 모델이 자연어로 소통하는 대신 내부의 “수학적 신호”를 직접 전송함으로써 비용을 20배 절약했습니다.
- 비유: 기존에는 모델들이 서로 통신하기 위해 파일을 인쇄하고 스캔하는 과정이 필요했지만, Mostik은 이를 생략합니다.
- 실험 결과: 대형 모델 GLM-5.2(753B 파라미터)와 소형 모델 Qwen3.5(4B)를 결합하여 두 모델의 중간 수준의 성능을 구현했으며, 비용은 GLM의 1/20에 불과했습니다.
- 난제: 서로 다른 모델들의 내부 구조와 파라미터가 다르기 때문에 이를 효과적으로 통신시키는 것이 어렵지만, 20배의 비용 절감은 매우 큰 성과입니다.
4. 미래: 스마트폰에는 소형 모델만 필요하고, 복잡한 작업은 클라우드에서 처리
과거에는 대형 모델(예: 7B, 4B, 1B)을 스마트폰에 탑재하려고 했지만, Mostik의 기술이 성공한다면 미래에는 0.xB 크기의 소형 모델만으로도 충분할 것입니다.
- 작업 분담: 로컬의 소형 모델은 간단하고 자주 필요한 작업(예: 사용자가 어떤 앱을 사용 중인지, 현재 상태 파악)을 담당하며, 복잡한 작업이 발생하면 압축된 데이터를 클라우드의 대형 모델로 전송합니다. 클라우드에서 처리가 완료되면 다시 데이터를 전송받아 처리합니다.
- 영향: 이러한 아키텍처는 AI 계산 방식을 완전히 변화시켜 비용을 “30% 감소”하는 것이 아니라 “한 단계 이상” 감소시킬 것입니다. 예를 들어, 현재는 작업 한 번에 수십 달러가 소요되지만, 미래에는 몇 센트만으로도 가능해질 수 있습니다.
결론: AI가 “아무렇게나 사용할 수 있을 정도로” 저렴해질 때, 진정한 혁명이 시작됩니다
이 세 가지 사례의 공통점은 AI 비용이 “선형적으로 감소하는 것”이 아니라 “비용 구조 자체를 근본적으로 재구성하는 것”입니다. AI가 “몇 센트로도 에이전트가 작업을 대신할 수 있게” 되고 “수십 개의 에이전트가 24시간 동안 사용자를 도와도 비용이 많이 들지 않게” 되면, 현재는 비현실적으로 보이는 많은 AI 응용 프로그램들이 실제로 사용될 수 있게 될 것입니다. 누가 순위에서 1위를 차지했는지보다 더 중요한 것은, 이렇게 똑똑한 AI가 얼마나 저렴해질 수 있는지입니다.
(전문 용어를 피하고 쉬운 언어로 설명하여 비금융/AI 분야에 종사하지 않는 사람들도 AI 비용 혁명의 논리와 영향을 이해할 수 있도록 했습니다.)