핵심 내용 요약
이 글은 “LLM은 고급 제조업이다”나 “AI의 최종 목표는 전력이다”와 같은 단순화된 인식에 반박하며, LLM 경쟁의 본질은 수학/응용수학과 공학적 직관의 대결이다고 지적합니다. 중국의 DeepSeek와 Kimi 팀은 MLA 압축, KDA 장거리 추론과 같은 독창적인 기술을 통해 “중국은 공학적인 역량만 있고 독창성은 없다”는 오래된 편견을 깨뜨리고 글로벌 자산 가격 결정 논리를 재정립했습니다. 또한 LLM은 현재 엄격한 수학적 기반이 부족하며 많은 미해결된 이론적 문제가 존재하므로, 향후 경쟁에서는 수학적 인재와 직관의 가치를 더욱 중시해야 하며, 그렇지 않으면 “맹목적인 달리기”에 빠질 수 있다고 강조합니다.
1. 왜 LLM은 “고급 제조업”이 아닌가?
제조업의 핵심은 “자원의 집중과 프로세스화”입니다. 예를 들어, 엘론 머스크는 충분한 인력, 칩, 공급망을 가지고 있지만 그의 Grok 모델의 성능은 평범하며, 수십만 개의 칩을 Anthropic에게 빌려야 합니다. 반면 LLM은 단순히 더 많은 칩을 구입하거나 조직 구조를 조정하는 것만으로는 성능을 향상시킬 수 없으며, 기초 수학의 본질에 대한 통찰이 핵심입니다.
예를 들어, DeepSeek 팀은 KV Cache(모델이 문맥을 처리할 때 저장하는 핵심 정보)가 고차원적이고 복잡해 보이지만 실제로는 저차원적인 구조를 가지고 있음을 발견했습니다. 이러한 통찰은 엔지니어가 “압축 방법을 찾는” 사고 방식이 아니라 물리수학에서 “복잡한 시스템의 단순화된 패턴을 인식하는” 직관에 기반합니다. 이는 제조업의流水선 작업으로는 대체할 수 없는 것입니다.
2. 중국 팀의 독창적인 혁신이 무엇을 바꾸었는가?
이전에는 시장에서 “중국의 AI는 공학적인 역량만 있고 독창성은 없다”고 일반적으로 여겨졌지만, DeepSeek와 Kimi의 기술은 이러한 편견을 깨뜨렸습니다:
- DeepSeek의 MLA 기술: 수학적 방법을 사용하여 KV Cache를 저차원으로 분해함으로써 모델의 비용을 크게 줄였으며, 이 기술을 오픈소스로 공개했습니다. 이 기술이 없었다면 중국의 모델들은 여전히 오픈소스 프레임워크에 갇혀 있었을 것입니다.
- Kimi의 KDA 기술: 주의력 핵 함수를 재설계하여 장문 추론 시의 오차 축적 문제를 해결했습니다.
이러한 혁신은 중국의 LLM이 세계 선두에 도달할 수 있게 했을 뿐만 아니라 OpenAI와 Anthropic의 독점을 깨뜨렸습니다. 이제 LLM 시장은 다양해졌으며, “고급 제조업”과 같은 잘못된 인식도 사라졌습니다. 더 중요한 것은 이러한 기술들이 자산 가격 결정 방식을 바꾸었다는 점입니다. 이전에는 중국의 AI가 구시대에 머물러 있다고 여겨졌지만, 이제는 이러한 독창적인 기술 덕분에 중국의 자산 가치가 재평가되고 있습니다.
3. “직관”이 LLM에 얼마나 중요한가?
여기서 말하는 “직관”은 무작위 추측이 아니라 복잡한 시스템에서 본질을 보는 능력입니다. 예를 들어, 표준 주의력 메커니즘의 KV Cache는 고차원적인 행렬이지만 선형대수학을 아는 연구생이라면 저차원 분해를 알고 있습니다. 그러나 Liang Wenfeng 팀만이 “KV Cache가 순서적인 차원에서 본래 저차원적인 구조를 가지고 있다”는 것을 깨달았습니다. 이러한 직관은 엔지니어가 “압축 방법을 찾는” 것이 아니라 물리수학에서 “복잡한 시스템의 단순화된 패턴을 인식하는” 것입니다. 이는 제조업의 생산 라인 작업으로는 대체할 수 없는 것입니다.
4. LLM의 수학적 약점과 숨겨진 문제들
현재의 LLM은 샤논 이전의 통신 산업과 같습니다. 엔지니어는 전화를 만들 수 있지만 정보의 본질을 이해하지 못합니다. LLM의 많은 핵심 문제들에 대한 엄격한 수학적 증명이 없습니다:
- Scaling Law: 왜 모델의 파라미터가 커질수록 성능이 좋아지는가? 수조 개의 파라미터가 있어도 여전히 성립할까? 모르니 일단 훈련해보는 수밖에 없습니다.
- GRPO 알고리즘: DeepSeek가 사용하는 훈련 방법은 왜 수렴하는가? 팀은 “시도해보니 문제가 없었다”고만 말하지만, 나중에는 해소할 수 없는 오차가 있다는 것이 발견되었습니다.
- 환상 문제: 모델이 무작위로 생성하는 결과는 사실은 고차원 공간에서의 확률 분포 때문입니다. 이는 모델이 “정답을 맞히거나 모른다” 사이에서 최적의 결정을 내리는 수학적 프레임워크가 없기 때문입니다.
이러한 문제들은 사소한 것이 아닙니다. 만약 Scaling Law가 한계에 도달하거나 압축-예측이 단순한 게임에 불과하다면, “AGI가 결국 도래할 것”이라는 모든 평가가 무너질 수 있으며, 이것이 최근 시장 변동의 핵심 원인입니다.
5. 향후 LLM 경쟁의 핵심: 수학적 기반의 강화
글은 LLM 경쟁의 후반부에서는 수학이 더 중요해질 것이라고 말합니다. 현재의 LLM은 “풍동 실험”조차 없습니다. 비행기 설계자는 마하 수가 얼마일 때 진동이 발생하는지 알지만, LLM은 얼마나 많은 파라미터가 환상을 유발하는지, 얼마나 긴 문맥이 의미를 흐트리는지 모릅니다. 이러한 문제들을 해결하기 위해서는:
1. 수학적 재능이 있는 인재를 확보: 비볼록 최적화, 행렬 계산, 미분 방정식에 능통한 사람들을 모아 LLM의 “무차원 수”를 찾아야 합니다.
2. 샤논의 순간을 기다리기: 샤논이 한 페이지의 공식으로 정보를 정의한 것처럼, 누군가가 LLM의 압축 한계와 추론 일관성의 하한을 간단한 공식으로 설명해야 합니다.
이러한 노력을 통해 LLM은 “확률 생성기”에서 진정으로 신뢰할 수 있는 도구로 발전할 수 있습니다. 그렇지 않으면 MaaS(모델即서비스)의 높은 수익률도 허구에 불과할 것입니다. 누가 “무작위 생성”에 장기적인 투자를 할까요?
결론: 젊은이들에게의 조언
저자는 재능과 직관을 가진 젊은이들에게 수학과 물리학을 공부할 것을 권합니다. 어쩌면 미래에 누군가 LLM의 “샤논 정리”를 만들어내어 등가적인 지능의 경계를 공식으로 정의할 수 있을 것입니다. 그것이 진정한 “창세의 순간”이며, 돈으로는 얻을 수 없는 것입니다.
이 글은 LLM의 발전과 수학적 기반의 중요성을 강조합니다. 중국의 기술 혁신이 세계 시장에 미치는 영향을 보여주며, 젊은이들에게 미래를 위한 준비를 할 것을 촉구합니다.