핵심 내용 요약
이 기사는 AI 분야의 “월드 모델”(World Model)에 중점을 두어, 현재의 대형 언어 모델(예: ChatGPT)이 실제 세계 경험의 부족으로 인해 물리적 추론, 공간 계획과 같은 작업에서 치명적인 약점을 가지고 있음을 지적합니다. 월드 모델은 실제 결과를 시뮬레이션할 수 있는 시스템으로서 일반 인공 지능(AGI: Artificial General Intelligence)로 가는 핵심 경로로 여겨집니다. 기사는 또한 월드 모델의 인지 과학적 기원, 상업적 적용 진전(자본 유입, 주요 기업들의 투자), 기술적 접근 방식의 차이(픽셀 수준의 재구성 vs 추상적 표현), 그리고 AGI에 이르기까지 아직 해결해야 할 많은 과제들(시간적 추론, 메타인식 등)에 대해서도 다룹니다.
상세한 설명
1. 대형 언어 모델의 “치명적인 약점: 실제 세계의 ‘상식’이 부족함”
간단한 예를 들어보겠습니다. AI에게 “잔이 바닥에 떨어지면 어떻게 될까?”라고 물으면, AI는 “중력 위치 에너지”, “응력 파동”과 같은 전문 용어들을 나열할 수 있지만, 5~6살 아이는 그저 “잔이 깨진다”고 말할 것입니다. 왜냐하면 LLM(대형 언어 모델)의 핵심은 “다음 단어를 예측하는 것”이며, 방대한 텍스트 데이터를 기반으로 학습하지만 실제로 잔이 바닥에 떨어지는 것을 본 적이 없기 때문입니다. 즉, 실제 세계의 경험이 없으면 물리 법칙을 제대로 이해할 수 없습니다.
예를 들어, 내비게이션에서 LLM은 경로를 암기할 수 있지만, 우회 경로를 요청하면 혼란스러워합니다(문자 정보만 가지고 있을 뿐 인간의 “심리적 지도”가 없기 때문입니다). 옷을 접는과 같은 일상적인 작업도 LLM은 전혀 할 수 없습니다; LLM은 단지 “설명”만 할 줄 알 뿐 “실제 상황”을 이해하지 못합니다. 이것이 바로 LLM의 본질적인 한계입니다: LLM은 “문자 전문가”일 뿐 “현실 전문가”는 아닙니다.
2. 월드 모델: AI가 인간처럼 결과를 예상할 수 있도록 하는 시스템
월드 모델의 개념은 1943년 심리학자 크레이크(Crick)에서 비롯되었습니다. 인간의 뇌에는 다양한 행동의 결과를 시뮬레이션할 수 있는 “소형 모델”이 있다고 그는 주장했습니다(예: “잔이 바닥에 떨어지면 깨진다”고 생각하면 의도적으로 만지지 않습니다). 이후의 “예측 처리 이론”(Prediction Processing Theory)은 인간의 지각이 세계를 지속적으로 예측한 후 시각, 청각 정보로 그 결과를 수정한다고 설명합니다.
AI 연구자들은 AI도 이러한 능력을 갖게 하고자 합니다: 행동하기 전에 내부에서 결과를 먼저 시뮬레이션하여 실제로 실수하는 것을 방지하고자 합니다. 예를 들어, 튜링상 수상자인 양리쿤(Yang Lequn)은 “예측 능력이 없는 AI는 진정한 지능이 아니다. 지능이란 우리 대신 시험을 해주는 것”이라고 말했습니다.
3. 자본의 집중 투자: 월드 모델, 새로운 AI 경쟁 분야로 부상
최근 2년 동안 월드 모델은 자본과 거대 기업들이 경쟁하는 핫한 분야가 되었습니다:
- 리페이페이(Li Feifei)가 설립한 World Labs는 “공간 지능”을 연구하기 위해 2억 3천만 달러를 유치했습니다;
- 양리쿤은 Meta를 떠나 AMI 연구소를 설립하여 1억 달러를 투자하여 월드 모델을 개발하고 있습니다;
- 구글 DeepMind의 Dreamer4 시스템은 “마인크래프트” 비디오를 많이 보고 자원을 수집하거나 도구를 만드는 등의 작업을 스스로 학습할 수 있습니다.
하지만 이들은 모두 초기 단계에 불과합니다. 예를 들어, World Labs의 Marble은 3D 장면 생성기에 불과하며, Genie3는 게임 시뮬레이터와 유사합니다; 실제로 집안일을 할 수 있는 로봇과는 거리가 멉니다.
4. 기술적 접근 방식의 대립: 픽셀 수준의 재구성 vs 추상적 요약
현재 두 가지 주요 기술적 접근 방식이 있으며, 이에 대한 논란이 치열합니다:
- 픽셀 수준의 재구성: Dreamer4와 같은 모델은 학습 과정에서 각 픽셀을 정확하게 복원하여 행동 후의 결과를 시뮬레이션합니다. 장점은 세부 사항이 완벽하지만 데이터 요구량이 많습니다;
- 추상적 표현: 양리쿤의 JEPA 접근 방식은 세부 사항을 복원하지 않고 추론에 필요한 핵심 정보만을 다룹니다(예: 잔이 바닥에 떨어지면 깨진다는 것만 알면, 조각의 위치는 신경 쓰지 않습니다). 장점은 데이터가 적지만, 추상적 정보가 복잡한 추론을 지원할 수 있는지에 대한 의문이 있습니다. 예를 들어, V-JEPA2는 물체의 움직임 규칙을 학습할 수 있지만 개방된 환경에서의 지능을 보여줄 수 있는지는 아직 증명되지 않았습니다.
양측 모두 일리가 있습니다: Dreamer4의 책임자인 하프나(Havner)는 픽셀 수준에서도 추상적 정보를 학습할 수 있다고 생각하며, 양리쿤은 추상적 접근이 더 효율적이라고 주장합니다.
5. AGI에 이르기까지의 길: 월드 모델만으로는 부족함
월드 모델이 아무리 잘 만들어져도 AGI(인간처럼 모든 것을 할 수 있는 지능)에 이르기까지는 많은 과제가 남아 있습니다:
- 시간적 추론: AI는 현재 단 1초 후의 상황만 예측할 수 있으며, “장기적인 결과”를 생각할 수 없습니다(예: 인간은 “지금 열심히 공부해서 나중에 좋은 직업을 찾겠다”고 생각합니다);
- 메타인식: AI는 자신이 무엇을 알고 모르는지 모릅니다; 잘못된 답변을 하거나 자신의 오류를 인식할 수 없습니다;
- 복잡한 인과 관계와 타인의 생각 이해: 인간은 복잡한 인과 관계(예: “비가 와서 길이 미끄럽다”)를 이해하고 타인의 의도(예: “그가 찌푸리는 것은 화가 난 것”이라고 추측)를 알 수 있지만, AI는 그렇지 못합니다.
전문가들은 월드 모델이 필수적인 조건이지만 충분한 조건은 아니라고 말합니다; AGI에 이르기 위해서는 더 많은 능력들의 조합이 필요합니다.
결론
월드 모델은 AI가 AGI로 나아가는 중요한 단계입니다. 하지만 이것이 “만병통치약”은 아닙니다; AI가 진정으로 인간처럼 생각하게 되기까지는 아직 많은 길이 남아 있습니다.