虎嗅

**세계는 더 이상 사전에 정해진 틀에 맞춰지지 않는다, 차세대 모델은 어디로 나아갈 것인가?**

原文:世界不再预制,下一代模型往哪走?

1. 핵심 내용 요약

이번 토론은 홍콩의 여러 대학에서 AI 분야의 젊은 학자들이 참여한 업계 원탁 회의로, 전체 과정에서 새로운 개념이나 과장된 설명은 없었습니다. 대신 현재 매우 인기 있지만 정의가 모호한 “월드 모델”(world model)의 실제 적용 문제점들을 분석하는 데 중점을 두었습니다. 많은 사람들이 “AI가 비디오를 생성하면 그것이 월드 모델이다”고 오해하는 것을 바로잡았으며, “전체 인터넷의 비디오를 분석하여 범용 로봇을 만들 수 있다”거나 “곧 ChatGPT 버전의 로봇이 등장할 것이다”는 환상도 깨뜨렸습니다. 또한 업계에서 자주 언급되는 “백만 시간의 훈련량”이 실제로는 의미가 없는 수치라는 반직관적인 판단도 제시되었습니다. 학자들은 현재 월드 모델의 기술적 방향이 아직 확정되지 않았으며, 이것이 대기업만이 참여할 수 있는 자본 게임이 아니라, 소규모 팀이나 창업자들도 특정 시나리오에 집중하여 충분한 기회를 가질 수 있다는 데 의견을 모았습니다.

---

2. 각 항목별 쉬운 설명

1. 시중에 나와 있는 99%의 “월드 모델”은 모두 미흡합니다

많은 사람들이 AI가 고양이가 물잔을 엎는 장면을 연속적으로 생성하면 그것이 월드 모델이라고 생각하지만, 이는 사실 전혀 다른 개념입니다. 현재의 비디오 생성 AI는 단지 화면의 픽셀을 조합하여 시각적으로 익숙한 이미지를 만들 뿐이며, 물잔이 바닥에 떨어져 깨지거나 물이 흘러나가는 것을 전혀 고려하지 않습니다. 학자들에 따르면, 진정한 월드 모델은 “다음 프레임의 이미지를 예측하는” 것이 아니라, 실제 세계의 작동 원리를 이해하는 것입니다. 예를 들어, 로봇에게 물잔을 밀라달라고 하면 물잔이 얼마나 멀리 미끄러질지, 물이 얼마나 흘러날지 미리 예측할 수 있어야 하며, 물잔이 가려져 있어도 그것이 여전히 그 자리에 있다는 것을 알아야 합니다. 비디오 생성 팀, 자율주행 팀, 로봇 개발 팀 모두 “월드 모델”이라고 주장하지만, 실제로는 전혀 다른 방향으로 연구를 진행하고 있으며, 아직 만나는 단계에 이르지 못했습니다.

2. 전체 인터넷의 비디오를 분석하여 범용 로봇을 만들 수 있을까요? 그렇게 간단하지 않습니다

많은 사람들은 ChatGPT가 인터넷의 모든 텍스트를 분석하여 범용 모델이 되었다고 생각하지만, 이는 사실이 아닙니다. 인터넷의 비디오는 대부분 사람들이 물잔을 안정적으로 다루거나 요리하는 성공적인 장면들뿐이며, 실수하는 장면은 거의 없습니다. 로봇이 배워야 할 것은 “어떤 상황에서 실수할 수 있는지”인데, 이러한 실패 데이터는 인터넷에서 찾기 어렵습니다. 또한, 인간이 GoPro로 촬영한 가정용 동영상도 로봇에게는 큰 도움이 되지 않습니다. 인터넷 비디오는 로봇의 학습에 참고 자료로만 사용될 수 있을 뿐, 실제 경험을 대체할 수 없습니다.

3. “실체화된 지능의 ChatGPT”라는 홍보는 과장입니다

최근 많은 로봇 회사들이 문을 열거나 물을 붓는 데 로봇을 사용하는 데모를 보여주며 “실체화된 지능의 ChatGPT가 도래했다”고 주장하지만, 이는 사실이 아닙니다. ChatGPT의 핵심 능력은 “전에 본 적 없는 문제에도 신뢰할 수 있는 답을 제시하는 것”인데, 현재의 로봇들은 단지 이전에 연습한 작업을 반복할 뿐입니다. 로봇의 범용성은 공장에서 먼저 검증되어야 하며, 일반 가정에서 사용하기 전에 산업용 기계에 부품을 조립하거나 이동시키는 등의 작업을 먼저 해야 합니다.

4. 업계에서 자주 언급하는 “백만 시간의 훈련량”은 의미가 없습니다

많은 로봇 회사들이 자신의 기술력을 홍보할 때 “우리의 로봇은 이미 10만 시간, 백만 시간을 훈련했다”고 주장하지만, 이는 단지 홍보를 위한 수치일 뿐입니다. 예를 들어, 청소 로봇이 매일 같은 경로를 반복적으로 돌아도 새로운 것을 배우지 못합니다. 미래의 로봇의 효과적인 학습 데이터는 “새로운 물체에 얼마나 자주 접촉하는지”, “작업에 실패하는지”, “물체를 어떻게 조정하는지”와 같은 것들입니다.

5. 미래의 로봇은 각기 다른 신체에 맞춰 개별적으로 프로그래밍할 필요가 없습니다

현재의 로봇은 매우 비효율적입니다. 예를 들어, 로봇의 팔의 길이가 바뀌면 모든 프로그램을 처음부터 다시 학습해야 하지만, 사람은 두꺼운 장갑을 끼거나 다른 도구를 사용해도 쉽게 적응할 수 있습니다. 미래의 월드 모델은 다양한 신체에 적응할 수 있는 능력을 갖춰야 하며, 이를 통해 로봇의 개발 비용을 크게 줄일 수 있을 것입니다.