세계 모델의 진짜 목적은 “환상을 그리는 것”인가, 아니면 “실제 길을 만드는 것”인가? – World Labs의 Atlas를 예로 들어
안녕하세요, 여러분의 금융 전문 기자이자 경제학자입니다. 오늘은 기술계와 자본계에서 큰 화제가 된 주제에 대해 이야기해보려고 합니다: 세계 모델(World Models)입니다.
AI에 관심이 있다면 Sora(사실적인 비디오를 생성하는 모델)나 다양한 로봇에 대한 소식을 들어보셨을 것입니다. 최근에 World Labs라는 회사가 Atlas라는 제품을 출시했는데, Sora와 비슷해 보이지만 하는 일은 전혀 다릅니다.
이 기사의 핵심적인 메시지는 매우 명확합니다: 현재의 ‘세계 모델’ 경쟁은 ‘누가 더 잘 그리는가’에서 ‘누가 더 정확하고 실용적으로 계산하는가’로 전환되고 있습니다. 많은 회사들이 여전히 비디오의 품질에 집중하고 있지만, 실제 산업에 적용되기 위해서는 로봇이 직접 작업할 수 있는 디지털 공간이 필요합니다.
이제 이 복잡한 기술 변화의 논리와 기회를 이해하기 쉽게 5가지 핵심 포인트로 설명해 드리겠습니다.
---
1. 핵심 차이점: Sora는 “영화를 찍는” 것이고, Atlas는 “집을 짓는” 것입니다
먼저, 가장 큰 오해를 바로잡아야 합니다: Atlas는 비디오 생성기가 아니라 3D 장면 재구성 도구입니다.
- Sora (비디오 생성): “고양이가 잔디밭에서 달린다”는 텍스트를 주면, 사실적인 비디오를 생성합니다. 중요한 것은 픽셀이 연결되었는지, 화면이 실제처럼 보이는지입니다. 최종 결과물은 사람이 보는 비디오 파일입니다.
- Atlas (세계 모델): 다양한 각도에서 찍은 몇 장의 사진을 주면, 실제 3D 공간을 재구성합니다. 중요한 것은 좌표가 정확한지, 기하학적 구조가 맞는지입니다. 최종 결과물은 사진이 아니라 점유계(좌표가 있는 점들의 집합)나 3D 고스 퍼지(형태와 색상이 있는椭球체)입니다.
쉬운 비유:
- Sora는 사실적인 유화를 그리는 것과 같습니다. 아무리 잘 그려도 그림 속으로 들어갈 수는 없습니다.
- Atlas는 레고로 진짜 방을 만드는 것과 같습니다. 그 방에는 길이, 너비, 높이가 있으며, 로봇이 들어갈 수 있고 프로그램이 직접 데이터를 읽을 수 있습니다.
왜 이것이 중요한가?
로봇에게는 비디오를 “보는” 것이 아니라 “벽이 어디에 있는지”, “테이블이 얼마나 높은지”, “내가 거기를 지날 수 있는지”를 알아야 합니다. Atlas가 제공하는 것은 로봇이 직접 계산할 수 있는 ‘0과 1’이며, 이것이 바로 로봇의 실제 지능을 위한 “기반”입니다.
---
2. 기술적 돌파: “전문 측량”에서 “스마트폰으로 간편하게 촬영”으로
과거에는 로봇을 훈련시키기 위한 3D 장면을 만들려면 매우 비용이 많이 들었습니다. 전문 레이저 레이더와 수십 대의 카메라를 사용해 물체 주변을 돌며 수백 장의 사진을 찍고, 엔지니어가 며칠 동안 수작업으로 모델을 만들어야 했습니다. 이는 마치 집을 지을 때 측량팀을 불러야 하는 것과 같았습니다. 느리고 비쌌습니다.
Atlas가 가져온 가장 큰 변화는 진입 장벽이 크게 낮아지고 효율성이 향상되었다는 것입니다.
- 입력이 매우 간단해졌습니다: 최소 2장의 일반 스마트폰 사진만으로도 사용 가능한 3D 장면을 재구성할 수 있습니다.
- 지능적인 추론: 공식 데모에 따르면, 책상의 클로즈업 사진 한 장만으로도 전체 방의 구조를 추측할 수 있으며, 전경 사진 한 장으로 의자의 위치를 정확히 파악할 수 있고, 측면 사진 한 장으로 모니터의 위치도 완성됩니다. 이는 단순한 퍼즐 맞추기가 아니라 공간적 맥락을 통해 물체들의 위치 관계를 이해하는 것입니다.
- 놀라운 효과: 스탠퍼드 대학의 중앙 정원은 몇 장의 지면 사진만으로도 고공에서 내려다보는 연속적인 비디오를 생성할 수 있습니다.
비즈니스적 의미:
이는 3D 장면 구축이 “전문 측량 수준”에서 “소비자 수준”으로 넘어갔다는 것을 의미합니다. 일반 엔지니어나 비전문가도 스마트폰으로 몇 장의 사진을 찍으면 몇 분 안에 로봇이 훈련할 수 있는 가상 환경을 만들 수 있습니다. 데이터 수집 비용이 급격히 감소했으며, 이것이 산업이 폭발적으로 성장하는 핵심 요인입니다.
---
3. 핵심 능력: 로봇이 “보고” 미래를 “시뮬레이션”할 수 있게 해줍니다
Atlas는 사진을 3D 모델로 변환할 뿐만 아니라, 시점과 시간도 제어할 수 있습니다. 이것이 일반 3D 모델링 소프트웨어와 다른 점입니다.
- 카메라 제어 기능: Atlas에게 “왼쪽 45도 각도에서 이 장면을 보고, 그 다음에 카메라를 천천히 멀리 이동시켜달라”고 지시하면, 지정한 경로를 따라 최대 1440p 해상도, 최대 1분 길이의 비디오를 생성할 수 있습니다.
- *비교 우위:* 다른 모델은 텍스트로 카메라 움직임을 설명해야 하므로 오류가 발생하기 쉽습니다. Atlas는 좌표를 직접 입력하므로 정확도가 매우 높습니다. 테스트에서 Atlas는 주요 비디오 모델보다 75%-94%의 높은 승률을 기록했으며, 특히 복잡한 카메라 움직임에서 그 장점이 두드러집니다.
- 시공간 시뮬레이션: 가장 멋진 기능입니다. 여러 대의 스마트폰으로 동시에 비디오를 녹화하면, Atlas는 시간을 “동결”시켜 원하는 각도에서 같은 순간을 다시 볼 수 있게 해줍니다.
- *과거에는:* 이러한 효과를 얻기 위해 수십 대의 동기화된 카메라와 수십만 원의 비용이 필요했습니다.
- *지금은:** 몇 대의 스마트폰과 Atlas만으로 가능합니다.
로봇에게의 가치:
이것은 단순히 재미를 위한 것이 아닙니다. 로봇 훈련에서 “내가 왼쪽으로 한 걸음을 내딛으면 카메라가 무엇을 보게 될까?”라는 질문에 답할 수 있습니다. Atlas는 로봇 센서가 보아야 할 RGB 이미지와 심도 데이터를 실시간으로 생성할 수 있습니다. 또한, 실제 장면에서 수천 가지 변형을 만들 수 있습니다(조명을 바꾸거나 장애물을 이동시키거나 경로를 변경하는 것 등)며, 이 모든 것을 재구성할 필요가 없습니다.
한 마디로 요약: 실제 세계는 한 번만 방문하면 됩니다. 디지털 세계는 무한히 반복 사용할 수 있습니다. 데이터 수집의 주체가 “실제 로봇”에서 “가상 로봇”으로 바뀌었습니다.
---
4. 치명적인 단점: Atlas는 “피부만 그릴 수 있고, 뼈는 그릴 수 없습니다**
Atlas는 매우 뛰어나지만, 기사는 그것의 본질적인 한계를 솔직하게 지적합니다: Atlas는 기하학만 이해할 뿐, 물리학은 이해하지 못합니다.
- Atlas는 무엇인가?: 고정밀度的 비전 렌더링 도구입니다. 장면을 그려낼 수 있고, 물체가 어디에 있고 어떤 모양인지 알 수 있습니다.
- Atlas가 아닌 것은?: 물리 엔진이 아닙니다. 물체가 몇 겹인지, 마찰 계수가 얼마인지, 힘을 받으면 어떻게 변형되는지, 충돌할지 알 수 없습니다.
- *예를 들어:** Atlas는 테이블 위에 사과가 있다는 것을 알지만, 사과가 부드러운지 단단한지, 밀면 얼마나 멀리 굴러가는지, 아니면 바로 부서질지는 알 수 없습니다. 이러한 물리적 속성은 사진에서 확인할 수 없으며, Atlas도 계산할 수 없습니다.
- 기술적 한계: Atlas의 손실 함수는 화면의 사실성을 최적화하는 데 중점을 두었지만, 물리적 정확성은 아닙니다. 시뮬레이션 과정에서는 외부의 MuJoCo, PhysX와 같은 엔진에 의존해야 합니다.
쉬운 비유:
Atlas는 최고 수준의 미술 감독과 같습니다. 장면을 생생하게 그릴 수 있지만, 역학은 이해하지 못합니다. 벽이 빨간색이라는 것은 알지만, 벽이 견딜 수 있는지는 모릅니다. 로봇이 벽에 부딪히면 Atlas는 충돌의 시각적 효과는 그릴 수 있지만, 충격의 강도나 로봇이 망가질지는 계산할 수 없습니다.
이것이 바로 World Labs가 SceniX를 인수한 이유입니다:
SceniX는 가상 물체에 물리적 속성(질량, 마찰, 탄성)을 부여하는 데 능숙합니다. World Labs(기하학) + SceniX(물리학) = 완전한 Real-to-Sim-to-Real(실제 → 시뮬레이션 → 실제)의 순환 체계를 구축합니다.
---
5. 업계 전망: “인식”에서 “이해”로의 마지막 단계
마지막으로, 전체 업계의 방향을 살펴보겠습니다.
- 현재 단계: 대부분의 회사들은 기하학적 재구성과 비전 생성에 집중하고 있습니다. 사진을 더 사실적인 3D 장면으로 변환할 수 있는 회사가 첫 번째 단계에서 승리합니다.
- 미래 경쟁: 진정한 경쟁은 물리적 속성의 통합에 있습니다.
- 기하학은 알고리즘을 통해 사진에서 추론할 수 있습니다.
- 하지만 물리적 파라미터(케이블의 감쇠, 직물의 직조 방식, 관절의 마찰 등)는 실제 물리적 상호작용을 통해 설정해야 합니다.
- 미래의 세계 모델은 공간 구조와 물리적 규칙**을 하나의 모델로 통합해야 합니다.
투자자에게의 시사점:
1. ‘Sim2Real’(시뮬레이션에서 실제로의 적용 능력에 주목하세요: 단순히 데모 비디오가 얼마나 멋진지만 보는 것이 아니라, 로봇이 시뮬레이션에서 훈련을 받은 후에 제로샷(Zero-shot)**으로 실제 로봇에 이전하여 안정적으로 작동할 수 있는지를 확인해야 합니다. World Labs가 시연한 로봇의 케이블 조작, 변형 가능한 물체의 제어, 그리고 1시간 동안 인간의 개입 없이 자율적으로 작동하는 것이 진정한 기술적 장벽입니다.
2. 데이터 비용은 핵심적인 경쟁력입니다: 가장 낮은 비용(스마트폰 사진)으로 최고 품질의 훈련 데이터를 생성할 수 있는 회사가 로봇 회사의 연구 개발 장벽을 낮추고, 그에 따라 시장에서 우위를 차지할 수 있습니다.
3. **물리 엔진과 비