虎嗅

**리페이페이의 월드 랩스가 새로 발표한 세계 모델, 과연 진짜 세계를 반영하는 모델일까?**

原文:李飞飞的World Labs新发布的世界模型,是真的世界模型吗?

핵심 내용 요약

World Labs가 출시한 Atlas는 단순한 “그림 그리기 도구”가 아니라, 기계가 사용할 수 있는 구조화된 3차원 세계를 생성할 수 있는 “세계 시뮬레이터”입니다. 이 시뮬레이터는 딥 픽처, 포인트 클라우드, 3D 고스 플렉스와 같은 기술을 사용하여 일반 사진을 측정 가능한 3차원 데이터(예: 컵의 지름, 테이블과 벽의 거리 등)로 변환하며, 실제 사진과 AI를 결합하여 로봇이 가상 환경에서 훈련할 수 있도록 합니다(실제 데이터 없이도 실제 기계에서 바로 사용 가능합니다). Atlas의 핵심적인 혁신은 “사람에게만 보여주는” 렌더러에서 “기계가 작업할 수 있는” 시뮬레이터로의 업그레이드로, AI 생성과 산업 응용 간의 격차를 해소한 것입니다.

1. Atlas: 그림 그리기가 아닌, 데이터 기록을 위한 시뮬레이터

이 기사는 AI 시스템을 세 가지 단계로 나눕니다:

  • 렌더러: 단지 “보기 좋은 그림”을 생성하는 역할을 합니다(예: 방향키를 누르면 해당 시점의 이미지를 생성하지만, 컵의 높이나 테이블과 벽의 거리는 알 수 없음).
  • 시뮬레이터: “세계의 상태”를 기억하는 역할을 하며, 컵의 위치, 테이블의 크기, 문이 얼마나 열렸는지 등의 정보를 언제든지 확인할 수 있어 로봇이 이 데이터를 기반으로 물건을 잡을 수 있습니다.
  • 플래너: 더 고급된 단계로, 물건의 위치뿐만 아니라 “지금 잡아야 할지, 어떤 각도에서 잡는 것이 가장 안전한지”도 판단합니다.

Atlas는 시뮬레이터에 속합니다. 예를 들어, 주방 사진을 찍으면 각 픽셀의 깊이를 계산하여 주방의 형태를 구성하고, 3D 장면을 생성합니다. 이 결과는 사람이 보기 위한 것이 아니라 게임 엔진, 디자인 소프트웨어, 또는 로봇의 제어 코드에 직접 사용됩니다.

2. Atlas의 “스마트한 점”: “위치 기억”을 활용한 문제 해결

Atlas의 기술 혁신은 다중 모달 입력과 공간 기억에 있습니다:

  • 다중 모달 입력: 텍스트, 이미지, 카메라의 위치와 방향(6개의 숫자로 설명 가능), 딥 픽처를 동시에 받아들입니다. 예: 문 앞과 창가에서 각각 소파 사진을 찍으면 일반 모델은 두 개의 다른 사진으로 인식하지만, Atlas는 사용자가 얼마나 걸었는지, 얼마나 돌았는지를 알아서 같은 소파라고 인식합니다.
  • 공간 기억: 이전 모델인 RTFM은 문제가 있었습니다(가상 집을 반 시간 동안 둘러본 후에는 너무 많은 이미지가 저장되어 처리 능력이 부족하거나 정보가 잊혔습니다). Atlas는 “위치를 인덱스로 사용”하여 주방의 모습을 확인할 때 언제 찍었는지 신경 쓰지 않고 필요한 정보를 바로 찾을 수 있습니다(마치 회의실에 들어가면 지난주 회의의 세부 사항을 즉시 기억하는 것처럼).

3. “실제를 복원하는 동시에 AI로 완성하는” 3차원 장면의 새로운 접근 방식

과거에는 3차원 장면을 만들기 위해 두 가지 방법이 있었습니다:

  • 재구성: 실제 사진을 사용하여 복원하지만, 찍지 못한 부분은 그대로 남겨둡니다(예: Funes World 프로젝트는 실제 건물의 백업을 만들었지만 누락된 부분은 보충하지 않았습니다).
  • 생성: AI가 상식을 기반으로 존재하지 않는 장면을 만듭니다.

Atlas는 이 두 방법을 결합합니다: 사진이 많으면 덜 생성하고, 사진이 적으면 더 많이 생성합니다. 예: 정원 사진만 주면 주변 건물을 자동으로 생성하고, 오두막 사진을 주면 생성된 부분을 실제 데이터로 바꿉니다. 로봇에게는 벽에 그려진 문양이 생성된 것인지 실제로 찍은 것인지는 중요하지 않으며, 중요한 것은 벽의 위치와 크기가 정확한지입니다.

4. 로봇의 “가상 세계에서의 훈련”: 시뮬레이터의 핵심 가치

Atlas의 가장 큰 응용 분야는 로봇 훈련입니다:

  • World Labs는 로봇 회사 SceniX를 인수한 후 Atlas 시뮬레이터를 사용하여 로봇을 훈련시켰습니다. 실제 데이터 없이도 로봇이 포장, 케이블 감기, 시험관 이동 등의 작업을 수행할 수 있으며, 일부 경우에는 한 시간 동안 사람의 개입 없이도 작동합니다.
  • 시뮬레이터가 현실과 “완전히 같을 필요는 없습니다”: 예: 시뮬레이터의 벽의 마찰 계수가 실제 벽과 다르더라도, 시뮬레이터에서 A 방법이 B 방법보다 좋다면 실제 기계에서도 그렇게 작동해야 합니다.

이는 로봇 훈련의 큰 문제점을 해결합니다(실제로는 실수가 매우 비용이 많이 들지만, 시뮬레이터에서는 수천 번의 실험이 가능하여 실수 경험을 빠르게 축적할 수 있습니다).

5. ImageNet에서 Atlas까지: 리 페이페이 팀의 “세계 모델” 개발 과정

리 페이페이 팀이 2009년에 개발한 ImageNet은 인터넷 이미지를 분류하여 기계가 “사물을 인식”하도록 했습니다(예: 사진 속의 컵을 인식하는 것). 이제 Atlas는 “사물이 어떻게 위치하는지”를 파악하는 것을 목표로 합니다(예: 컵이 테이블 위에 어떻게 놓여 있는지, 밀려난 후 어디에 있는지, 테이블 뒤로 돌아갔을 때 같은 컵인지 등).

이 과정에서 두 가지 접근 방식이 있습니다:

  • 한쪽은 충분한 비디오 데이터를 제공하면 3차원 구조가 자연스럽게 형성될 것이라고 생각합니다(예: Meta의 V-JEPA 2).
  • 다른 쪽(Atlas)은 카메라의 위치, 기하학적 정보, 물리적 제약을 모델에 직접 적용하여 세계가 처음부터 구조화되도록 합니다.

Atlas의 접근 방식은 더 실용적입니다: 3차원 데이터는 텍스트와 달리 인터넷에 방대한 양의 자료가 없으므로 공간 관계와 상호작용을 기록하는 것이 어렵기 때문에, 모델에 직접 규칙을 적용하는 것이 더 효율적입니다.

결론: Atlas가 해결하려는 것은 “가상 세계의 상호작용”

기사는 마지막으로 Morrell의 발명을 예로 들어 설명합니다: Morrell의 기계는 일주일 동안의 장면을 완벽하게 재현할 수 있지만, 실제로는 일어나지 않은 일(예: 컵을 넘기는 것)은 할 수 없습니다. 반면 Atlas는 가상 세계가 “살아나도록” 만드는 것을 목표로 합니다. 즉, 단순히 장면을 복원하는 것을 넘어서 로봇이 그 안에서 손을 뻗고, 물건을 만지고, 실험을 할 수 있도록 하는 것이 진정한 “세계 시뮬레이터”의 역할입니다.

일반 사람에게는 Atlas가 당장 삶에 직접적인 영향을 미치지 않을 수 있지만, 로봇, 산업 디자인, 디지털 트윈과 같은 분야의 효율성을 향상시킬 것입니다. 예를 들어, 미래에는 로봇이 실제 공장에서 반복적으로 실험할 필요 없이 Atlas의 가상 세계에서 충분히 연습한 후에 바로 작업에 투입될 수 있습니다.