虎嗅

GPT-6이 만물을 인식했다면, 실체화 기반 모델에는 무엇이 남았을까?

原文:GPT-6认出了万物,具身基座模型还剩什么

로봇 산업의 “차원 축소” 공격? GPT-6 Astra가 어떻게 신체 인공지능의 게임 규칙을 바꾸고 있는가?

안녕하세요, 여러분의 금융 기자이자 경제학자입니다. 오늘은 매우 흥미로운 산업 심층 분석 기사를 다룰 예정입니다.

간단히 말해, 지난 2년 동안 로봇 산업(신체 인공지능)은 이런 이야기를 해왔습니다: “대형 모델은 똑똑하지만 물리적 세계를 이해하지 못하기 때문에, 로봇에게 특별한 ‘뇌’(기반 모델)를 훈련시켜야 합니다.”

하지만 OpenAI가 최근에 발표한 GPT-6 Astra가 등장하면서 이 이야기에 큰 의문이 제기되었습니다. Astra는 놀라운 능력을 보여주었는데, 특별한 훈련을 받지 않고도 단지 한 장의 사진만으로 상호작용 가능한 시뮬레이션 환경을 재현할 수 있었습니다.

이것은 마치 주방에 들어가본 적 없는 사람이 요리법 사진을 보고 모든 재료를 알아보고, 그 재료들이 어디에 놓여야 하는지 알며, 심지어 요리 과정까지 시뮬레이션할 수 있는 것과 같습니다(비록 맛은 맞지 않을 수 있지만).

이것은 로봇의 “뇌”를 훈련시키는 데 많은 돈을 쓰고 있는 스타트업들에게 큰 경고입니다. 아래에서 이 기사의 내용을 다섯 가지 측면으로 나누어 이 산업 변화를 완전히 이해할 수 있도록 설명해 드리겠습니다.

---

1. 핵심 내용: “사진 보고 말하기”에서 “세계 구축하기”까지, Astra는 무엇을 했나?

먼저, Astra가 어떤 능력을 보여주었는지, 그리고 왜 이것이 위협적인지 알아봅시다.

이전에는 로봇이 물리적 세계를 이해하는 것이 매우 어려운 “Real2Sim”(실제 세계에서 시뮬레이션 세계로) 문제였습니다. 예를 들어, 로봇에게 테이블 위에 컵과 액체가 있는 사진을 보여주면, 로봇은 보통 “이것은 컵이다”, “이것은 물이다”만을 인식할 수 있었습니다.

하지만 이번에 개발자들이 Astra에게 그 사진을 주고 상호작용 가능한 시뮬레이션 환경을 생성하도록 요청했을 때, Astra는 다음을 해냈습니다:

  • 물체 인식: 컵과 액체가 무엇인지 알아냈습니다.
  • 공간 이해: 액체가 컵 안에 있고, 컵이 테이블 위에 있다는 것을 알아냈습니다.
  • 세부 사항 복원: 액체의 색깔까지 매우 사실적으로 재현했습니다.
  • 코드 생성: 이러한 정적인 이미지들을 실행 가능한 프로그램 시나리오로 변환했습니다.

중요한 점은: Astra는 이 시나리오를 위해 특별히 훈련받지 않았습니다. 그저 인터넷의 방대한 이미지, 비디오, 매뉴얼을 “보는” 것만으로 이 모든 것을 배웠습니다.

유일한 단점: 액체가 섞였을 때의 화학 반응을 시뮬레이션하지 못했습니다. 물이 어떻게 생겼는지는 알지만, 물과 황산을 섞으면 폭발한다는 것은 모릅니다. 이는 Astra가 “시각”은 이해하지만 깊은 “물리적 인과 관계”는 이해하지 못한다는 것을 의미합니다.

쉬운 설명: Astra는 책을 많이 읽은 실습생과 같습니다. 세상의 99%의 흔한 물체를 알고 대략적으로 어떻게 사용하는지는 알지만, 실제로 만져본 적이 없기 때문에 마찰력이 얼마나 큰지, 힘을 얼마나 세게 줘야 하는지는 모릅니다.

---

2. 인지 위기: “사과를 알아보는” 것이 더 이상 보호막이 아니다

기사에 따르면, GPT-6의 등장으로 신체 인공지능 스타트업들의 생존 공간이 직접 위협받고 있습니다, 특히 “기반 모델” 이야기를 하는 회사들이 그렇습니다.

과거에는 회사가 로봇이 테이블 위의 사과를 인식하게 만들면 그것이 기술적 능력으로 여겨졌고, 판매 포인트가 되었습니다.

하지만 이제 GPT-6과 같은 범용 다중 모달 모델은 방대한 훈련 데이터(인터넷의 모든 이미지, 비디오, 논문 포함) 덕분에 엄청난 “물리적 세계 도감”을 구축했습니다.

  • 컵을 들어본 적은 없지만, 수많은 사람들이 컵을 드는 것을 봤습니다.
  • 공장에 들어간 적은 없지만, 로봇팔과 생산 라인을 인식할 수 있습니다.
  • 서랍을 열어본 적은 없지만, 손잡이가 어디에 있고 서랍을 어떻게 열어야 하는지 알고 있습니다.

이는 “물체 인식”과 “상황 이해”가 이제 일반적인 능력이 되어가고 있으며, “글을 읽는” 것처럼 더 이상 희귀한 기술이 아니라는 것을 의미합니다.

스타트업들에게는 “내 로봇은 명령을 이해하고 물체를 인식할 수 있다”는 것만으로는 OpenAI와 같은 거대 기업과 경쟁할 수 없습니다. 컴퓨팅 파워, 데이터 규모, 반복 속도에서 스타트업들은 이길 수 없습니다. 새로운 “대형이고 포괄적인” 범용 모델을 처음부터 훈련시키는 것은 비용이 많이 들 뿐만 아니라, 범용 모델이 이미 해낸 일을 반복하는 것일 가능성이 높습니다.

쉬운 설명: 예전에는 “이해하는” 것이 능력이었지만, 이제는 기본적인 것입니다. “이해하는” 것만으로 생계를 유지할 수는 없습니다. 범용 대형 모델이 그 일을 대신할 것입니다.

---

3. 능력의 한계: 왜 Astra는 “화학 반응”을 시뮬레이션하지 못했을까?

여기에는 매우 중요한 세부 사항이 있으며, 이것이 “범용 모델”과 “신체 인공지능”의 핵심 차이점입니다.

Astra는 액체의 색깔을 재현했지만, 액체가 섞였을 때의 반응은 시뮬레이션하지 못했습니다. 왜일까요?

  • 색깔은 시각 정보이므로 방대한 이미지에서 배울 수 있습니다.
  • 화학 반응은 재료의 특성, 물리적 법칙, 인과 관계를 포함하며 더 정확한 데이터와 모델이 필요합니다.

이것은 “물체를 인식하는 것”이 반드시 물체를 신뢰할 수 있게 조작할 수 있다는 것을 의미하지는 않는다는 핵심 논리를 보여줍니다.

로봇은 컵의 위치를 정확히 지적할 수 있고, “손을 뻗고, 잡고, 들어올리는” 단계를 생성할 수 있습니다. 하지만 실제로 실행할 때는:

  • 클램퍼에 얼마나 많은 힘이 필요한가?
  • 접촉점이 2밀리미터만 벗어나도 미끄러질까?
  • 컵 속의 액체가 흔들린 후 속도를 어떻게 조정해야 할까?
  • 다른 재질의 마찰력은 얼마나 큰가?

이러한 것들은 모두 실제 세계의 피드백, 즉 “촉각”, “힘 감각”, “실패 경험”에서 비롯됩니다. 범용 모델(Astra)은 이러한 “신체 경험”이 부족합니다. 컵이 어떻게 생겼는지는 알지만, 컵의 무게, 미끄러움, 깨지기 쉬움은 모릅니다.

쉬운 설명: Astra는 이론가입니다. 어떻게 해야 하는지는 알지만, 실제로 하는 느낌은 모릅니다. 신체 인공지능의 가치는 바로 이 “실제 경험”의 공백을 채우는 데 있습니다.

---

4. 가치의 이동: “뇌”에서 “신체 경험”으로

이제 범용 모델이 “인지” 문제를 해결했으므로, 신체 인공지능 스타트업들의 기회는 어디에 있을까요? 기사는 매우 명확한 판단을 내렸습니다: 가치는 뒤로 이동하고 있습니다.

미래의 분업 논리는 세 가지 계층으로 재구성될 수 있습니다:

1. 상위 계층 (인지 계층): GPT-6 수준의 범용 모델이 제공합니다. 명령을 이해하고, 물체를 인식하며, 작업 단계를 계획하는 역할을 합니다.

2. 중간 계층 (동작 예측 계층): 신체 모델이 수행합니다. 동작이 발생한 후 환경이 어떻게 변할지 예측하는 역할을 합니다.

3. 하위 계층 (제어 계층): 특정 로봇과 결합합니다. 마지막 몇 센티미터의 정확도, 힘 제어, 지연, 안전 문제를 해결하는 역할을 합니다.

스타트업들의 새로운 장벽은 “파라미터 규모”가 아니라 “데이터에 동작이 포함되어 있는지”입니다.

  • 일반 비디오 데이터: 모델에게 “사람이 컵을 들었다”고 알려줍니다. (범용 모델은 이미 충분히 배웠습니다.)
  • 로봇 상호작용 데이터: 로봇팔이 어느 방향으로 접근하는지, 관절이 어떻게 움직이는지, 클램퍼가 얼마나 많은 힘을 가하는지, 잡기가 성공했는지, 실패 후 어떻게 복구하는지 기록합니다.

이러한 시각, 촉각, 힘 감각, 관절 상태, 실행 결과를 포함한 상호작용 데이터야말로 로봇이 실제 세계로 진입하는 진정한 경험입니다. 이러한 데이터는 인터넷에서 직접 얻기 어렵고, 계산 능력만으로 자동으로 채우기도 어렵습니다.

쉬운 설명: 더 이상 모든 것을 아는 “뇌”를 만들 필요는 없습니다. 그것은 OpenAI의 일입니다. 여러분이 해야 할 일은 “신체 경험”을 축적하는 것입니다. 로봇이 만지고, 잡고, 실패하고, 수정하도록 하는 것입니다. 이러한 “실제 상호작용 데이터”를 가진 회사가 다음 단계의 경쟁 우위를 가질 것입니다.

---

5. 산업의 종착점: 출발선이 앞으로 옮겨졌지만, 게임은 끝나지 않았다

마지막으로, 이 기사의 결론을 살펴보겠습니다: GPT-6는 신체 인공지능을 끝내지 않았고, 산업의 출발선을 한 걸음 앞으로 옮겼습니다.

  • 과거: 출발선은 “로봇이 세계를 인식하게 하는 것”이었습니다.
  • 현재: 출발선은 “로봇이 안전하고 정확하게 세계를 변화시키게 하는 것”으로 바뀌었습니다.

만약 회사의 핵심 능력이 로봇이 물체를 인식하고 언어를 이해하는 것뿐이라면, GPT-6과의 격차는 점점 커져 결국 주변화될 것입니다.

하지만 많은 실제 상호작용 데이터, 힘 감각, 촉각, 실패 경험 데이터를 축적한 회사라면, GPT-6는 그 회사의 “상위 뇌”가 될 수 있으며, 그 회사 자체는 필수적인 “신체 실행자”가 될 것입니다.

투자자들에게의 메시지:

  • 경계: “우리는 범용 로봇 기반 모델을 훈련시킬 것입니다”라