虎嗅

**세계적인 모델이 인기를 끌며 GPT-6가 로봇 분야로 진출: 실체화된 ‘뇌’의 주도권은 누가 쥐고 있을까? | AI 100 비공개 회의**

原文:世界模型爆火,GPT-6把手伸向机器人:具身大脑到底谁说了算?| AI 100 闭门会

한국어 번역:

1. 뉴스의 핵심 내용을 쉽게 설명하기

최근 AI 업계에서 매우 중요한 변화가 있었습니다. 이전에는 휴먼형 로봇에 대한 논의가 관절의 유연성이나 모터의 힘과 같은 “신체적” 측면에 집중되었지만, 이제는 전 업계가 “로봇의 뇌”라는 새로운 분야로 관심을 돌리고 있습니다.

이 변화의 계기는 OpenAI가 휴먼형 로봇 개발에 참여한다고 발표한 것이었으며, 이어서 공개된 GPT-6 Astra의 성능이 실망스러웠습니다. 간단한 작업(예: 물건을 잡고 놓기)의 성공률은 95%였지만, 플러그를 콘센트에 꽂는과 같은 정교한 작업에서는 성공률이 10%에 불과했습니다. 이는 최고 수준의 대형 모델이 실제 세계에 들어가면 그 기능이 크게 제한된다는 것을 의미합니다.

이제 업계는 깨달았습니다: 대형 모델은 디지털 세계에서는 문서를 작성하거나 그림을 그리는 데는 유능하지만, 실제 세계의 복잡한 상황(물건이 미끄러지거나 움직이거나 충돌하는 것)에는 적합하지 않습니다. 이미 자금이 이 분야로 흘러들고 있습니다. 상반기에 국내의 신체 기반 인공지능 분야에 투자된 총액은 400억 이상이었으며, 그중 절반 이상이 “로봇의 뇌”를 개발하는 회사에 투자되었습니다. 특히 “월드 모델”(world model)이라고 불리는 기술에 많은 관심이 집중되고 있습니다. 하지만 문제는 12개의 오픈소스 신체 기반 모델을 실제로 테스트한 결과, 복잡한 작업의 성공률이 평균 16.7%에 불과했다는 것입니다. 이렇게 과장되게 홍보된 월드 모델이 로봇에게 얼마나 실제로 도움이 되는지에 대해서는 업계 내에서도 의견이 분분합니다.

그래서 이번에는 업계의 선도적인 창업자, 투자자, 대학 교수들이 모여 비공개 회의를 열어 네 가지 핵심 질문에 대해 논의했습니다: 월드 모델이 정말로 로봇의 뇌로서 필수적인가? 어떤 뇌가 실제로 작업에 적합한가? 현재의 수십억, 수백억 원의 평가가 진정한 기술에 기반한 것인가, 아니면 단지 과장된 건가? 앞으로 1년 안에 어떤 기술이 실제로 적용될 수 있을까? 9월 22일에는 전 업계 종사자들을 위한 라이브 방송을 통해 이러한 질문들에 대한 답을 공개할 예정입니다. 이는 신체 기반 인공지능 분야에 대한 명확한 기준을 제시하는 것입니다.

---

2. 각 항목별 쉬운 설명

2.1 업계의 실제 상황: 휴먼형 로봇의 “뇌”는 “신체”보다 100배 더 어렵다

많은 사람들은 휴먼형 로봇이 인간처럼 관절이 유연하면 공장에서 일하거나 집안일을 할 수 있다고 생각했지만, OpenAI의 테스트 결과 이러한 환상이 깨졌습니다. 관절의 정밀도가 인간보다 높아도 뇌가 반응이 느리거나 다음 순간에 물건이 어디로 움직일지 예측할 수 없으면 정교한 작업을 할 수 없습니다.

이전의 대형 모델들은 모두 디지털 세계에서만 훈련되었기 때문에 실제 세계의 다양한 문제(예: 물이 담긴 컵이 미끄러지거나 부드러운 빵이 변형되거나 바닥에 있는 돌에 걸리는 것)를 경험하지 못했습니다. 이제는 로봇의 “신체 하드웨어”는 거의 기준에 도달했지만, “뇌의 지능”은 3살 어린이 수준에 머물러 있습니다. 이러한 이유로 업계는 모두 “로봇의 뇌” 개발에 집중하고 있습니다. 이는 단순한 홍보가 아니라 이전의 접근 방식이 더 이상 효과적이지 않기 때문입니다.

2.2 “월드 모델”이란 무엇인가?

현재 많은 회사들이 “월드 모델”이 무엇인지에 대해 다른 정의를 내리고 있습니다. 어떤 회사는 “월드 모델이 로봇이 몇 초 후에 볼 수 있는 장면을 생성할 수 있다”고 하고, 다른 회사는 “로봇이 연습할 수 있는 가상 시나리오를 대량으로 생성할 수 있다”고 하며, 또 다른 회사는 “로봇이 물건을 잡을 때 그것을 깨뜨릴지 예측할 수 있다”고 합니다. 결국 모두 사람들이 수십 년 동안 경험한 물리적 상식을 로봇에게 적용하려는 것입니다. 예를 들어, 테이블 위의 물컵을 밀 때 물이 손에 닿기 전에 미리 결과를 예측하고 행동을 조정할 수 있어야 합니다. 하지만 현재의 월드 모델 대부분은 “가상 영상을 매우 사실적으로 생성하는” 수준에 머물러 있으며, 실제 세계의 규칙을 이해하고 그에 따라 작동하는 데는 아직 많은 발전이 필요합니다.

2.3 자본의 투자 목적: 다음 “안드로이드 수준의 독점 기회”

상반기에 투자된 400억 중 절반 이상이 “로봇의 뇌” 개발에 사용되었습니다. 많은 회사가 10초짜리 데모만 공개했음에도 불구하고 그들의 평가는 수십억 원에 달했습니다. 자본이 이 분야에 몰리는 이유는 간단합니다: 휴먼형 로봇이 대중화되면 수십억 대의 로봇이 각각 자체적으로 뇌 시스템을 개발할 수는 없으므로, 모든 로봇이 사용할 수 있는 공통된 “지능 시스템”이 등장할 것입니다. 누가 먼저 이를 개발하면 그 회사의 가치는 현재의 안드로이드와 엔비디아의 합계에 달할 것입니다. 하지만 현재는 과대평가된 부분도 많습니다. 많은 회사들이 실제 데이터를 제공하지 못하고 단지 PPT로만 월드 모델의 효과를 홍보하고 있습니다. 이번 비공개 회의에서는 업계의 투자자들이 모여 “진정한 기술”과 “과대평가된 기술”의 경계를 명확히 할 것입니다. 앞으로는 단순한 데모로는 투자를 유치할 수 없으며, 로봇이 복잡한 작업을 할 수 있는지, 새로운 작업을 위해 코드를 다시 작성할 필요가 없는지가 중요한 기준이 될 것입니다.

2.4 미래의 로봇 제어권은 누가 가질 것인가?

현재는 두 가지 대립된 의견이 있습니다. 로봇의 “신체”를 제작하는 회사들은 자신들이 관절의 움직임과 하드웨어 설정을 가장 잘 알고 있으므로 지능 제어권을 제3자에게 넘겨줄 필요가 없다고 주장합니다. 반면, “뇌”를 개발하는 회사들은 수십억 원을 투자하여 개발한 공통 모델을 제공하는 것이 더 경제적이라고 주장합니다. 결국 누가 더 많은 실제 데이터를 확보하느냐가 중요할 것입니다. 즉, 로봇이 실제 세계에서 얼마나 많은 경험을 쌓았는지가 결정적인 요소가 될 것입니다. 데이터가 많을수록 로봇의 성능이 향상되고, 더 빠르게 발전할 수 있으며, 다른 회사들은 따라잡을 수 없을 것입니다.

2.5 신체 기반 인공지능의 진정한 성숙도를 판단하는 기준

앞으로는 로봇이 실제로 작업을 할 수 있는지를 판단할 때 6가지 중요한 지표를 참고해야 합니다:

① 동일한 작업을 100번 반복할 때의 성공률

② 물체의 위치를 변경하거나 장애물을 추가했을 때의 성공률

⑤ 작업 중에 오류가 발생했을 때 스스로 조정하여 계속 작업할 수 있는지

⑥ 새로운 작업을 수행할 때 필요한 시간과 비용

⑦ 다른 모델에 이 뇌를 적용할 때의 시간과 비용

⑧ 100번의 작업 중에 사람의 개입이 필요한 횟수

이러한 지표들이 높은 수준에 도달해야 로봇이 실제로 공장이나 가정에서 생산 도구로 사용될 수 있으며, 업계는 더 이상 무모한 투자에 의존하지 않을 수 있을 것입니다.