第一财经

**전시대가 춤출 수 있고, 공장은 정확하게 작동하지 않는다… 신체화된 지능의 ‘뇌’는 아직 학습 중입니다.**

原文:展台能跳舞,工厂拧不准,具身智能的“大脑”还在补课

핵심 내용 요약

현재 휴먼형 로봇 산업은 “열기와 현실의 괴리” 단계에 있습니다. 전시회에서 로봇들이 춤추고 옷을 접는 등의 멋진 모습은 범용 로봇 시대의 도래를 기대하게 하지만, 실제로 로봇들이 할 수 있는 일은 보여준 것에 비해 훨씬 제한적입니다. 주요 문제는 “뇌”(지능)와 “몸”(하드웨어)의 협업 부족에 있습니다. 뇌는 명령을 내릴 수 있지만, 손이 물건을 제대로 잡지 못하거나 정확도가 부족합니다. 기술적인 방향성이 통일되지 않았으며 데이터도 부족합니다. 비록 과열된 평가(가치와 실제 가치의 불일치)가 있지만, 장기적으로 데이터와 실제 가치 문제를 해결하면 2~10년 내에 ChatGPT와 같은 돌파구가 찾아올 것으로 예상됩니다.

1. 전시회는 멋지지만, 로봇들은 “손재주가 없어서” 일을 할 수 없다

전시회에서의 로봇들은 춤추고 옷을 접는 등 지능적으로 보이지만, 공장이나 가정에서는 제대로 작동하지 못합니다. 예를 들어, 컵을 잡으려다 미끄러지거나 상자를 너무 세게 짓눌러 찌그러뜨리거나, 잠긴 찬장 문을 열지 못합니다. 그 이유는 간단합니다—뇌는 생각할 수 있지만 몸이 따라오지 못합니다.

로봇의 “몸”의 주요 문제점은 세 가지입니다:

1. 손이 너무 둔하다: 민첩한 손의 힘 조절(힘 제어) 정확도가 부족하여 물건을 제대로 잡지 못하거나 망가뜨립니다.

2. 발이 불안정하다: 두 발로 걸을 때 넘어지기 쉽고 균형 감각이 떨어집니다.

3. 전신의 조화가 부족하다: 동작을 할 때 유연성이 부족하여, 예를 들어 테이블에서 물건을 가져와 찬장에 넣는 과정에서 중간에 멈춥니다.

산업 현장에서는 더 높은 정확도가 필요합니다(자동차 부품 조립 등 밀리미터 또는 아래미리미터 수준). 현재 로봇의 작동 정확도는 센티미터에서 밀리미터 수준에 머물러 있어 산업 기준에 미치지 못합니다. 따라서 현재 로봇은 주로 연구, 공연, 교육에 사용되며 산업 현장에서의 활용은 “쇼링”에 불과합니다.

2. 실제 적용의 세 가지 장애물: 일반화 능력, 정확도, 효율성

로봇이 어렵게나마 일을 할 수 있다고 해도, 공장이나 가정에 진출하려면 세 가지 장애물을 극복해야 합니다:

1. 일반화 능력이 부족하다: 다른 환경으로 옮기면 제대로 작동하지 않습니다. 예를 들어, 고정된 실험실에서는 옷을 잘 접을 수 있지만, 재질이 다르거나 조명이 달라진 환경에서는 성공률이 급격히 떨어집니다.

2. 정확도가 부족하다: 산업 현장에서는 나사를 박을 때 아래미리미터 수준의 정확도가 필요하지만, 로봇은 현재 밀리미터 수준에 머물러 있습니다.

3. 효율성이 너무 낮다: 로봇이 간단한 조립 작업을 할 때 인간보다 훨씬 느립니다. 예를 들어, 자동차 공장에서 로봇이 부품을 조립하는 데 10초가 걸리는 반면, 인간은 3초면 충분합니다. 기업들은 로봇을 사용하려 하지 않습니다.

더 깊은 문제는 물리적 세계가 너무 복잡하여 로봇이 모든 상황에 대처할 수 있는 일반적인 규칙을 가지고 있지 않다는 것입니다(예: 공장에서 갑자기 부품이 떨어지거나, 가정에서 아이가 장난감을 바닥에 던지는 경우). 모델과 데이터도 이러한 예상치 못한 상황을 모두 포괄할 수 없습니다.

3. 기술적 방향성: “모방 학습”에서 “미래 예측”으로

로봇의 “뇌”(지능)는 큰 업그레이드를 겪고 있습니다:

  • 과거: VLA 모델(모방 학습): 로봇에게 많은 비디오를 보여주고 동작을 모방하게 하는 방식입니다. 하지만 정적이고 고정된 환경에서만 작동 가능하며, 환경이 바뀌면 제대로 작동하지 못합니다.
  • 현재: 세계 모델(미래 예측): 로봇이 다음에 무슨 일이 일어날지 “예측”할 수 있습니다. 예를 들어, 컵을 잡을 때 미끄러질지 미리 예측하여 손의 힘을 조절하거나, 걸을 때 바닥에 구멍이 있는지 예측하여 피할 수 있습니다. 이는 VLA 모델의 문제점을 해결하지만, 아직 실험실 단계에 머물러 대규모로 적용되지 않았습니다.
  • 공통적인 문제: 데이터 부족: 현재의 지능 모델의 파라미터는 약 70억 개에 불과하며(초기 언어 모델의 수천억 개에 비해 훨씬 적음), 훈련에 사용되는 GPU도 적습니다(수십 개의 카드만으로도 충분합니다). ChatGPT 수준의 지능을 달성하려면 수천 개, 수만 개의 카드로 구성된 클러스터가 필요하며, 더 많은 실제 세계 데이터가 필요합니다.

4. 과열된 평가 아래에서의 산업 성장

현재 산업에는 과열된 평가가 있습니다. 회사들의 가치 평가가 높지만 실제로 창출하는 가치는 적습니다. 예를 들어, “휴먼형 로봇 1호주”로 불리는 유수과기(YuShu Technology)의 주가는 상장 후 거의 절반으로 떨어졌는데, 이는 시장이 그들의 제품이 실제로 적용되지 않았다는 것을 인식했기 때문입니다.

하지만 과열된 평가가 전부 나쁜 것은 아닙니다. 적당한 수준의 과열은 자금과 인재를 유치하여 기술 발전을 가속화할 수 있습니다. 업계 전문가들은 미래의 돌파구가 두 가지 핵심 요소에 있다고 보고 있습니다:

1. 데이터 부족 문제 해결: 더 많은 실제 환경의 데이터(예: 공장이나 가정에서의 로봇 작동 영상 및 동작 데이터)를 수집합니다.

2. 실제 가치 창출: 로봇이 인간이 하고 싶어 하지 않거나 할 수 없는 일(예: 탄광에서 일하거나 노인 돌봄)을 할 수 있도록 합니다.

언제가 진정한 돌파구가 올까요? 유수과기의 창립자인 왕싱싱(Wang Xingxing)은 이렇게 말했습니다: “로봇이 어떤 낯선 환경(예: 가정)에서도 약 80%의 작업을 완수할 수 있다면, 그때가 지능의 ChatGPT 시대가 올 것입니다. 빠르면 2~3년, 늦어도 5~10년 안에 가능할 것입니다.”

현재 전시회의 조명은 밝지만, 진정한 시험은 조명이 비추지 않는 곳에서 이루어집니다—공장의 생산 라인, 가정의 주방과 같이 로봇이 매일 안정적으로 작동해야 하는 곳에서입니다.

결론: 휴먼형 로봇 산업은 “보기에는 멋지지만 실제로는 어렵지만”, 장기적으로 큰 잠재력을 가지고 있습니다. 하드웨어, 데이터, 기술적 방향성의 장애물을 극복해야만 “쇼링”에서 “실용성”으로 나아갈 수 있습니다. 과열된 평가는 점차 사라지고, 실제 문제를 해결하는 회사들만이 살아남을 것입니다.