第一财经

"실체화된 인공지능 데이터가 급속히 성장하고 있지만, 모델의 검증은 아직 완전히 이루어지지 않았다"

原文:具身智能数据“狂飙”,但还未完全实现模型验证

一、 뉴스의 핵심 내용 요약

이 보도는 현재 휴먼형 로봇 산업이 직면한 가장 중요한 전환점을 명확히 지적합니다. 이전에는 전 산업이 “훈련 데이터의 심각한 부족”이라는 문제로 어려움을 겪고 있었지만, 이제 국내의 일부 기업들이 로봇 훈련 데이터를 산업화하여 생산하는 “데이터 수집 공장” 모델을 선도적으로 구축했습니다. 이를 통해 연간 수십만 시간, 누적으로는 백만 시간에 이르는 고품질의 데이터 생산 능력을 확보하게 되었으며, 이전에 “데이터를 충분히 모을 수 없다”는 기본적인 문제를 해결했습니다. 하지만 산업계는 곧 인공적으로 만들어진 시뮬레이션 환경에서 수집된 데이터에는 명확한 한계가 있다는 것을 깨달았습니다. 실제로 작업을 할 수 있는 휴먼형 로봇을 만들기 위해서는 “로봇을 먼저 70점 정도로 훈련시킨 후 실제 작업 현장에 투입하여 작업하면서 실제 데이터를 수집하여 모델을 개선하는” 긍정적인 순환을 반복해야 합니다. 현재 전 산업은 “데이터 규모 경쟁”에서 “실제 현장에서의 성공적인 운영”으로의 전환점에 서 있습니다.

---

두、 각 항목별 쉬운 설명

1. 왜 전 산업이 갑자기 데이터를 열심히 수집하는가?

기본적으로는 로봇의 “전문 학습 자료”가 완전히 부족했기 때문입니다.

우리가 일반적으로 사용하는 AI 대형 모델들은 인터넷에 저장된 텍스트와 비디오 콘텐츠를 학습하는데, 이는 인류가 수천 년 동안 축적한 지식을 모두 학습하는 것과 같습니다. 하지만 휴먼형 로봇은 “실제 세계에서 어떻게 작업하는지”를 배워야 합니다. 예를 들어, 컵을 어떤 힘으로 들어도 떨어뜨리지 않게 하거나, 테이블을 닦을 때 옆에 있는 꽃병을 어떻게 피해야 하는지, 바닥에 놓인 전선을 어떻게 건너야 하는지와 같은 세부적인 동작, 힘의 조절, 상황에 따른 대응 논리 등에 대한 정확한 데이터가 인터넷에 충분하지 않습니다.

이전에는 데이터가 너무 부족해서 로봇들이 “문을 열기”와 같은 기본적인 동작조차 제대로 할 수 없었습니다. 각기 다른 문 손잡이의 모양, 문의 무게, 문 뒤에 무엇이 있는지와 같은 변수들의 샘플 수가 너무 적어서 로봇들은 이러한 상황을 경험할 기회가 없었습니다. 이제 기업들은 데이터 생산 능력을 높이기 위해 경쟁하고 있는데, 이는 로봇이 실제로 작업을 할 수 있는 “전문 학습 자료”를 구축하는 것입니다. 그렇지 않으면 휴먼형 로봇은 단지 팔과 다리를 흔드는 장난감에 불과할 것입니다.

2. 이제 산업계는 “로봇 전용 운전 학교”를 만들었으며, 데이터 생산 모델이 이미 확립되었습니다.

이전에는 로봇 훈련 데이터를 수집하는 효율이 매우 낮았습니다. 로봇이 스스로 돌아다니며 데이터를 녹화하더라도 대부분은 쓸모없는 데이터였고, 사람을 고용하여 비디오를 찍더라도 동작의 세부 사항이 정확하지 않았습니다. 이제 선도적인 기업들은 전용 데이터 수집 기지를 만들어 로봇에게 “초대형 운전 학교”를 제공하고 있습니다.

이 기지에서는 가정 주방, 슈퍼마켓 진열대, 공장 생산 라인, 약국 진열대와 같은 일반인들이 매일 접하는 실제 환경을 1:1로 복제하고, 전문 조작원들이 로봇을 조종하여 다양한 동작을 수행하게 합니다. 예를 들어, 조리대를 닦거나, 물건을 배치하거나, 택배를 분류하는 등의 작업을 하면서 모든 관절의 움직임, 힘, 경로의 파라미터를 정확하게 기록합니다. 이후 AI가 24시간 동안 쓸모없는 데이터를 자동으로 걸러내고, 당일 수집된 데이터는 밤에 클라우드에서 처리되어 다음 날 훈련 팀에 제공됩니다.

이제 이 모델은 완전히 산업화되었으며, 선도적인 기업들은 연간 수십만 시간 분량의 고품질 데이터를 생산할 수 있습니다. 심지어 일부 기업들은 이미 백만 시간 분량의 유효한 데이터를 축적했는데, 이는 로봇에게 마치 “100만 시간 분량의 숙련된 전문가의 지도”를 제공하는 것과 같습니다. 이전에 우려되었던 “데이터 생산 문제”는 이미 상당 부분 해결되었습니다.

3. “운전 학교에서 만들어진 로봇”에는 본질적인 한계가 있습니다.

데이터 수집 공장 모델은 빠르지만, 이를 통해 훈련된 로봇은 기껏해야 기초적인 기능만 갖춘 초보 운전자에 불과합니다. 실제 현장에 나가면 쉽게 혼란스러워집니다. 세 가지 주요 문제가 있습니다:

첫째, 시뮬레이션 환경이 너무 “가상적”입니다. 운전 학교의 모든 장비는 깔끔하게 배치되어 있어 실제 현장에서 발생할 수 있는 예상치 못한 상황(예: 조리대 옆에 반병의 간장이 쌓여 있거나, 천이 기름지고 바닥에 물이 고여 미끄러운 상황)이 반영되지 않습니다.

둘째, 기준이 일관되지 않습니다. 각 기업이 데이터를 수집할 때 관절의 위치를 잘못 표시하는 경우가 많아, 로봇이 잘못된 정보를 배우게 됩니다.

셋째, 속도가 느립니다. 데이터 수집원들이 기지에서 동작을 천천히 수행하지만, 실제 공장이나 식당에서는 모두 속도를 내야 합니다. 운전 학교에서 천천히 훈련된 로봇은 실제 현장의 속도를 따라잡을 수 없습니다.

따라서 산업계는 데이터 수집 공장만으로는 실제 작업을 할 수 있는 로봇을 만들 수 없다는 데 의견이 일치합니다.

4. 최종적인 해결책은 로봇을 먼저 실제 현장에 투입하여 작업시킨 후 업그레이드하는 것입니다.

이제 산업계가 찾은 최적의 방법은 다음과 같습니다: 먼저 데이터 수집 공장의 고품질 데이터를 사용하여 로봇의 능력을 70점 정도로 훈련시켜 실제 현장에서 넘어지지 않도록 하고, 간단한 작업을 할 수 있도록 합니다. 그런 다음 로봇을 실제 현장에 투입하여 작업하게 하면서 실제 데이터를 수집하고 모델을 개선합니다. 예를 들어, 택배 역에서 택배를 분류하거나, 커피숍에서 접시를 나르거나, 공장에서 나사를 조이는 등의 작업을 하면서 실제 상황에서 발생하는 다양한 문제를 즉시 해결합니다. 이러한 순환을 반복하면 로봇의 능력이 빠르게 향상됩니다. 보도에 따르면, 로봇이 처음 택배 역에 도착했을 때는 정확도가 낮았지만, 일정 시간 동안 데이터를 충분히 수집하면 훨씬 더 효율적으로 작업할 수 있게 됩니다. 이러한 “작업-데이터 수집-업그레이드-더 나은 작업”의 순환을 효과적으로 구축하면, 새로운 환경에 적응하는 데 이전에는 몇 달이 걸렸던 작업도 몇 주 안에 해결할 수 있습니다. 누가 먼저 이러한 순환을 시작하느냐에 따라 누가 먼저 실제로 사용 가능한 휴먼형 로봇을 만들 수 있을 것입니다.

5. 현재 공개된 “백만 시간 분량의 데이터”는 단지 참가 자격증에 불과합니다.

현재 각 기업들은 수십만 시간에서 백만 시간 분량의 데이터를 축적했다고 자랑하지만, 아무도 이 데이터만으로 완벽한 휴먼형 로봇을 만들 수 있다고 단언할 수 없습니다. 심지어 “얼마나 많은 데이터가 필요한지”에 대한 기본적인 공식조차 아직 확정되지 않았습니다. 산업계는 여전히 시행착오를 거치고 있습니다.

현재의 백만 시간 분량의 데이터는 단지 경쟁에 참가할 수 있는 자격증에 불과하며, 실제 현장에서의 작업 데이터를 누가 먼저 확보하느냐가 진정한 승자를 결정할 것입니다. 앞으로 1~2년 안에 더 많은 로봇들이 택배 역, 식당, 공장에서 작업하는 모습을 볼 수 있을 것입니다. 이러한 평범해 보이는 작업 현장들이 사실은 휴먼형 로봇 산업의 진정한 시험장이 될 것입니다.