虎嗅

Русский перевод: Анализ работы интеллектуальных роботов в течение 1 миллиона часов: действительно ли они могут стать «умными»? | Закрытое совещание по искусственному интеллекту (AI 100)

原文:拆透具身智能100万小时:真能喂出一个“聪明”机器人吗?|AI 100闭门会

Краткое содержание анализа

Рынок роботов с интеллектом, способным взаимодействовать с физическим миром (интерактивного ИИ), набирает обороты, однако существует заблуждение относительно того, что достаточно количества данных в объеме миллионов часов для достижения уровня производительности, характерного для моделей типа GPT. На самом деле ключевыми факторами являются эффективность данных (их информативная насыщенность, охват сложных случаев и возможность переноса на другие задачи), а не их объем. В настоящее время отрасль переходит от простого накопления данных к повышению эффективности их использования, при этом приоритет отдается применению роботов в промышленных и коммерческих сценариях (колесные роботы оказались более практичными по сравнению с антропоидными). В краткосрочной перспективе не требуется выбирать между двумя основными подходами к разработке моделей (VLA и мировые модели). Конкурентное преимущество компаний, занимающихся сбором данных, заключается в создании замкнутых циклов: от сбора до обучения, развертывания и анализа результатов неудачных попыток, а не просто в количестве собранных данных. Между Китаем и США нет заметных различий; Китай имеет преимущества в области цепочек поставок и 하드вера.

Подробный анализ

1. Миллионы часов — это просто трюк? Важны эффективные данные

Многие считают, что для развития интерактивного ИИ необходимы миллионы часов данных, однако Пэн Пай из компании CoolWah Technology привел контрпример: модель не сможет многого узнать, проехав всего 100 километров по обычной дороге; в то время как пластиковый пакет, летящий на рынке, может показать различия в способности лазерных датчиков и видеосистем распознавать гибкие препятствия.

Ключевые критерии оценки данных:

  • Надежность источников данных: многие утверждения о количестве собранных часов основаны на количестве токенов в языковых моделях, что не позволяет проверить или опровергнуть их достоверность;
  • Эффективные данные должны соответствовать следующим критериям: ① быть объяснимыми (неудачи должны быть связаны с конкретными факторами, такими как угол движения, сила воздействия или стратегия); ② содержать достаточное количество сложных случаев (например, погодные условия или ситуации с пересечением пути транспортными средствами); ③ быть универсальными для использования различными роботами (то есть не представлять собой однократные затраты на их обработку);
  • Критерий прекращения накопления данных: бизнес-ценность новых данных должна быть ниже затрат на их сбор (экономический точка перелома); например, если для определенной задачи достигнут уровень успешности 99%, дальнейший сбор данных становится нерентабельным.

2. Изменения в структуре данных

Структура данных для обучения интерактивного ИИ изменилась: теперь она представляет собой динамическую пирамиду:

  • Основание пирамиды: видеозаписи с точки зрения первого лица человека (например, видео приготовления еды или уборки дома) — обладают большим объемом и способностью к использованию различными роботами;
  • Средний уровень: симулируемые/синтетические данные — используются для моделирования экстремальных ситуаций (например, аварий на атомных станциях) и дополнения реальных случаев неудач;
  • Верхний уровень: данные о реальных проблемах, возникающих в процессе работы роботов — имеют наибольшую ценность и напрямую способствуют повышению стабильности моделей;

Ключевой механизм: все уровни данных должны использоваться взаимодействующе (например, при возникновении проблем с пластиковыми пакетами сначала используются симуляции, затем дополняются данными с видеозаписей); Го Цзюньлиан из компании QianXun Intelligence отмечает, что чисто человеческие видео не содержат достаточно информации о взаимодействии робота с окружающей средой, поэтому к среднему уровню данных также добавляются данные, полученные с помощью устройств типа UMI (с ручными захватами).

3. Подходы к разработке моделей: VLA или мировые модели? В краткосрочной перспективе выбор не обязательный

В отрасли существуют два основных подхода к разработке моделей: VLA (обучение на основе видеозаписей) и мировые модели (сначала изучение физических законов, затем принятие решений). Участники дискуссии сходятся во мнении, что при достаточном объеме данных различия между этими подходами незначительны; кроме того, многоуровневые системы оказываются более практичными в применении (например, Google Gemini Robotics использует верхний уровень моделей для понимания задач и нижний уровень VLA для выполнения конкретных действий; существующие технологии, такие как SLAM, могут использоваться напрямую).

Коммерческие требования: многие клиенты хотят, чтобы роботы стабильно выполняли определенные задачи, а не чтобы одна модель справлялась со всеми обязанностями.

4. Коммерциализация: начинать с более простых сценариев; антропоидные роботы не являются обязательным элементом

Предыдущие поколения автоматизированных систем предполагали модификацию окружающей среды под потребности машин (например, роботы для уборки в закрытых торговых центрах), тогда как современные интерактивные роботы должны адаптироваться к условиям человеческого общества (например, роботы для уборки на открытых пешеходных дорогах).

Приоритеты при внедрении:

  • Исключение экстремальных сценариев: промышленные условия с высокой степенью специализации (где традиционные автоматизированные системы уже давно используются и приносят низкую прибыль);
  • Домашние условия: слишком сложные для внедрения из-за наличия пожилых людей, детей и домашних животных;

Практические решения: промышленные и коммерческие сценарии (например, перевозка грузов на фабриках или уборка в торговых центрах) — здесь требуется сочетание специализированных решений и универсальности;

Антропоидные роботы не являются обязательным элементом: Го Цзюньлиан отмечает, что колесные роботы с подъемными механизмами способны выполнять более 95% задач; для клиентов важны стабильность работы робота, низкие затраты на обслуживание и высокая экономическая эффективность, а не внешний вид робота.

5. Как выживать компаниям, занимающимся сбором данных? Важен не объем данных, а их качество

Основной конкурентный фактор компаний, занимающихся сбором данных, — способность эффективно использовать полученные данные для улучшения моделей:

  • Замкнутые циклы обработки данных (сбор → отбор → обучение → развертывание → анализ неудач → повторное обучение) являются ключом к успеху; например, если робот застревает из-за пластикового пакета во время уборки дороги, компания должна записать этот случай, чтобы модель в следующий раз избегала подобных ошибок;

Необходимость универсальности данных: данные должны быть пригодны для использования с различными роботами и в разных условиях (например, старые данные могут быть использованы для обучения новых моделей);

Взаимодействие с командами разработчиков: компании-поставщики данных должны понимать потребности модельеров и предоставлять данные, содержащие полезную информацию (например, повторяющиеся обыденные сценарии не имеют большой ценности, важны сложные случаи).

Заключение

Конкуренция в области интерактивного ИИ перешла от соревнования по количеству собранных данных к соревнованию по эффективности их использования. Миллионы часов — это лишь начало пути; настоящий поворотный момент наступит тогда, когда данные о реальных неудачах помогут моделям избегать ошибок в будущем. Для обычных пользователей роботы будут более умными и эффективными: они смогут избегать препятствий (например, пластиковых пакетов на рынке или велосипедных колясок на пешеходных дорогах) и полностью интегрироваться в нашу жизнь.