Краткое содержание анализа
Рынок роботов с интеллектом, способным взаимодействовать с физическим миром (интерактивного ИИ), набирает обороты, однако существует заблуждение относительно того, что достаточно количества данных в объеме миллионов часов для достижения уровня производительности, характерного для моделей типа GPT. На самом деле ключевыми факторами являются эффективность данных (их информативная насыщенность, охват сложных случаев и возможность переноса на другие задачи), а не их объем. В настоящее время отрасль переходит от простого накопления данных к повышению эффективности их использования, при этом приоритет отдается применению роботов в промышленных и коммерческих сценариях (колесные роботы оказались более практичными по сравнению с антропоидными). В краткосрочной перспективе не требуется выбирать между двумя основными подходами к разработке моделей (VLA и мировые модели). Конкурентное преимущество компаний, занимающихся сбором данных, заключается в создании замкнутых циклов: от сбора до обучения, развертывания и анализа результатов неудачных попыток, а не просто в количестве собранных данных. Между Китаем и США нет заметных различий; Китай имеет преимущества в области цепочек поставок и 하드вера.
Подробный анализ
1. Миллионы часов — это просто трюк? Важны эффективные данные
Многие считают, что для развития интерактивного ИИ необходимы миллионы часов данных, однако Пэн Пай из компании CoolWah Technology привел контрпример: модель не сможет многого узнать, проехав всего 100 километров по обычной дороге; в то время как пластиковый пакет, летящий на рынке, может показать различия в способности лазерных датчиков и видеосистем распознавать гибкие препятствия.
Ключевые критерии оценки данных:
- Надежность источников данных: многие утверждения о количестве собранных часов основаны на количестве токенов в языковых моделях, что не позволяет проверить или опровергнуть их достоверность;
- Эффективные данные должны соответствовать следующим критериям: ① быть объяснимыми (неудачи должны быть связаны с конкретными факторами, такими как угол движения, сила воздействия или стратегия); ② содержать достаточное количество сложных случаев (например, погодные условия или ситуации с пересечением пути транспортными средствами); ③ быть универсальными для использования различными роботами (то есть не представлять собой однократные затраты на их обработку);
- Критерий прекращения накопления данных: бизнес-ценность новых данных должна быть ниже затрат на их сбор (экономический точка перелома); например, если для определенной задачи достигнут уровень успешности 99%, дальнейший сбор данных становится нерентабельным.
2. Изменения в структуре данных
Структура данных для обучения интерактивного ИИ изменилась: теперь она представляет собой динамическую пирамиду:
- Основание пирамиды: видеозаписи с точки зрения первого лица человека (например, видео приготовления еды или уборки дома) — обладают большим объемом и способностью к использованию различными роботами;
- Средний уровень: симулируемые/синтетические данные — используются для моделирования экстремальных ситуаций (например, аварий на атомных станциях) и дополнения реальных случаев неудач;
- Верхний уровень: данные о реальных проблемах, возникающих в процессе работы роботов — имеют наибольшую ценность и напрямую способствуют повышению стабильности моделей;
Ключевой механизм: все уровни данных должны использоваться взаимодействующе (например, при возникновении проблем с пластиковыми пакетами сначала используются симуляции, затем дополняются данными с видеозаписей); Го Цзюньлиан из компании QianXun Intelligence отмечает, что чисто человеческие видео не содержат достаточно информации о взаимодействии робота с окружающей средой, поэтому к среднему уровню данных также добавляются данные, полученные с помощью устройств типа UMI (с ручными захватами).
3. Подходы к разработке моделей: VLA или мировые модели? В краткосрочной перспективе выбор не обязательный
В отрасли существуют два основных подхода к разработке моделей: VLA (обучение на основе видеозаписей) и мировые модели (сначала изучение физических законов, затем принятие решений). Участники дискуссии сходятся во мнении, что при достаточном объеме данных различия между этими подходами незначительны; кроме того, многоуровневые системы оказываются более практичными в применении (например, Google Gemini Robotics использует верхний уровень моделей для понимания задач и нижний уровень VLA для выполнения конкретных действий; существующие технологии, такие как SLAM, могут использоваться напрямую).
Коммерческие требования: многие клиенты хотят, чтобы роботы стабильно выполняли определенные задачи, а не чтобы одна модель справлялась со всеми обязанностями.
4. Коммерциализация: начинать с более простых сценариев; антропоидные роботы не являются обязательным элементом
Предыдущие поколения автоматизированных систем предполагали модификацию окружающей среды под потребности машин (например, роботы для уборки в закрытых торговых центрах), тогда как современные интерактивные роботы должны адаптироваться к условиям человеческого общества (например, роботы для уборки на открытых пешеходных дорогах).
Приоритеты при внедрении:
- Исключение экстремальных сценариев: промышленные условия с высокой степенью специализации (где традиционные автоматизированные системы уже давно используются и приносят низкую прибыль);
- Домашние условия: слишком сложные для внедрения из-за наличия пожилых людей, детей и домашних животных;
Практические решения: промышленные и коммерческие сценарии (например, перевозка грузов на фабриках или уборка в торговых центрах) — здесь требуется сочетание специализированных решений и универсальности;
Антропоидные роботы не являются обязательным элементом: Го Цзюньлиан отмечает, что колесные роботы с подъемными механизмами способны выполнять более 95% задач; для клиентов важны стабильность работы робота, низкие затраты на обслуживание и высокая экономическая эффективность, а не внешний вид робота.
5. Как выживать компаниям, занимающимся сбором данных? Важен не объем данных, а их качество
Основной конкурентный фактор компаний, занимающихся сбором данных, — способность эффективно использовать полученные данные для улучшения моделей:
- Замкнутые циклы обработки данных (сбор → отбор → обучение → развертывание → анализ неудач → повторное обучение) являются ключом к успеху; например, если робот застревает из-за пластикового пакета во время уборки дороги, компания должна записать этот случай, чтобы модель в следующий раз избегала подобных ошибок;
Необходимость универсальности данных: данные должны быть пригодны для использования с различными роботами и в разных условиях (например, старые данные могут быть использованы для обучения новых моделей);
Взаимодействие с командами разработчиков: компании-поставщики данных должны понимать потребности модельеров и предоставлять данные, содержащие полезную информацию (например, повторяющиеся обыденные сценарии не имеют большой ценности, важны сложные случаи).
Заключение
Конкуренция в области интерактивного ИИ перешла от соревнования по количеству собранных данных к соревнованию по эффективности их использования. Миллионы часов — это лишь начало пути; настоящий поворотный момент наступит тогда, когда данные о реальных неудачах помогут моделям избегать ошибок в будущем. Для обычных пользователей роботы будут более умными и эффективными: они смогут избегать препятствий (например, пластиковых пакетов на рынке или велосипедных колясок на пешеходных дорогах) и полностью интегрироваться в нашу жизнь.