Резюме основного содержания новости
Данная статья прямо указывает на самый важный поворотный момент в текущей индустрии антропоморфных роботов: ранее вся отрасль сталкивалась с серьезной проблемой нехватки обучающих данных. Теперь ряд китайских компаний первыми внедрили модель промышленного производства данных для обучения роботов, достигнув годового объема производства в десятки тысяч часов и общего объема в миллион часов, тем самым решив начальную проблему недостатка данных. Однако отрасль быстро поняла, что данные, собранные в искусственно созданных симуляционных условиях, имеют явные ограничения. Чтобы создать роботов, способных выполнять реальные задачи, необходимо следовать циклу: сначала довести уровень навыков робота до 70%, затем отправить его в реальные условия работы, где он будет собирать данные, которые будут использоваться для улучшения моделей. Сейчас отрасль находится на перекрестке пути от соревнования по объему данных к эффективному внедрению этих моделей в практическую деятельность.
---
Популярное объяснение по пунктам
1. Почему вся отрасль сейчас с ума сходит от сбора данных?
Причина в том, что ранее роботы не имели достаточного количества «профессиональных учебных материалов». Обычные крупные ИИ-модели обучаются на имеющихся в интернете текстовых и видеоматериалах, что эквивалентно ознакомлению с знаниями, накопленными человечеством за тысячи лет. Однако антропоморфные роботы должны уметь выполнять конкретные действия в реальном мире: как правильно держать стакан, чтобы не уронить его, как обходить вазы при мытье стола, как перешагивать через провода на полу и т. д. Для этих действий в интернете нет достаточного количества точно маркированных данных. Ранее отрасль испытывала серьезный дефицит данных; многие роботы даже не могли правильно открыть дверь из-за недостатка примеров различных дверных ручек, весов дверей и препятствий за ними. Сейчас компании активно собирают данные, чтобы создать необходимую базу знаний для роботов; иначе антропоморфные роботы останутся лишь игрушками, не способными выполнять реальные задачи.
2. В отрасли появились специализированные центры для обучения роботов
Ранее сбор данных для обучения роботов был крайне неэффективен: либо роботы действовали случайным образом, и собранные данные были бесполезными, либо для съемки движений нанимались люди, но их действия были неточными. Теперь ведущие компании создали специализированные центры для сбора данных, которые воссоздают реальные сценарии (кухни, супермаркеты, производственные линии, аптеки) и используют операторов для выполнения различных действий роботами (мытье плит, распаковка посылок и т. д.). После каждого действия точно записываются параметры движений, силы и путей. Затем данные автоматически проверяются ИИ, и ненужные данные удаляются. В год такие центры могут произвести десятки тысяч часов качественных данных; некоторые компании уже собрали до миллиона часов полезных данных, что эквивалентно опыту работы опытных мастеров. Проблема недостатка данных в значительной степени решена.
3. Собранные данные имеют ограничения
Хотя модель промышленного сбора данных эффективна, роботы, обученные с помощью этих данных, все равно имеют определенные недостатки. Во-первых, симулированные условия слишком искусственны: все предметы расположены идеально, в реальности могут возникнуть неожиданные ситуации (например, на плите может быть полбутылки соевого соуса, полотенце может быть мокрым, на полу может быть вода, вызывающая скольжение). Во-вторых, стандарты сбора данных различаются между компаниями, что приводит к ошибкам в обучении роботов. В-третьих, скорость выполнения действий в симуляторах низкая, что не соответствует реальным рабочим условиям.
4. Единственный путь к успеху — использовать роботов в реальных условиях
Единственный эффективный подход — сначала довести уровень навыков робота до 70%, затем отправить его в реальные условия работы, где он будет собирать данные для улучшения моделей. Только так можно добиться реального прогресса. Статья приводит пример робота, который после работы в почтовом отделении значительно улучшил свои навыки.
5. Миллион часов данных — это лишь входной билет
Собранные данные еще не гарантируют успеха. Ни одна компания пока не может утверждать, что с таким количеством данных сможет создать идеального робота; отрасль все еще ищет оптимальные подходы. Миллион часов данных — это лишь входной билет на участие в соревнованиях. Победитель будет тот, кто первым получит большое количество данных из реальных условий работы. В ближайшие годы мы увидим все больше роботов, работающих на почтовых отделениях, в ресторанах и на производствах. Эти кажущиеся обыденными сценарии на самом деле являются ключевыми для развития индустрии антропоморфных роботов.