Резюме основного содержания
Это был круглый стол в отрасли, в котором приняли участие молодые ученые из различных гонконгских вузов в области искусственного интеллекта. В ходе обсуждения не было никаких пустых разговоров о новых концепциях или трендах; все внимание было сосредоточено на анализе практических проблем, связанных с современными «мировыми моделями» искусственного интеллекта, определения которых остаются крайне нечеткими. Были опровергнуты распространенные заблуждения, например, что способность ИИ генерировать видео уже является проявлением мировых моделей, а также мифы о том, что общие роботы можно создать на основе видеоматериалов с интернета или что вскоре появится робот-аналог ChatGPT. Ученые также указали на то, что утверждения о необходимости миллионов часов обучения роботов являются необоснованными. В итоге было признано, что технологический путь развития мировых моделей еще не определен и что это не только игра для крупных компаний; маленькие команды и стартапы могут найти свои возможности для прорыва, работая в конкретных сферах.
---
Популярное объяснение по пунктам
1. 99% существующих «мировых моделей» на рынке — это недоработанные версии
Многие считают, что способность ИИ генерировать видео, на которых, например, кошка опрокидывает стакан, уже является проявлением мировых моделей, но это совершенно разные вещи. Современные алгоритмы генерации видео просто собирают пиксели так, чтобы они соответствовали знакомому визуальному восприятию пользователя, но они не понимают, что стакан может разбиться при падении или что его может скрыть угол стола. Настоящая мировая модель должна уметь предсказывать поведение реального мира: например, знать, насколько далеко скользнет стакан и сколько воды проллетит, даже если его не видно. Команды, занимающиеся генерацией видео, разработкой беспилотных систем или робототехникой, используют термин «мировая модель», но идут совершенно разными путями и еще далеки от слияния их усилий.
2. Нельзя создать универсального робота, используя видео с интернета
Раньше многие верили, что ChatGPT стал универсальной моделью благодаря анализу всех текстов с интернета, но такой подход не работает. Видео с интернета показывают успешные сцены, но роботам нужны данные о ситуациях, в которых они могут ошибиться. Кроме того, данные о движениях человека с помощью камер не могут заменить реальный опыт взаимодействия с роботами.
3. Еще не время для роботов с «телесным интеллектом»
Компании, разрабатывающие роботов, часто используют демо-версии, чтобы показать их способность выполнять простые команды (например, открывать двери или наливать воду), и называют это приходом «роботов с телесным интеллектом», но на самом деле это еще не серьезный прогресс. Чтобы роботы стали полезными, их нужно сначала применять в конкретных промышленных сценариях, например, для работы с промышленными механизмами.
4. Утверждения о миллионах часах обучения — это маркетинговые трюки
Компании часто хвастаются большим количеством часов обучения своих роботов, но это не отражает их реальных достижений. Например, робот-пылесос может целыми днями кружить по одному и тому же маршруту, не учась ничему новому. Более полезными будут данные о том, как робот взаимодействует с реальными предметами в реальных условиях.
5. Будущие роботы не будут нуждаться в индивидуальной настройке для каждого типа тела
Современные роботы часто требуют переобучения при смене конструкции, что существенно увеличивает затраты. Но будущие мировые модели смогут адаптироваться к различным типам тел (руки с разным количеством пальцев, разной силой и т. д.), что снизит затраты на их производство и использование.