虎嗅

Погоня за универсальным искусственным интеллектом: множество мировых моделей развиваются параллельно

原文:追逐通用人工智能,世界模型多头并进

Краткое содержание статьи

Статья посвящена так называемым «мировым моделям» в области искусственного интеллекта (ИИ) и отмечает, что существующие большие языковые модели (например, ChatGPT) имеют серьезные недостатки при выполнении задач, требующих физического рассуждения или планирования пространства, из-за отсутствия опыта реального мира. «Мировые модели», способные симулировать последствия действий в реальности, считаются ключевым шагом на пути к созданию универсального ИИ (AGI). В статье также рассматриваются истоки этих моделей в когнитивных науках, прогресс их коммерческого внедрения (поступление капитала, участие ведущих компаний), существующие разногласия в технических подходах (воссоздание изображений на уровне пикселей против абстрактного представления реальности), а также препятствия на пути к достижению цели — недостатки в таких областях, как временная абстракция и метакогнитивные способности.

Подробный анализ

1. «Смертельные недостатки» больших языковых моделей

Примером может служить вопрос: «Что произойдет, если стакан упадет на пол?» Большая языковая модель может ответить сочетанием специализированных терминов (гравитационная потенциальная энергия, упругие волны), но пяти-шестилетний ребенок скажет просто: «Стакан разобьется». Причина в том, что основа работы таких моделей — предсказание следующего слова на основе обширного текстового обучения, однако они никогда не видели, как стакан падает; без опыта реальности они не могут по-настоящему понять физические законы. Например, при навигации модель может запомнить маршрут, но не сможет его пройти, так как у нее нет внутреннего представления о пространстве («умного картографа»), в отличие от человека; подобные задачи, как складывание одежды, для нее совершенно невозможны.

2. Концепция мировых моделей

Идея мировых моделей возникла еще в 1943 году у психолога Крека; по его мнению, человеческий мозг содержит «маленькую модель», которая позволяет предвидеть последствия различных действий (например, мысль о том, что стакан разобьется, препятствует намеренному его повреждению). Позднее теории когнитивной обработки утверждали, что восприятие реальности основано на постоянном прогнозировании с последующей корректировкой на основе информации от органов чувств. Исследователи ИИ стремятся дать своим системам такую же способность — предвидеть результаты действий перед их выполнением, чтобы избежать ошибок в реальности. Например, лауреат Тьюринговской премии Ян Ликун считает, что ИИ без способности к предвидению не является настоящим интеллектом; интеллект — это возможность использовать мысли для испытания различных вариантов действий.

3. Интерес к мировым моделям со стороны инвесторов

За последние два года мировые модели привлекли большое внимание инвесторов и технологических гигантов:

  • Компания World Labs, основанная известным специалистом по ИИ Ли Фэйфэй, привлекла 230 миллионов долларов для разработки системы пространственного интеллекта;
  • Ян Ликун покинул Meta и основал лабораторию AMI, получившую 1 миллиард долларов на исследования мировых моделей;
  • Система Dreamer4 от Google DeepMind, изучив множество видео из игры «Мой мир», может самостоятельно выполнять сложные задачи (например, сбор ресурсов или создание инструментов). Однако все эти разработки находятся на начальном этапе: например, система Marble от World Labs представляет собой лишь генератор 3D-сцен, а Dreamer4 — игровой симулятор; до создания роботов, способных выполнять домашние задачи, еще далеко.

4. Разногласия в технических подходах

Существуют два основных подхода к реализации мировых моделей:

  • Воссоздание изображений на уровне пикселей: системы типа Dreamer4 пытаются точно воссоздать каждый пиксель после выполнения действия; преимущество — высокая детализация, но требуется большое количество данных;
  • Абстрактное представление: подход Яна Ликуна фокусируется на ключевых информационных аспектах, необходимых для рассуждений (например, стакан разобьется, но не нужно знать положение каждого осколка); преимущество — меньшее количество данных, однако возникает вопрос: достаточно ли абстрактной информации для сложных рассуждений? Например, система V-JEPA2 может изучать закономерности движения объектов, но еще не доказала своей эффективности в условиях открытой среды. Оба подхода имеют свои достоинства; руководитель Dreamer4 считает, что абстрактное представление может быть более эффективным.

5. Препятствия на пути к AGI

Даже если мировые модели станут более совершенными, до достижения уровня AGI (интеллекта, способного делать все, как человек) остается множество проблем:

  • Временная абстракция: ИИ может предсказывать только события на ближайшую секунду, но не способно планировать долгосрочные действия;
  • Метакогнитивные способности: ИИ не может понимать своих знаний и ошибок;
  • Сложные причинно-следственные связи и понимание чужого мышления: люди могут анализировать сложные ситуации (например, «из-за дождя дороги скользкие») и предполагать намерения других. Мировые модели являются необходимым, но не достаточным условием для достижения уровня AGI.

Заключение

Мировые модели — важный шаг на пути к созданию универсального ИИ, однако они не являются «панацеей»; для того чтобы ИИ действительно начал мыслить как человек, предстоит преодолеть еще множество препятствий.