虎嗅

Русский перевод: GPT-6 распознает все возможные объекты: что остается от моделей с физической основой (англ. “embodied base models”)?

原文:GPT-6认出了万物,具身基座模型还剩什么

“Снижение уровня конкуренции” в индустрии робототехники? Как GPT-6 Astra меняет правила развития технологий антропоморфной интеллектуальности?

Здравствуйте, я ваш финансовый журналист и экономист. Сегодня мы рассмотрим очень интересную глубокую статью об индустрии робототехники.

Вкратце, за последние два года индустрия антропоморфной интеллектуальности развивала следующую концепцию: “Хотя большие модели и очень умны, они не понимают физического мира, поэтому нам нужно специально обучать роботов отдельным ‘мозгам’ (базовым моделям)”.

Однако появление недавно выпущенного OpenAI GPT-6 Astra поставило эту концепцию под сомнение. Astra продемонстрировал удивительные способности: без специального обучения, на основе одной лишь картинки, он смог создать интерактивную симулированную среду.

Это похоже на ситуацию, когда человек, никогда не бывавший на кухне, посмотрел на фотографию блюда, узнал все ингредиенты, понял, где их нужно разместить, и даже смог воссоздать процесс приготовления (хотя вкус, возможно, будет не таким, как на деле).

Для стартапов, вкладывающих много средств в обучение роботических “мозгов”, это серьезный сигнал к бдительности. Далее я разберу эту статью на пять ключевых аспектов, чтобы вы полностью поняли изменения в индустрии.

---

1. Основное событие: от “описания по картинке” к “созданию среды” – что сделал Astra?

Сначала давайте разберем, какие способности продемонстрировал Astra и почему это так важно.

Ранее роботам было очень сложно понять физический мир. Например, если вы показали роботу фотографию стола с чашкой и жидкостью, он мог только определить, что это чашка и что это жидкость.

Но теперь Astra смог создать интерактивную симуляцию, не проходя специального обучения. Он:

  • определил предметы: понял, что это контейнер и жидкость;
  • понял пространственные отношения: понял, что жидкость находится в контейнере, а контейнер на столе;
  • воссоздал детали: даже очень точно воспроизвел цвет жидкости;
  • создал программу: преобразовал эти статические изображения в работающую сценарию.

Ключевой момент: Astra не проходил специального обучения для этой задачи. Он просто изучил огромное количество изображений, видео и руководств с интернета.

Единственный недостаток: он не смог симулировать химическую реакцию при смешивании жидкостей. Он знает, как выглядит вода, но не понимает, что произойдет при смешивании воды с серной кислотой. Это показывает, что он понимает визуальные данные, но еще не освоил более сложные физические законы.

Простой вывод: Astra похож на стажера, который много читает, но никогда не работал. Он узнает 99% обычных предметов и знает, как они используются, но не имеет практического опыта.

---

2. Кризис восприятия: “Узнавание яблока” больше не является преимуществом

Статья отмечает, что появление GPT-6 существенно сокращает возможности стартапов в области антропоморфной интеллектуальности, особенно тех, кто все еще акцентирует внимание на базовых моделях.

Раньше, если компания могла заставить робота узнать яблоко на столе, это считалось техническим преимуществом. Теперь же благодаря огромному объему обучающих данных (включающих все изображения, видео и научные статьи с интернета), GPT-6 создал обширный “атлас физического мира”.

  • Он никогда не держал в руках чашку, но видел, как это делают многие люди;
  • Он никогда не был на фабрике, но узнает, что такое роботизированные руки и конвейеры;
  • Он никогда не открывал ящики, но знает, где находятся ручки и как их открывать.

Это означает, что способности к определению предметов и пониманию сцен становятся общими навыками, как и умение читать. Для стартапов, чья основная продающаяся функция заключается в способности робота понимать команды и узнавать предметы, конкуренция с такими гигантами, как OpenAI, становится очень серьезной. Создание собственных “больших и всеобъемлющих” универсальных моделей требует больших затрат и вряд ли принесет дополнительных преимуществ.

Простой вывод: Раньше умение “понимать” считалось ценным навыком, теперь это стандарт. Если ваша компания зависит только от этого навыка, вы сталкиваетесь с серьезной конкуренцией.

---

3. Границы возможностей: почему Astra не смог симулировать химическую реакцию?

Здесь есть важный момент, который отличает универсальные модели от антропоморфных роботов:

Astra смог воссоздать цвет жидкости, но не смог симулировать ее химическую реакцию. Почему?

  • Цвет – это визуальная информация, которую можно изучить из множества изображений;
  • Химическая реакция требует более точных данных и моделей, учитывающих свойства материалов и физические законы.

Это показывает, что понимание предметов не означает способности надежно ими управлять. Робот может точно определить местоположение предметов, но не знает, какой силой нужно их двигать, не знает, может ли он упасть при небольшом смещении, как скорректировать движения при колебаниях жидкости и какова трение разных материалов.

Простой вывод: Astra – это теоретик, который знает, как нужно действовать, но не имеет практического опыта. Ценность антропоморфных роботов заключается в том, чтобы заполнить этот пробел в их возможностях.

---

4. Перенос ценностей: от “мозга” к “практическому опыту”

Теперь, когда универсальные модели решили проблемы восприятия, где же возможности для стартапов в области антропоморфной интеллектуальности? Статья предлагает следующее объяснение: ценность смещается в другом направлении.

Будущая структура индустрии может выглядеть следующим образом:

1. Верхний уровень (когнитивный): обеспечивается универсальными моделями вроде GPT-6. Они понимают команды, определяют предметы и планируют действия.

2. Средний уровень (предсказание действий): выполняется антропоморфными моделями. Они предсказывают, как изменится среда после выполнения действий.

3. Нижний уровень (управление): связан с конкретными роботами. Здесь решаются вопросы точности, контроля силы и безопасности.

Новый барьер для стартапов – не размер параметров моделей, а наличие данных о реальных действиях роботов.

  • Обычные видеоданные: показывают модели, как люди действуют (универсальные модели уже достаточно хорошо их изучили);
  • Данные о взаимодействии с роботами: записывают, как руки робота двигаются, какая сила приложена, успешно ли произошло захват и как робот восстанавливается после неудачи.

Такие данные о взаимодействии с роботами включают визуальную, тактильную и физическую информацию, а также результаты действий. Их сложно получить с интернета, и их невозможно автоматически собрать с помощью вычислительных мощностей.

Простой вывод: Не стоит больше создавать универсальные модели, которые знают все; нужно собирать данные о реальных действиях роботов. Компании, обладающие такими данными, будут иметь преимущество на следующем этапе развития индустрии.

---

5. Заключение: стартовая линия сместилась, но игра еще не закончилась

В заключение статья говорит, что GPT-6 не уничтожил индустрию антропоморфной интеллектуальности, а лишь сдвинул ее стартовую линию вперед.

  • Раньше: главной задачей было научить роботов понимать мир;
  • Теперь: главная задача – научить роботов безопасно и точно влиять на реальный мир.

Если компания сосредотачивается только на понимании предметов и языка, она будет отставать от GPT-6 и в конечном итоге оказаться на периферии. Но если компания накопит много данных о реальных действиях роботов, GPT-6 может стать ее “верхним мозгом”, а сама компания – неотъемлемой частью системы.

Заключение для инвесторов:

  • Будьте осторожны: компании, которые все еще говорят о необходимости обучения универсальных роботических моделей и не имеют эксклюзивных данных о реальных действиях роботов, находятся в большом риске;
  • Будьте оптимистичны: компании, специализирующиеся на конкретных сценариях (например, на фабриках или домашнем использовании) и накапливающие данные о взаимодействии роботов, имеют большие перспективы.

В общем: Умение понимать мир становится общим навыком, но важнее доказать свою способность безопасно и точно влиять на реальный мир. Не стоит соревноваться с AI в количестве знаний, нужно соревноваться в надежности и эффективности действий роботов.