虎嗅

ГPT-6 уже здесь: мы обсудили с несколькими экспертами вопросы защитных механизмов и препятствий на пути развития технологий персонализированного интеллекта.

原文:GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

GPT-6 появился: существует ли ещё “защитный барьер” для антропоморфных интеллектов? — Глубокий анализ тревог, возможностей и основных аспектов

Здравствуйте, я ваш финансовый журналист. Недавно в технологическом сообществе разразился скандал: OpenAI выпустил версию GPT-6 под названием Astra и заявил о намерении создавать роботов человекоподобного вида. Это как великан с мечом для убийства драконов, вдруг говорящий: “Я собираюсь заняться земледелием”.

Для стартапов, занимающихся разработкой антропоморфного интеллекта (hardware и алгоритмы для роботов), это не только давление, но и кризис существования: если ИИ окажется достаточно умным, понадобятся ли ещё специалисты по робототехнике? Может ли это лишить меня работы?

Сегодня мы рассмотрим этот вопрос, исходя из мнений многих экспертов с конференции на Набережной (например, Чжу Чжэн из JiJia Vision, Чжу Син из Ant LingBo, Ван Цянь из Zi Bian Liang и других), и объясним всё простым языком: что же на самом деле представляет собой GPT-6? Где находится защитный барьер для антропоморфного интеллекта? Следует ли нам паниковать или сохранять спокойствие?

---

I. Волк действительно пришёл: почему все вдруг начали тревожиться?

Прежде всего, нужно признать, что эта тревога имеет веские основания и не является беспочвенной.

1. Ощущение “уничтожающего удара”

Раньше считалось, что создание языковых моделей (например, ChatGPT) и роботов — это два разных процесса. Но теперь GPT-6 Astra не только может общаться, но и управлять механическими руками. На демонстрационных видео он умеет брать палочки для еды и ставить их в стаканы очень уверенно.

Чжу Чжэн из JiJia Vision сказал прямо: “Волк уже здесь, прекратите мечтать”. Его логика такова: языковые модели уже “поглотили” многомодальные функции (восприятие изображений, звуков), и теперь они начинают распространяться на антропоморфный интеллект. К тому же компании вроде OpenAI обладают преимуществами в области талантов, вычислительных мощностей и финансирования. Если они решат вмешаться лично, стартапам будет трудно соперничать.

2. Срочность времени

Чжу Чжэн считает, что ближайшие один-два года являются критическим периодом. Стартапы в области антропоморфного интеллекта пока не создали настоящих, неподдающихся копированию защитных барьеров. Если гиганты войдут на рынок, они могут быстро устранить технологический разрыв и вытеснить стартапы, которые всё ещё работают над первыми поколениями роботов.

**3. Суть тревоги: страх быть “досрочно обеспеченными”

Суть тревоги заключается в том, что ценность антропоморфного интеллекта раньше требовала нескольких лет работы стартапов для её подтверждения и реализации. Но теперь компании, разрабатывающие большие языковые модели, могут просто выпустить более совершенную модель и получить всю выгоду.

---

II. Не спешите плакать: путь больших моделей в физический мир не так уж прост

Хотя тревога вполне оправдана, на той же конференции были и спокойные голоса. Чжу Син из Ant LingBo и Ван Цянь из Zi Bian Liang задали важный вопрос: если OpenAI настолько силен, почему бы им не заняться разработкой автономного вождения и не поглотить Tesla?

1. “Понимание принципов” не означает “умение работать”

Языковые модели хороши в обработке семантики и логики, например, они знают, что такое “стакан” и что означает команда “поставить стакан на стол”. Но физический мир сложен, динамичен и полон факторов, влияющих на взаимодействие.

  • Семантический уровень (мозг): знание местоположения объектов и направления их перемещения — GPT-6 здесь сильный.
  • Физический уровень (руки и ноги): знание необходимой силы, точного угла движений и способов компенсации непредвиденных ситуаций — это слабое место GPT-6 на данный момент.

2. Разрыв между данными и проверкой

Прогресс языковых моделей основан на огромном количестве программных данных и совершенной системе проверки. Прогресс в генерации видео не решает проблем контроля движений роботов.

Компаниям, разрабатывающим большие модели, также нужно дополнить свои возможности:

  • Реальные данные: данные о неудачах роботов в реальном мире.
  • Адаптация к аппаратуре: разные механические руки и датчики требуют разных стратегий управления.
  • Система проверки: как доказать, что робот действительно правильно выполнил задачу? Для этого нужна сложная система оценки.

3. Разрыв в индустриальных возможностях

Чжу Син сравнил это с автономным вождением: даже если модель сильна, это не значит, что она сможет работать без понимания конкретных сценариев и накопления опыта.

---

III. Анализ реальности: на что способен GPT-6 и на что нет?

Чтобы понять реальное положение GPT-6 в области антропоморфного интеллекта, команда Xu HuaZhe из Breakout Robot и RoboDojo провела конкретные тесты. Результаты интересны: GPT-6 не является ни “богом”, ни “бесполезным инструментом”, а скорее мощным консультантом.

1. Сильные стороны: семантика и понимание пространства

В тестах Astra показал отличные результаты:

  • он умеет распознавать объекты на столе.
  • он может брать тонкие палочки для еды и даже ставить их в стаканы.
  • он может планировать действия, не связанные с прямым захватом объектов.

Это говорит о том, что GPT-6 очень сильен в плане определения целей и понимания пространственных отношений.

2. Слабые стороны: сложные задачи и точные действия

Однако при более сложных задачах (например, поднятии предметов палочками, складывании одежды, передаче предметов руками) результаты Astra оставляют желать лучшего.

Причина: в физическом взаимодействии существует множество невидимых факторов (трение, упругость объектов, изменение центра тяжести), которые невозможно учесть только на основе визуальных данных; для их устранения требуются данные от сенсоров и реальные корректировки в реальном времени.

3. Ключевые данные: комбинированный подход — лучший вариант

Исследования RoboDojo показали, что комбинация универсальных способностей GPT-6 и специализированных моделей для управления роботами дает наилучшие результаты:

  • Прямое управление GPT-6: успех 26%.
  • Совместное управление GPT-6 и специализированной моделью: успех 48%.
  • Детали: GPT-6 корректирует только 14,4% действий, остальные 85,6% выполняются специализированной моделью.

Заключение: GPT-6 улучшает возможности системы, но не заменяет необходимость в специализированных алгоритмах для управления роботами.

---

IV. Где находится защитный барьер? Переосмысление понятия “барьера”

Если GPT-6 настолько силен, где же защитный барьер для стартапов в области антропоморфного интеллекта? Раньше говорили, что ключевым фактором являются данные, но теперь это мнение нуждается в переоценке.

1. Размывание “данных барьера”

Ли Тяньюй из YuanCe Future рассказал о новой тенденции: они начали использовать GPT-6 для создания трёхмерных симуляций.

  • Раньше: создание таких симуляций требовало много времени и затрат.
  • Теперь: GPT-6 может быстро генерировать логичные и полные 3D-сцены.

Это означает, что наличие большого количества данных больше не является преимуществом, поскольку стоимость их получения снижается. Преимущества, основанные на накоплении данных, утрачиваются из-за возможностей универсальных языковых моделей.

2. Настоящий барьер: способность постоянно находить проблемы

Ключевым фактором защиты является способность определять, в каких ситуациях роботы могут потерпеть неудачи, собирать данные об этих неудачах и использовать их для улучшения продуктов.

3. Физический подход vs. семантическая настройка

Шэнь Юйцзюнь из Ant LingBo и Минь Вэй из YingShen Intelligence подчеркнули важность физических законов в разработке роботов:

  • Старый подход: настройка моделей на основе языковых или видеомоделей делает их уязвимыми для обновлений.
  • Новый подход: разработка моделей, учитывающих физические законы и изменения в пространстве, делает их более устойчивыми к технологическим изменениям.

---

V. Будущее: не “кто поглотит кого”, а сосуществование и разделение труда**

Гипотеза о “нулевом исходе” не соответствует реальности. Появление GPT-6 не означает конца индустрии антропоморфного интеллекта, а скорее её перестройку.

1. Инфраструктура vs. приложения

Минь Вэй считает, что в будущем OpenAI может стать поставщиком инфраструктуры, подобной “сети водоснабжения, электроснабжения и связи”.

  • OpenAI/Anthropic: предоставляет мощные универсальные возможности для работы с данными.
  • Стартапы в области антропоморфного интеллекта: занимаются интеграцией аппаратного обеспечения, адаптацией к конкретным сценариям, оптимизацией физического взаимодействия и обслуживанием продуктов.

Коммерческая логика: в готовом роботе способности языковых моделей могут составлять менее половины ценности; остальная часть зависит от понимания физических законов, механической инженерии и умения работать в сложных условиях. Эти задачи гиганты не всегда хотят выполнять и не могут полностью их аутсорсировать.

2. Обратное влияние роботов на ИИ

Роботы могут предоставлять ценную информацию о физическом мире, которая необходима для совершенствования ИИ:

  • Неудачи роботов могут помочь ИИ лучше понять гравитацию, трение и другие факторы.

Заключение: ф