虎嗅

Новый формат Image2.5 настолько совместим с другими технологиями, что его можно использовать для создания анимированных изображений (анимаций)? Да, но работает это нестабильно.

原文:新出的Image2.5一致性狠到能做动图?能,但不稳定

Здравствуйте! Я ваш друг-журналист в области финансов и экономики. Сегодня мы поговорим о только что выпущенной OpenAI модели GPT-Image 2.5.

Эта статья от издания “Зи Вэй” раскрывает очень интересный бизнес- и технологический феномен: между “впечатляющими” техническими возможностями и их “стабильностью” часто существует огромный разрыв.

Чтобы вы легко поняли этот подробный обзор, я сначала выделил основные выводы, а затем разъясню логику событий с пяти точек зрения.

📌 Краткое содержание

Новая модель OpenAI GPT-Image 2.5 добилась значительного прогресса в создании последовательных изображений и теоретически может использоваться для создания анимированных изображений (GIF). Пользователи сети даже придумали способ, позволяющий использовать эту модель для создания видео из нескольких изображений. Однако в реальных тестах было обнаружено, что модель крайне нестабильна: при более сложных действиях, множестве персонажей или особых ракурсах возникают проблемы (дрожание изображения, неправильное положение конечностей). В настоящее время GPT-Image 2.5 скорее представляет собой “полуфабрикат с большим потенциалом” и еще далека от замены профессионального анимационного программного обеспечения, но ее появление означает начало нового этапа в развитии технологий генерации изображений, направленного на достижение стабильности.

---

🔍 Подробный анализ с пяти точек зрения

1. Технические достижения: от случайных результатов к стабильности

Простым языком:

Раньше алгоритмы ИИ для создания изображений работали непредсказуемо. Например, если просить их нарисовать человека, они могли справиться с задачей, но при изменении цвета одежды лицо могло исказиться или фон измениться. Это называется “дрожанием изображения” или “смещением элементов”.

Главное преимущество GPT-Image 2.5 в том, что она “слушается указаний пользователя и не делает ошибок”. Она изменяет только те элементы изображения, которые указаны, оставляя остальные неизменными. Такая стабильность делает ее особенно ценной.

  • Почему это важно? Раньше для создания анимации требовалось использование профессионального программного обеспечения (например, After Effects), что сопровождалось высокими затратами. Если ИИ сможет стабильно генерировать последовательные изображения, это существенно снизит сложность и стоимость процесса создания анимации.

2. Как пользователи сети используют модель для создания видео?

Простым языком:

Официально OpenAI не предоставила инструмент для создания видео с использованием GPT-Image 2.5, но пользователи обнаружили способ, позволяющий это сделать:

1. Запросить модель на создание большого изображения, содержащего 16 маленьких квадратов (4x4), каждый из которых представляет собой отдельный момент движения.

2. Использовать другой ИИ-инструмент (ChatGPT Work) для разделения этого изображения на 16 частей.

3. Собрать полученные квадраты в GIF-анимацию.

Это похоже на создание “комикса”, который затем быстро воспроизводится как анимация.

  • Пример Higgsfield: Команда продемонстрировала максимально возможный уровень качества такого подхода, создав анимацию превращения Трансформеров с плавными переходами, схожими с реальными кадрами. Это вызывает большие ожидания относительно потенциала GPT-Image 2.5.

3. Реальные результаты тестов

Простым языком:

Команда, проводившая тестирование, не преувеличивала результаты, а провела тщательную проверку модели. Было обнаружено, что модель справляется с простыми действиями, но сталкивается с проблемами при более сложных сценах:

  • Простые движения: работают без проблем и могут повторяться.
  • Сложные движения: начинают дрожать, и возникают ошибки (неправильное положение конечностей). Например, на 6-м кадре нога находится справа, на 7-м — слева, а на 13-м снова справа. Это создает нелогичные эффекты в анимации.
  • Взаимодействие нескольких персонажей: при одновременных движениях персонажей изображение начинает дрожать, и контроль над ними теряется.
  • Особые ракурсы: при повороте камеры изображение искажается, как будто камера внезапно перевернулась.

Вывод: В настоящее время модель хорошо справляется с изображениями на прозрачном фоне с одним персонажем и простыми движениями, но стабильность снижается при более сложных сценах.

4. Почему даже простые сцены представляют сложности?

Простым языком:

Команда попыталась создать анимацию превращения Трансформеров из 30–72 отдельных изображений. Процесс занял много времени (30 минут), и результат оказался неудовлетворительным даже с использованием самой совершенной версии модели (Sunburst Max). Это связано с тем, что ИИ лучше справляется с изображениями, а не с точным воспроизведением физических законов. Для реалистичного изображения механических движений ему не хватает точности.

  • Необходимость комбинации моделей: для получения качественного результата требуется сочетание модели генерации изображений с языковой моделью (например, ChatGPT Work), которая помогает проверять и исправлять ошибки.

5. Бизнес-перспективы

Простым языком:

Несмотря на некоторые разочарования, с экономической точки зрения GPT-Image 2.5 имеет большое значение:

  • Снижение затрат: раньше для создания качественных изображений требовалось много попыток, теперь это стало возможно с меньшим количеством ошибок.
  • Снижение зависимости от профессионального программного обеспечения: ИИ может выполнять большую часть работ по обработке изображений.
  • Перемена конкурентных факторов: в будущем главным критерием станет не качество изображений, а стабильность и экономия затрат при выполнении сложных задач.

Советы для пользователей:

  • Не ожидайте, что модель сможет создавать качественные анимации: она все еще нестабильна и может давать ошибки при сложных сценах.
  • Идеально подходит для простых анимаций: логотипов, эмодзи, динамических рекламных постеров и т. д.
  • Обратите внимание на интеграцию с другими инструментами: будущие победители в этой области будут использовать комплексные системы, способные автоматически проверять и исправлять ошибки.

---

💡 Заметка журналиста

Появление GPT-Image 2.5 напоминает ситуацию с “талантливым, но импульсивным стажером”: у нее огромный потенциал, но при работе с сложными задачами возникают проблемы. Для предприятий и частных пользователей это отличный инструмент для уменьшения затрат на создание простых изображений. В будущем главными критериями станут стабильность, экономия затрат и возможности автоматической коррекции ошибок.

В заключение: Технология впечатляющая, но ее использование требует осторожности. Снижение затрат на создание изображений повышает ее привлекательность, но ожидания должны быть реалистичными.