Краткое содержание анализа
За всего шесть недель Google выпустил три новых больших модели из серии Gemini Flash. Последняя модель — 3.8 Flash — остается доступной по доступной цене (0,75 доллара за миллион токенов за ввод и 3,75 доллара за вывод). Показатели ее производительности впечатляют: по программированию она сравнялась с Claude Opus 5, а по интеллектуальным задачам превзошла GPT-5.6 Sol. Также была выпущена специализированная версия модели для обеспечения кибербезопасности — Cyber. Однако при практическом использовании обычные пользователи отмечают, что, хотя показатели производительности высоки, модель не справляется с реальными задачами. Официальные демонстрации требуют специальной конфигурации, модель плохо справляется с длительными задачами, а обработка деталей недостаточно качественна. Причина в том, что флагманская модель Google Gemini Pro сталкивается с трудностями в разработке, а ключевые специалисты ушли из компании, поэтому Google вынужден полагаться на меньшие по масштабу модели серии Flash, чтобы сохранить свою позиции на рынке.
I. Модель с высокими показателями производительности по доступной цене
3.8 Flash называется Google «самой умной моделью серии Flash». Особое внимание уделено улучшению производительности в долгосрочных программных задачах, сложных интеллектуальных задачах и сценариях работы профессиональных агентов. Цена модели осталась прежней, как у предыдущей версии 3.7 Flash.
- Программирование на высоком уровне: По результатам теста DeepSWE модель показала процентное достижение 73,7%, сравнявшись с Claude Opus 5 (74%), при этом стоимость ее использования в 5 раз ниже (2,36 доллара за задачу против 11,84 доллара у Opus 5). В тесте Terminal-Bench 2.1 модель достигла 89,4%, впервые приблизившись к 90%-ному порогу.
- Интеллектуальные способности на уровне лидеров: По результатам теста HLE (охватывающего науку, технику, инженерию и искусство), модель получила 54,9% баллов, что немного выше, чем у Opus 5 (54,4%) и GPT-5.6 Sol.
- Превосходство в специализированных сценариях: По результатам тестов для финансовых агентов (Vals V2) модель показала 61,4% против 53,8% у GPT-5.6 Sol; показатель прохождения тестов для юридических агентов (Harvey) составил 10%, что в 1,5 раза выше, чем у Opus 5.
- Специализированная версия для кибербезопасности: Модель обнаруживает 86,2% уязвимостей (превосходя GPT-5.5-Cyber), стоимость их устранения также ниже; команда Chrome использовала эту модель для создания более качественных патчей, чем у других моделей, однако доступ к этим патчам ограничен лишь доверенными пользователями.
Секрет успеха 3.8 Flash заключается в том, что при решении сложных задач модель применяет дополнительные алгоритмы: например, при программировании она генерирует на 36 000 токенов больше и выполняет на 41 шаг больше операций, чем 3.7 Flash. Хотя стоимость выполнения сложных задач немного выше (от 0,4 до 0,58 доллара), в целом модель все равно дешевле флагманских решений.
II. Реальные результаты при использовании
На официальных демонстрациях модель 3.8 Flash демонстрирует высокую производительность (например, создание 3D-замков или работа с картами Google в режиме DOS), но при использовании обычными пользователями выявляются серьезные недостатки:
- Разница в конфигурации: Для демонстраций используется специальная платформа Antigravity и инструмент Nano Banana для генерации текстур, в то время как обычные пользователи имеют доступ только к базовым версиям модели. Например, при создании 3D-модели вертолета Airbus результаты получаются неудовлетворительными (неровные поверхности, неестественное движение модели); при моделировании вулкана возникают проблемы с реалистичностью изображения.
- Высокая скорость, но низкое качество: При выполнении игры Sticky Ball модель работает быстро, но механика движения и графика уступают модели Kimi K3. В тестах на сценарии нью-йоркского города использовано всего 6 деревьев (вместо 10 у 3.7 Flash); пропущены такие элементы, как пешеходные переходы и эффекты размытия на воде; кроме того, в модели добавлено слишком много предустановленных настроек камер и параметров постобработки изображений.
- Недостаточная выносливость при выполнении длительных задач: По результатам теста Terminal-Bench 4.0 модель показала процентное достижение 19,1% (у Opus 5 — 51,8%); в тестах на работу с компьютером в симуляции OSWorld — 59% (у Opus 5 — 75,4%). В общем рейтинге модель занимает восьмое место; в отдельных категориях она демонстрирует высокие результаты, но при выполнении многопрофильных задач проявляются ее недостатки.
III. Причины срочного выпуска модели Flash
Срочность выпуска модели Flash обусловлена серьезными проблемами в разработке флагманской модели Gemini Pro:
- Задержки с выпуском флагманской модели: В мае этого года Суриш Пичаи обещал, что новая версия Gemini Pro выйдет через месяц, но планы были изменены; версия 3.5 Pro так и не была выпущена, а работа над Gemini 4 затянулась.
- Утечка ключевых специалистов: За последние полмесяца компанию покинули такие ведущие специалисты, как Noam Shazeer и Jeff Dean, что привело к организационным трудностям. Новое руководство требует ускорения процесса разработки.
- Flash как временная мера: Модели серии Flash имеют меньший масштаб, что позволяет быстрее вносить изменения и проводить тренировки; несколько внутренних команд могут одновременно работать над различными вариантами реализации, что ускоряет процесс разработки. В случае с флагманской серией Gemini Pro для каждых изменений требуется больше ресурсов (GPU и времени), что увеличивает затраты на разработку.
IV. Реальное место модели Flash в стратегии Google
Flash не является конечной целью Google, но в текущих условиях представляет собой наиболее практичный вариант:
- Не флагманская модель: Реальные тесты показали, что модель еще далека от идеала (слабые результаты при выполнении длительных задач и недостаточная обработка деталей).
- Эффективное решение временных проблем: Благодаря низкой стоимости и быстрой разработке модель позволяет Google сохранять свои позиции на рынке в условиях нестабильности.
В целом, модель 3.8 Flash демонстрирует значительные успехи в некоторых аспектах, но при использовании обычными пользователями выявляются серьезные недостатки. Срочность ее выпуска связана с серьезными проблемами в разработке флагманской модели Gemini Pro и нестабильностью внутренней ситуации в компании.