Resumen del contenido principal
En solo seis semanas, Google lanzó tres modelos de la serie Gemini Flash. El más reciente, el 3.8 Flash, mantiene un precio muy asequible (0.75 dólares por millón de tokens de entrada y 3.75 dólares por salida), y sus resultados en pruebas de rendimiento son impresionantes: ha alcanzado el mismo nivel que el Claude Opus 5 en términos de programación y ha superado al GPT-5.6 Sol en capacidad de razonamiento. Además, se lanzó una versión especializada en seguridad cibernética llamada Cyber. Sin embargo, en la práctica, los usuarios comunes han encontrado que, aunque sus resultados en pruebas son buenos, su rendimiento en aplicaciones reales es deficiente. Las demostraciones oficiales dependen de configuraciones especiales, y el modelo carece de resistencia para tareas prolongadas, así como de un manejo detallado de las situaciones. La razón es que el modelo insignia de Google, el Gemini Pro, está teniendo dificultades para ser lanzado y hay una pérdida de talento técnico clave; por lo tanto, Google debe recurrir a modelos más pequeños como el Flash para mantener su presencia en el mercado.
I. El “estudiante sobresaliente” a un precio asequible: rendimiento cercano al de un modelo insignia
El 3.8 Flash es descrito por Google como el “modelo Flash más inteligente”, con un enfoque especial en la programación a largo plazo, el razonamiento complejo y las aplicaciones de agentes profesionales, pero su precio es el mismo que el de su predecesor, el 3.7 Flash.
- Capacidad de programación casi óptima: En la prueba de programación de largo alcance DeepSWE, obtuvo un 73.7%, igualando al Claude Opus 5 (74%), aunque a un quinto del costo de este (2.36 dólares por pregunta contra 11.84 dólares); en la prueba Terminal-Bench 2.1, alcanzó un 89.4%, acercándose por primera vez al umbral del 90%.
- Razonamiento interdisciplinario en la primera categoría: En la prueba HLE (prueba definitiva para humanos que abarca STEM y humanidades), obtuvo un 54.9%, ligeramente superior al Opus 5 (54.4%) y al GPT-5.6 Sol (54.5%).
- Superación en aplicaciones profesionales: En la prueba de agentes financieros Vals V2, obtuvo un 61.4%, superando al GPT-5.6 Sol (53.8%); en la prueba de agentes legales Harvey, tuvo una tasa de éxito del 10%, que es 1.5 veces mayor que la del Opus 5.
- Versión Cyber para seguridad: Tiene una tasa de detección de vulnerabilidades del 86.2% (superior a la del GPT-5.5-Cyber) y el costo de reparación de estas vulnerabilidades es más bajo; el equipo de Chrome utilizó este modelo para generar parches correctos, que son 2.6 veces más eficaces que los de otros modelos, aunque solo están disponibles para “defensores de confianza”.
El secreto de su éxito radica en que, frente a problemas complejos, el 3.8 Flash piensa varios pasos más allá: por ejemplo, en tareas de programación, genera 36,000 tokens adicionales y ejecuta 41 pasos más que el 3.7 Flash. Aunque el costo real de tareas complejas aumenta ligeramente (de 0.4 dólares a 0.58 dólares), sigue siendo mucho más económico que los modelos insignia.
II. Debilidades en pruebas reales: buenos resultados en pruebas, pero problemas en uso diario
En las demostraciones oficiales, el 3.8 Flash puede construir castillos en 3D o usar versiones de Google Maps en modo DOS, pero los usuarios comunes notan grandes diferencias en el rendimiento real:
- Configuraciones discriminatorias: Las demostraciones utilizan instrucciones de bucle de la plataforma Antigravity y Nano Banana para generar texturas, mientras que los usuarios comunes solo tienen acceso a modelos básicos. Por ejemplo, al crear un helicóptero de Airbus con Three.js, el resultado se obtiene en 109 segundos, pero los componentes del helicóptero son de mala calidad y su movimiento es torpe; la simulación de un cráter volcánico también presenta errores.
- Rápido pero de baja calidad: En el juego Sticky Ball, el 3.8 Flash funciona rápidamente, pero su mecanismo de movimiento y su rendimiento no son comparables al del Kimi K3; en la prueba del mercado de Nueva York, solo se incluyen 6 árboles (menos que los 10 del 3.7 Flash), se omiten elementos como los semáforos y el efecto de desenfoque bajo el agua, y se añaden de forma arbitraria ajustes de cámara y opciones de procesamiento posterior.
- Falta de resistencia para tareas prolongadas: En la prueba Terminal-Bench 4.0 (una tarea más difícil), obtuvo solo un 19.1% (el Opus 5 alcanzó el 51.8%); en la prueba de operaciones en un ordenador OSWorld, obtuvo un 59% (el Opus 5, 75.4%). En la clasificación general de inteligencia, ocupa el octavo lugar, con un rendimiento fuerte en ciertas áreas, pero muestra debilidades en tareas multidisciplinarias.
III. La necesidad urgente de lanzar modelos insignia y la pérdida de talento
La prisa de Google por lanzar el 3.8 Flash no se debe a un avance tecnológico repentino, sino a circunstancias forzadas:
- Retrasos en el modelo insignia: En mayo de este año, Pichai prometió que la nueva versión del Pro estaría disponible en un mes, pero el plan para el 3.5 Pro fue cancelado (sus mejoras no eran tan significativas como las del 3.8 Flash), y el Gemini 4 todavía está en la fase de entrenamiento, lejos de estar listo.
- Pérdida de talento clave: En los últimos mes y medio, figuras clave como Noam Shazeer (pionero en modelos grandes) y Jeff Dean (un personaje central en la IA de Google) han dejado la empresa, lo que ha causado inestabilidad en la organización. La nueva dirección exige acelerar los lanzamientos.
- El Flash como medida de emergencia: El tamaño del modelo Flash es más reducido, y su capacidad de modificación y entrenamiento es mucho menor que la de la serie Pro; varios equipos internos pueden probar diferentes opciones simultáneamente y realizar iteraciones cada tres semanas. En cambio, cualquier ajuste en la serie Pro requiere más recursos de GPU y más tiempo, lo que aumenta los costos de error.
Por lo tanto, los tres modelos lanzados en seis semanas son una forma de “jugar a ganar con pequeños pasos”: dado que el modelo insignia está retrasado, Google debe utilizar modelos más pequeños como el Flash para mantener su presencia en el mercado y no quedarse atrás frente a competidores como OpenAI y Anthropic.
IV. La verdadera posición del Flash: no es el objetivo final, pero sirve para mantener la posición
El Flash no es el objetivo final de Google, pero es la opción más práctica en estos momentos:
- No es un modelo insignia completo: Los problemas detectados en pruebas reales demuestran que todavía está lejos de ser un modelo completo y de alto rendimiento (debilidades en tareas prolongadas y falta de detalle).
- Sin embargo, es suficiente para situaciones de emergencia: Es económico, se actualiza rápidamente y puede competir con modelos insignia en aplicaciones específicas (programación, agentes financieros), lo que ayuda a Google a mantener su cuota de mercado y la atención de los desarrolladores hasta que estén disponibles los modelos Pro y Gemini 4.
En resumen, el Flash es una “solución temporal” para Google: para ganar en el largo plazo, necesita modelos insignia, pero por ahora depende de modelos más pequeños para no quedarse atrás en la competencia por los modelos grandes.
Conclusión
La serie Flash de Google es como un estudiante que destaca en ciertas materias (programación, finanzas) a un precio más bajo que los estudiantes más avanzados, aunque su rendimiento integral no es comparable. La prisa en lanzar estos modelos se debe a retrasos en el desarrollo de modelos insignia y a una pérdida de talento clave. Para los usuarios que necesitan herramientas para tareas específicas (como programación o análisis financiero simple), es una opción muy atractiva; sin embargo, para tareas más complejas, probablemente sea mejor esperar a que estén disponibles los modelos insignia. Para la industria, esto refleja la intensa competencia en el campo de los modelos grandes: nadie se atreve a detenerse, incluso si eso significa “avanzar a pequeños pasos” para mantener su visibilidad.