虎嗅

Gemini3.8 lance une attaque surprise tard dans la nuit, tous les samedis et dimanches… Qu’est-ce qui presse vraiment Google ?

原文:Gemini3.8 Flash深夜突袭,六周三更,谷歌到底在急什么?

Résumé des principaux points

En seulement six semaines, Google a lancé trois nouveaux modèles de la série Gemini Flash. Le dernier modèle, le 3.8 Flash, est proposé à un prix très abordable (0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie) et affiche de bons résultats d'performance (il égale Claude Opus 5 en programmation et dépasse GPT-5.6 Sol en raisonnement). Une version spéciale, Cyber, a également été conçue pour la sécurité en ligne. Cependant, les utilisateurs ordinaires ont constaté que, bien que les performances en test soient impressionnantes, la réalité de l'utilisation est moins satisfaisante : les démonstrations officielles reposent sur des configurations spéciales, le modèle a des difficultés à gérer des tâches longues et les détails sont approximatifs. La raison en est que le modèle phare de Google, Gemini Pro, rencontre des retards et que les talents clés du domaine ont quitté l'entreprise, forçant Google à se contenter des modèles plus modestes comme le Flash pour maintenir sa présence sur le marché.

I. Un modèle performant à bas prix

Le 3.8 Flash est présenté par Google comme le “modèle Flash le plus intelligent”, avec des améliorations notables en programmation de longue durée, en raisonnement complexe et dans les scénarios d'agents professionnels, tout en conservant le même prix que son prédécesseur, le 3.7 Flash.

  • Performances de programmation exceptionnelles : Il a obtenu 73,7 % de points dans le test DeepSWE, égalant ainsi Claude Opus 5 (74 %), mais à un cinquième du coût de ce dernier (2,36 dollar par question contre 11,84 dollars) ; il a également atteint 89,4 % dans le test Terminal-Bench 2.1, se rapprochant pour la première fois de la barre des 90 %.
  • Raisonnement interdisciplinaire de premier plan : Dans le test HLE (Human Ultimate Exam) couvrant les domaines STEM et des sciences humaines, il a obtenu 54,9 % de points, légèrement supérieur à Opus 5 (54,4 %) et GPT-5.6 Sol (54,5 %).
  • Supériorité dans les scénarios professionnels : Il a surpassé GPT-5.6 Sol avec 61,4 % de points dans le test des agents financiers (Vals V2) et atteint un taux de réussite de 10 % dans le test des agents juridiques (Harvey), soit 1,5 fois supérieur à celui d'Opus 5.
  • La version Cyber pour la sécurité : Il détecte 86,2 % des vulnérabilités (supérieur à GPT-5.5-Cyber) et les coûts de correction sont plus bas ; l'équipe de Chrome a utilisé ce modèle pour générer des correctifs fiables, soit 2,6 fois plus efficaces que ceux des autres modèles, mais cette fonctionnalité est réservée aux “défenseurs de confiance”.

Le secret réside dans le fait que le 3.8 Flash réfléchit plus avant de résoudre les problèmes : par exemple, il génère 36 000 tokens de plus et exécute 41 étapes supplémentaires lors des tâches de programmation, ce qui augmente légèrement le coût (de 0,4 dollar à 0,58 dollar), tout en restant moins cher que les modèles phares.

II. Déceptions dans les tests réels

Bien que les performances en test soient prometteuses, l'utilisation quotidienne est décevante pour les utilisateurs ordinaires :

  • Configuration sélective : Les démonstrations officielles utilisent des instructions spéciales (Antigravity et Nano Banana) pour générer des textures, tandis que les utilisateurs ordinaires n'ont que des modèles de base. Par exemple, la création d'un hélicoptère Airbus avec Three.js prend 109 secondes, mais les détails sont approximatifs et le mouvement est mal réalisé ; la simulation d'un cratère volcanique présente également des problèmes.
  • Vitesse sans qualité : Le modèle fonctionne rapidement, mais les mécanismes de mouvement et les performances sont inférieurs à ceux du modèle Kimi K3. Dans le test du marché de New York, seulement 6 arbres sont affichés (contre 10 pour le 3.7 Flash), et des éléments essentiels tels que les passages piétonniers et les effets de distorsion sous l'eau sont omis, tandis que des paramètres de caméra et des filtres de post-traitement sont ajoutés de manière aléatoire.
  • Faiblesse dans les tâches longues : Le 3.8 Flash n'a obtenu que 19,1 % de points dans le test Terminal-Bench 4.0 (contre 51,8 % pour Opus 5) et 59 % dans le test d'opérations sur ordinateur dans OSWorld (contre 75,4 % pour Opus 5). Il se classe huitième au classement général des modèles intelligents, avec des points forts en programmation, mais ses performances déclinent dans les tâches interdisciplinaires.

III. La raison de ces déceptions : Retards sur le modèle phare et perte de talents

La précipitation de Google dans le lancement des modèles Flash ne reflète pas une avancée technologique majeure, mais plutôt une situation difficile :

  • Retards sur le modèle phare : En mai de cette année, Sundar Pichai avait promis la sortie du nouveau modèle Pro dans un mois, mais le projet 3.5 Pro a été annulé (les améliorations proposées étaient inférieures à celles du 3.8 Flash), et le développement de Gemini 4 est toujours en cours.
  • Perte de talents clés : Au cours des derniers mois et demi, des personnalités clés du domaine des grands modèles, comme Noam Shazeer et Jeff Dean, ont quitté l'entreprise, créant des troubles au sein de l'équipe. La nouvelle direction exige donc une accélération des lancements.
  • Le Flash en tant que solution temporaire : Le 3.8 Flash étant de plus petite taille, sa modification et son entraînement nécessitent moins de ressources que les modèles Pro, permettant à plusieurs équipes de tester différentes approches rapidement (itération tous les trois semaines). En revanche, ajuster les modèles Pro requiert davantage de ressources (GPU et de temps), ce qui augmente les coûts de développement.

Ainsi, les trois nouveaux modèles Flash représentent une stratégie de “petits pas rapides” pour Google, dans le but de maintenir sa position sur le marché face à des concurrents comme OpenAI et Anthropic.

IV. La véritable place du Flash

Le Flash n'est pas l'objectif final de Google, mais il s'avère être la solution la plus pratique pour l'instant :

  • Pas un modèle phare complet : Les problèmes constatés lors des tests réels montrent qu'il est encore loin d'un modèle phare complet (faiblesse dans les tâches longues et détails approximatifs).
  • Une solution de secours : Son prix abordable et sa rapidité d'itération lui permettent de rivaliser avec les modèles phares dans certains domaines (programmation, agents financiers), permettant à Google de conserver sa part de marché et l'attention des développeurs en attendant la sortie des modèles Pro et Gemini 4.

En somme, le Flash est une solution temporaire pour Google : pour gagner la compétition des grands modèles, l'entreprise compte sur ses modèles phares, mais pour l'instant, elle utilise le Flash pour ne pas être distancée par ses concurrents.

Conclusion

La série Flash de Google est comme un élève performant sur certains domaines (programmation, finance) à un prix avantageux, mais ses performances globales sont inférieures à celles des meilleurs modèles. Les retards sur le modèle phare et la perte de talents forcent Google à miser sur des modèles plus modestes pour maintenir sa présence sur le marché. Pour les utilisateurs, le Flash peut être une option intéressante pour des tâches spécifiques (programmation, analyses financières simples), mais pour des tâches complexes, il faudra attendre les modèles phares. Pour l'industrie, cela reflète l'intensité de la concurrence dans le domaine des grands modèles : aucune entreprise n'a le droit de ralentir, même si cela signifie avancer à petits pas.