Résumé des principaux points
Google met à jour son modèle Gemini Flash tous les trois semaines (la version 3.8 est sortie il y a seulement trois semaines, soit à peine trois semaines après la précédente). Il a également lancé une version spéciale dédiée à la sécurité informatique, appelée Cyber. Meta a suivi le mouvement en mettant à jour son propre modèle et a taquiné Google en se demandant « Qui est Gemini ? ». La série phare de Google, Gemini Pro, rencontre des difficultés (la version 3.5 Pro a été annulée et la version 4 est encore en cours d'entraînement), ce qui a contraint le modèle plus compact Flash à devenir le principal acteur dans les développements actuels. La raison en est que la logique de développement des grands modèles a changé : au lieu de se concentrer uniquement sur l'augmentation de leur taille, on accorde désormais plus d'importance aux techniques d'apprentissage renforcé et aux agents intelligents (agents logiciels). Le modèle Flash, étant plus petit, permet de réduire les coûts d'essai et d'erreur, permettant ainsi des itérations rapides.
1. Pourquoi Google met-il à jour Flash tous les trois semaines ? Le modèle compact est devenu un « terrain d'expérimentation rapide »
Auparavant, les mises à jour des grands modèles étaient lentes en raison de leur taille importante (comme la série Pro), ce qui nécessitait des ressources calculatoires considérables, du temps et une coordination entre plusieurs équipes, entraînant des coûts élevés. Flash, étant plus petit, permet de modifier et de réentraîner le modèle facilement, permettant à plusieurs équipes de tester différentes approches (comme l'apprentissage renforcé et l'entraînement d'agents) en même temps.
Par exemple, Flash est comme une « version d'essai » d'un système mobile, permettant d'ajouter rapidement de nouvelles fonctionnalités ou de corriger des erreurs, tandis que la série Pro est la « version finale » qui ne peut être mise à jour que lorsque les fonctionnalités sont suffisamment matures. Google teste d'abord ces nouvelles technologies sur Flash et les itère rapidement si elles se révèlent efficaces, ce qui explique la fréquence élevée des mises à jour.
2. En quoi la version 3.8 de Flash est-elle plus performante ? Comme un « employé qui prend l'initiative de terminer le travail »
Les modèles d'IA précédents fournissaient souvent seulement des résultats préliminaires lorsqu'ils effectuaient des tâches complexes, sans se soucier de leur fonctionnement ou d'erreurs. La version 3.8 intègre une nouvelle fonctionnalité appelée « Agentic loops », qui permet au modèle de prendre l'initiative : il réfléchit à la manière de procéder, utilise des outils pour exécuter les tâches, vérifie les résultats, corrige les problèmes et ne cesse de travailler que lorsque la tâche est terminée.
Par exemple, dans une démo officielle, le modèle peut créer un jeu 3D de sorcier avec des puzzles et des textures en utilisant des outils préexistants, ou même une version DOS des cartes de Google avec des paysages urbains. Les résultats des tests sont impressionnants : il surpasse de nombreux grands modèles dans des tests de longue durée et a amélioré ses performances dans des scénarios financiers et juridiques par rapport à la version précédente, obtenant 54,9 % de points dans des tests de connaissances STEM. Google souhaite que Flash échappe à l'image d'un modèle bon marché mais peu performant et qu'il puisse gérer des tâches complexes.
3. La rapidité a-t-elle des inconvénients ? Les avantages et les inconvénients sont clairs
Les avantages de Flash sont sa rapidité et son coût réduit :
- Par rapport à Claude Opus 5, la version 3.8 de Flash coûte 0,12 dollar pour réaliser la même tâche en Three.js (Opus coûte 1,86 dollar, soit 15 fois plus cher), et sa vitesse est 7 fois plus faible (37 secondes contre 24 minutes).
Cependant, ses inconvénients sont également notables :
- Lors de la création d'un jeu comme Sticky Ball, Flash génère rapidement des résultats, mais l'expérience utilisateur est inférieure à celle de Kimi K3 (mecanismes de mouvement et design défautifs) ;
- Lors de la création d'un paysage de la ville de New York, Flash n'a inclus que 6 arbres (alors que Opus en a inclus 1840), a omis les passages piétonniers et les effets sous-marins demandés par les utilisateurs, et a ajouté des préréglages de caméra et une horloge en temps réel non nécessaires.
En résumé, Flash est idéal pour des tâches rapides, mais sa précision et la qualité finale ne sont pas comparables à celles des modèles phares.
4. Pourquoi la série Pro rencontre-t-elle des difficultés et Flash est-elle devenu le remplaçant ?
La série Pro de Google rencontre des problèmes :
- La version 3.5 Pro a été annulée car ses améliorations n'étaient pas significatives par rapport à Flash ;
- La version 4 de Gemini est encore en cours d'entraînement et ne sera pas disponible avant longtemps.
La raison de ces difficultés est que les grands modèles nécessitent des ressources considérables pour chaque mise à jour, ce qui ne justifie pas un investissement avant que des progrès significatifs ne soient réalisés. Flash, étant plus compact, permet de mettre en œuvre rapidement de nouvelles fonctionnalités, ce qui le rend indispensable pour combler ce vide. De plus, les ajustements internes chez Google (exigences de la direction pour accélérer les choses) ont fait de Flash le principal acteur dans les développements actuels.
5. Qu'est-ce que la version Cyber ? Un « petit expert en sécurité » spécialisé dans la détection de failles
La version 3.8 de Flash inclut également une version Cyber, conçue pour les tâches de sécurité informatique :
- Elle permet de détecter des failles, de réaliser des tests d'intrusion et de générer automatiquement des correctifs de sécurité ;
- Les résultats des tests sont impressionnants : elle dépasse la version précédente ainsi que de nombreux autres grands modèles dans la détection de failles, avec un taux de réussite proche de celui des meilleurs modèles ;
- Dans la pratique, l'équipe de Chrome a utilisé cette version pour générer des correctifs corrects 2,6 fois plus rapidement que les modèles commerciaux ; une entreprise de sécurité l'a utilisée pour des tests d'intrusion, constatant une augmentation de 7,5 % à 9,7 % du taux de correction des failles, avec une réduction des coûts de 2,3 à 5,2 fois ; elle a même détecté en moins de deux heures une faille grave que les méthodes traditionnelles ne pouvaient trouver qu'après des mois de travail.
Cette version est conçue pour les professionnels de la défense en ligne et représente un assistant efficace et peu coûteux pour eux.
En conclusion : une stratégie temporaire de Google ?
Google n'avait peut-être pas l'intention de faire de Flash son modèle principal, mais les difficultés rencontrées par la série Pro et le changement de logique de développement des grands modèles (l'importance croissante des techniques d'apprentissage renforcé) ont fait de Flash un acteur incontournable. Cependant, cela reste une solution provisoire : le succès de la version 4 de Gemini sera déterminant. Si celle-ci ne répond pas aux attentes, même les performances de Flash ne suffiront pas à combler le vide laissé par la série Pro. Les moqueries de Meta (« Qui est Gemini ? ») montrent également que le retard de Google dans le développement de ses modèles phares a été remarqué par ses concurrents.