虎嗅

Hier soir, la Silicon Valley a été témoin d’une véritable bataille des dieux de l’IA.

原文:昨晚,硅谷经历了AI诸神之战。

Résumé des événements majeurs en AI au Silicon Valley hier

Les trois événements majeurs en matière d’IA qui se sont déroulés hier au Silicon Valley (lancement de Gemini 3.8 Flash par Google, mise à jour de Muse Spark1.3 par Meta, et lancement de Mostik par une start-up) semblent être des mises à jour des capacités des modèles, mais en réalité ils pointent vers une révolution dans les coûts de l’inférence par IA : une réduction multidimensionnelle des coûts. Cette révolution passe de l’« égalisation des capacités haut de gamme » à la « réduction des tâches inutiles », puis à la possibilité de transmettre directement des données internes sans passer par le langage naturel. L’économie de l’IA évolue ainsi d’un modèle de tarification basé sur les tokens à un modèle basé sur le coût réel des tâches effectuées. L’intelligence devient de plus en plus abordable, ce qui pourrait permettre le développement de nombreuses applications IA qui n’étaient pas rentables jusqu’à présent.

1. Google : Intégration de capacités d’IA haut de gamme dans des offres abordables

Gemini 3.8 Flash, qui était initialement conçu pour être rapide et peu coûteux mais avec des capacités limitées, intègre désormais des compétences d’ingénierie logicielle de pointe (comme l’exécution de tâches complexes en plusieurs étapes dans des tests DeepSWE).

  • Résultats : 74 % de réussite, au même niveau que le modèle le plus performant, Claude Opus5.
  • Coûts : Environ 2,36 dollars par tâche, contre 11,84 dollars pour Claude et 6,46 dollars pour GPT.

Pourquoi est-ce important ? À l’ère des agents intelligents, l’IA ne sert pas seulement à des conversations courtes ; elle doit effectuer des tâches continues et complexes (comme la programmation ou la recherche). Une différence de coût significative peut influencer la décision des entreprises d’utiliser ces agents. Google affirme que les tokens étant suffisamment abordables, les modèles peuvent effectuer des processus d’inférence plus longs sans sacrifier leurs performances.

2. Meta : Moins d’erreurs = plus d’économies

Muse Spark1.3 a vu ses performances augmenter de 55 % à 75,4 %, mais ce qui est plus important, c’est la réduction des appels aux outils (de 20 %) et de la consommation de tokens (de 25 %).

  • Économie des coûts : Les erreurs coûtent cher, car elles entraînent des modifications inutiles et des tests répétés. Muse peut détecter plus rapidement les ambiguïtés, demander de l’aide et se souvenir des contraintes initiales, ce qui permet d’éviter des tâches inutiles.
  • Enjeu : À l’ère des agents intelligents, éviter les erreurs est plus précieux que simplement améliorer les performances.

3. Mostik : Les modèles peuvent communiquer directement, sans utiliser de langage naturel

Mostik a créé un système où deux modèles IA peuvent échanger des données sans passer par le langage naturel, en utilisant des représentations mathématiques internes.

  • Comparaison : Actuellement, les modèles doivent convertir des données en texte avant de pouvoir communiquer. Mostik permet de passer directement des données d’un modèle à l’autre, éliminant ainsi le besoin d’imprimantes et de scanners.
  • Résultats expérimentaux : Le modèle combinant GLM-5.2 (753 milliards de paramètres) et Qwen3.5 (4 milliards de paramètres) fonctionne efficacement, avec des coûts 20 fois plus bas que ceux de GLM.
  • Défi : Les langages internes des différents modèles sont souvent différents, ce qui rend la communication difficile. Cependant, la réduction des coûts de 20 fois est très prometteuse.

4. Avenir : Seuls de petits modèles seront nécessaires sur les smartphones, les tâches complexes seront traitées en cloud

Auparavant, les entreprises cherchaient à intégrer des modèles volumineux sur les smartphones (de 7 milliards à 1 milliard de paramètres). Si la technologie de Mostik se révèle efficace, les smartphones n’auront peut-être besoin que de modèles très légers (de l’ordre de quelques milliers de paramètres).

  • Organisation des tâches : Les petits modèles locaux s’occuperont des tâches simples et fréquentes, et les tâches complexes seront traitées en cloud. Les données seront transmises sous forme compressée, réduisant considérablement les coûts.

Conclusion : L’intelligence deviendra vraiment accessible

Ce que ces trois événements ont en commun, c’est que les coûts de l’IA ne diminuent pas de manière linéaire, mais que la structure même des coûts est en train de se réformer fondamentalement. Lorsque l’intelligence deviendra suffisamment abordable pour être utilisée facilement (par exemple, pour des tâches simples ou pour des agents intelligents disponibles 24/7 sans coûts excessifs), de nombreuses applications aujourd’hui considérées comme folles deviendront monnaie courante. Le plus intéressant n’est pas de savoir qui prendra la première place dans les classements, mais de savoir à quel point l’IA pourra devenir encore plus accessible.

(Cet article explique les événements en langage simple, afin que les non-spécialistes en finance et en IA puissent comprendre la logique et les impacts de cette révolution des coûts en IA.)