虎嗅

Un article d’Agent révèle la vérité sur la production : les capacités peuvent être couplées, mais l’exécution doit être standardisée

原文:一篇Agent 论文揭开了生产真相:能力可以耦合,执行必须标准化

Bonjour ! Je suis votre journaliste financier et ami économiste. Aujourd'hui, nous allons parler de cet article publié sur le compte WeChat public “AIGC from 0 to 1”. Bien que le titre comporte des termes techniques tels que “thèse”, “agent” et “poids”, il révèle en réalité une vérité sur l'industrie plutôt simple et même un peu “contre-intuitive”.

Pour que vous compreniez facilement, j'ai découpé cet article long en “résumé essentiel” et “interprétation en langage simple à cinq dimensions”.

---

📝 Résumé essentiel : comprendre l'information en une phrase

Point clé :

Auparavant, on pensait que pour rendre les assistants intelligents en IA (agents), il fallait soit changer pour un “cerveau” (modèle) plus puissant, soit fournir à ce cerveau de meilleures “mains et instructions” (frameworks, mots d'encouragement, chaînes d'outils). Mais la dernière thèse WHALE prouve que ces deux éléments ne peuvent pas être optimisés séparément ; leur optimisation conjointe est la plus efficace.

Mais (voici le point clé) :

Bien que l'optimisation conjointe soit techniquement la meilleure option, dans un environnement de production d'entreprise, on ne peut pas les faire évoluer indéfiniment ensemble. En effet, si le “cerveau” et les “mains” s'adaptent trop bien (couplage étroit), le coût de leur remplacement devient élevé (c'est ce qu'on appelle le “taxe de couplage”).

Conclusion finale :

Les capacités peuvent évoluer ensemble, mais l'exécution doit être standardisée (les interfaces doivent être uniformes et les versions contrôlables). Les entreprises devraient traiter l'IA comme un produit logiciel complet à lancer et à gérer, et non comme un prototype en constante évolution.

---

🔍 Interprétation en langage simple à cinq dimensions

1. Pourquoi “se concentrer seulement sur le cerveau” ou “seulement sur les instructions” ne fonctionne pas ? (La logique fondamentale de WHALE)

Parabole simple :

Imaginez que le modèle est un étudiant brillant fraîchement diplômé et que le framework de mise en œuvre est sa boîte à outils et son processus de travail.

  • Approche traditionnelle :
  • Soit on entraîne uniquement l'étudiant (ajustement du modèle), sans se soucier de l'utilité de la boîte à outils. Résultat : l'étudiant est intelligent, mais la boîte est mauvaise, il ne peut pas exploiter pleinement ses capacités.
  • Soit on optimise uniquement la boîte à outils (modification des instructions, ajout de mécanismes de recherche), sans tenir compte des capacités de l'étudiant. Résultat : la boîte est parfaite, mais l'étudiant n'est pas à la hauteur.
  • Nouvelle découverte de WHALE :
  • Si vous fixez la boîte à outils et que vous ne formez que l'étudiant, celui-ci apprendra à s'adapter à cette boîte inadéquate, plutôt que d'acquérir de véritables compétences.
  • Si vous fixez l'étudiant et que vous ne modifiez que la boîte à outils, celle-ci sera conçue spécifiquement pour les limites de l'étudiant. Si vous changez pour un nouvel étudiant plus intelligent, l'ancienne boîte deviendra un obstacle.
  • Approche correcte :
  • Optimisation alternée : entraînez d'abord le modèle, puis ajustez la boîte à outils en fonction de ses nouvelles capacités ; répétez l'opération. C'est comme jouer au ping-pong : vous vous adaptez mutuellement pour évoluer ensemble.
  • Résultat : les données expérimentales montrent que cette approche améliore l'exactitude de 4 à 24 points de pourcentage par rapport à une optimisation séparée.

Commentaire du journaliste :

C'est comme rénover une maison : vous ne pouvez pas acheter le meilleur canapé sans vous soucier de l'emplacement des prises, ni modifier les prises sans tenir compte du confort du canapé. Les deux doivent s'harmoniser, mais ce processus doit être dynamique.

2. Pourquoi un “bon score” en laboratoire peut devenir un désastre en production ? (Les différences entre objectifs)

Parabole simple :

  • Objectif en laboratoire : obtenir de bons résultats (plus de 5 points de score).
  • Objectif en entreprise : gagner de l'argent, économiser des coûts, éviter les problèmes.

Différences concrètes :

En laboratoire, gagner 5 points d'exactitude peut nécessiter quelques ajustements de code. En production, cela peut signifier :

  • Coûts augmentés : besoin de plus de serveurs, de temps d'entraînement plus long.
  • Risques accrus : de nouvelles erreurs peuvent survenir, nécessitant des corrections manuelles.
  • Entretien difficile : pour ces 5 points, 10 correctifs peuvent être ajoutés au code, et personne n'ose les supprimer de peur de provoquer des problèmes.

Commentaire du journaliste :

Le monde universitaire cherche l’“performance maximale”, tandis que le monde industriel cherche l’“stabilité et l’efficacité”. Cela explique pourquoi de nombreux modèles performants en laboratoire échouent en entreprise. Les entreprises calculent le “coût total” : profit = valeur - coût d'entraînement - coût d'exploitation - coût de risque**. Si améliorer l'exactitude de 5% entraîne un doublement des coûts d'exploitation, cela n'est pas rentable.

3. Qu'est-ce que la “taxe de couplage” et pourquoi est-elle plus coûteuse que le modèle lui-même ?

Parabole simple :

Le couplage se produit lorsque deux éléments sont trop étroitement liés et difficiles à séparer.

La “taxe de couplage” est le coût élevé à payer pour les modifications nécessaires lorsqu'on veut séparer ces éléments.

Exemple concret :

Supposons que votre système AI se compose d'un modèle A et d'un framework B qui fonctionnent très bien ensemble.

  • Le modèle A est habitué à un format spécifique du framework B.
  • Les mécanismes de traitement des erreurs du framework B sont conçus pour les particularités du modèle A.
  • Problème : si vous voulez mettre à jour le modèle pour un modèle C plus performant, de nombreux éléments du framework B deviennent inutilisables.
  • Solution : vous devez réécrire le framework B ou même réajuster toutes les interfaces. Ce processus est très complexe et sujet à erreurs.

Pire encore : le “endettement technologique”

Au fil du temps, le système est rempli de correctifs pour résoudre de petits problèmes :

  • Résultat instable : ajout de traitements pour l'analyse des données, de mécanismes de réessai, de règles de terminaison, etc.

Finalement, personne ne sait plus quel code est vraiment utile, et personne n'ose le supprimer. C'est ainsi que le **couplage devient un “endettement technologique”.

Commentaire du journaliste :

Le MLOps (Machine Learning Operations) met l'accent sur la modularité et la remplaçabilité pour réduire ce “endettement”. Si chaque mise à jour du modèle nécessite la réécriture du système entier, celui-ci devient fragile.

4. À quoi ressemblera le système AI de demain ? Le “framework” se divisera en deux parties

L'article propose une idée intéressante : le framework de mise en œuvre ne disparaîtra pas, mais se divisera en deux catégories :

Première catégorie : les frameworks cognitifs (qui seront supprimés ou simplifiés)

  • Ce qu'ils font : corriger les défauts du modèle (par exemple, rappeler au modèle de continuer s'il s'arrête, le faire relire s'il énonce des absurdités).
  • Tendance : à mesure que les modèles deviendront plus intelligents (comme GPT-5, Claude 4), ces aides deviendront inutiles ou même gênants, car les nouveaux modèles sauront se débrouiller seuls.
  • Exemple : auparavant, les modèles avaient des problèmes de contexte (oubliaient ce qu'ils avaient écrit). Les ingénieurs ajoutaient des fonctionnalités pour les aider. Aujourd'hui, ces fonctionnalités peuvent devenir un obstacle.

Deuxième catégorie : les frameworks systémiques (qui deviendront de plus en plus importants)

  • Ce qu'ils font : gérer la sécurité, les autorisations, l'état du système (par exemple, accès aux bases de données, modification du code, récupération en cas de blocage).
  • Tendance : plus les modèles deviendront puissants, plus ils pourront faire (par exemple, gérer l'environnement de production, interagir avec les systèmes de paiement), mais cela augmente les risques. Ainsi, ces mécanismes de sécurité et de gestion de l'état deviendront essentiels et standardisés.

Commentaire du journaliste :

Auparavant, on se demandait si l'IA pouvait faire les choses correctement ; demain, on se demandera si elle peut le faire de manière fiable. La capacité à apprendre évolue, mais les autorisations et les règles de fonctionnement doivent rester stables. C'est pourquoi des entreprises comme Anthropic séparent la gestion des sessions, de l'environnement d'exécution et des modèles.

5. Conseils pratiques pour les entreprises : évitez l’évolution infinie, optez pour des versions définies

Stratégie recommandée : WHALE-lite (optimisation conjointe légère)

Les entreprises ne devraient pas essayer de faire évoluer constamment leur système AI comme un organisme vivant. Elles devraient suivre un processus de “congélation-validation-lancement” :

1. Phase de développement : permettre l'optimisation conjointe du modèle et du framework pour trouver la meilleure combinaison.

2. Phase de congélation : une fois les résultats satisfaisants, fixez cette combinaison en une version (par exemple, v1.0).

  • Cette version inclut le modèle, le code du framework, les instructions, les interfaces, les politiques d'autorisation et un environnement de test.

3. Phase de lancement : déployez cette version dans l'environnement de production.

  • L'important : ce qui est lancé n'est pas seulement un modèle, mais un paquet logiciel complet, réplicable et vérifiable.

4. Mises à jour ultérieures : ne lancez de nouveaux ajustements que si les tests montrent que le modèle est le point faible, ou si les besoins commerciaux changent.

  • Chaque mise à jour doit être accompagnée de tests de régression pour éviter de nouveaux problèmes.

Scénarios appropriés pour l'optimisation conjointe :

  • Tâches fixes, fréquentes, avec des résultats vérifiables automatiquement (par exemple, réparation de code, maintenance de processus standardisés, vérification de règles).
  • Une amélioration de 1% de l'exactitude peut avoir une grande valeur commerciale.

Scénarios inappropriés :

  • Tâches variables, dépendant de jugements subjectifs, faible trafic, besoins clients variés.

Dans ces cas, la remplaçabilité des composants est plus importante que la recherche de la performance maximale.

Commentaire du journaliste :

C'est comme la fabrication de voitures. Il ne faut pas que le moteur et la boîte de vitesses s'adaptent continuellement après la sortie du véhicule (modifier le carburateur aujourd'hui, ajuster le rapport de vitesses demain). Il faut les ajuster en usine pour qu'ils fonctionnent ensemble parfaitement, puis les assembler en un véhicule complet et le vendre avec une garantie. Si le client veut de nouvelles fonctionnalités, il doit acheter un nouveau véhicule, pas demander au mécanicien de les modifier sur la route.

---

📌 Conclusion et perspectives

L'article conclut sur une idée très prometteuse : le MCP (Model Context Protocol) ne deviendra pas le standard universel dans le domaine de l'IA (comme le TCP/IP). Le MCP règle la manière dont les outils sont connectés au modèle. Le A2A (Agent-to-Agent) règle la communication entre les agents IA. Ce qui doit vraiment être standardisé, ce sont les actions de base telles que la création de tâches, les changements d'état, les demandes d'autorisation et l'enregistrement des états.

L'infrastructure IA de demain ne sera pas un “système d'exploitation AI” unique et complet, mais sera composée de plusieurs couches :

1. Couche supérieure : les applications commerciales.

2. Couche intermédiaire : l'optimisation du modèle et du framework (instructions, ajustements, processus de travail).

3. Couche inférieure : les fondements de l'IA (identité, autorisations, environnements de test, stockage des états, journaux d'audit).

Un conseil pour les professionnels :

Les capacités peuvent évoluer ensemble, mais l'exécution doit être standardisée. Ne faites pas de votre système AI une “boîte noire” ; faites-en une “boîte blanche” où vous pouvez voir chaque étape de son fonctionnement, savoir qui a donné les autorisations et comment corriger les erreurs. C'est la clé pour que l'IA puisse être efficacement intégrée en production.