Résumé des faits clés
Récemment, le monde de l’IA a été témoin d’une farce allant du délire à la dénonciation de fraude : l’équipe J-Space a annoncé le lancement d’un plug-in appelé Skill, prétendant améliorer considérablement les performances de DeepSeek V4 Pro sans modifier les poids des modèles, au point de le surpasser même par rapport aux modèles de pointe tels que Fable 5. Cependant, lorsque les développeurs de la communauté ont réévalué les résultats, ils ont constaté non seulement qu’il n’y avait aucune amélioration, mais que l’utilisation de ce plug-in consommait davantage de ressources. L’auteur a refusé de divulguer les détails des tests et a même supprimé les posts sceptiques, révélant ainsi que cette prétendue amélioration n’était qu’un coup de bluff basé sur la falsification des données. La tromperie était d’autant plus efficace qu’elle ciblait précisément une faiblesse réelle de DeepSeek V4 Pro : sa sensibilité à l’environnement externe, ce qui a incité de nombreuses personnes à croire aux promesses de l’outil.
1. Le “plug-in magique” de J-Space : une promesse démesurée
Le Cognition Suite V3.6 proposé par J-Space n’est en réalité qu’un ensemble de mécanismes permettant de gérer le fonctionnement des modèles en temps réel, sans modifier les modèles eux-mêmes. Selon l’équipe, les assistants intelligents commettent fréquemment quatre types d’erreurs :
- Surcharge d’informations : trop d’objectifs et d’outils sont fournis, noyant les éléments importants ;
- Perte de mémoire : après plusieurs itérations de raisonnement, le même nom ou la même valeur peuvent changer de sens ;
- Essais répétés sans raison : en cas d’échec d’une action, l’opération est reproduite sans analyser les causes ;
- Fin prématurée des tâches : les réponses sont jugées correctes avant même que les résultats ne soient vérifiés.
Leur solution consiste à transformer le processus d’exécution en un cycle de “jugement rapide → exécution → réflexion approfondie → vérification → essai avec des informations diagnostiques”, et à consigner les données clés dans un “livre externe” pour éviter les oubliels. Les résultats annoncés étaient spectaculaires : Terminal Bench est passé de 87,9 à 90,1, NL2Repo de 61,5 à 73,4, et ils prétendaient même que DeepSeek V4 Pro dépassait Fable 5 et Opus4.8, suscitant un grand enthousiasme.
2. La révélation des mensonges par la communauté : les tests ont montré l’échec
Très rapidement, des développeurs ont remis en question ces affirmations :
- Test de l’informateur A : deux rounds d’essais A/B avec V4 Flash n’ont montré aucun différence de performance, mais le groupe J-Space a consommé plus de ressources ;
- Évaluation par un tiers : le groupe contrôle a obtenu 8,3 points, tandis que le groupe J-Space n’a que 7,87 points ;
- Révélation de l’informateur B : avec 8 cartes NVIDIA H20 pour 89 questions, seul 69 ont été résolues (soit 77,5 %), mais le rapport indiquait un taux de réussite de 87,1 %, soit près de 10 % de moins ; les essais échoués n’ont pas été améliorés après trois tentatives.
- Suppression des posts : des utilisateurs ayant posé des questions sceptiques ont vu leurs messages supprimés par l’auteur, obligeant les autres à réenvoyer leurs contributions ; l’auteur a refusé de divulguer l’environnement des tests, la procédure et les résultats, ce qui a aggravé la situation.
3. En quoi résidait la tromperie ? J-Space a ciblé une véritable faiblesse de DeepSeek V4 Pro
Le succès de J-Space s’explique par leur capacité à exploiter une problématique réelle : DeepSeek V4 Pro est particulièrement sensible à l’environnement d’exécution. Par exemple, certains utilisateurs ont constaté que les résultats étaient imparfaits au début d’une tâche, mais qu’ils devenaient plus fiables après quelques heures ; de plus, le même modèle obtenait des scores très différents selon les modes d’exécution (Standard/PTC/Minimal).
Les gens croyaient déjà que l’ajustement de l’environnement pouvait améliorer les performances, ce qui rendait la prétention de J-Space encore plus crédible.
4. Une leçon pour le monde de l’IA : toute amélioration prétendue doit être reproduisible
Cette affaire a montré que toute affirmation d’amélioration des performances doit pouvoir être vérifiée par d’autres. Tout comme les résultats financiers doivent être audités, les résultats des recherches en IA doivent également être rendus publics (en incluant l’environnement des tests, la procédure et les données utilisées). Peu importe à quel point les résultats de J-Space semblent impressionnants, s’ils ne peuvent pas être reproduits, ils restent sans fondement. La prochaine fois que vous verrez des promesses exagérées concernant l’IA, demandez-vous d’abord : “Ces résultats peuvent-ils être reproduits ? Y a-t-il des preuves ?”
5. L’idée technique en elle-même : les problèmes sont réels, mais la solution peut être inefficace
Il est important de noter que les quatre problèmes identifiés par J-Space (surcharge d’informations, perte de mémoire, etc.) existent bel et bien, et de nombreuses équipes travaillent à leur résolution (par exemple, des solutions comme Routing Suite pour choisir le bon mode de raisonnement ou Anchored Standard pour stabiliser le comportement du modèle). Cependant, la solution proposée par J-Space était soit inefficace, soit basée sur de la fraude, ce qui en fait un exemple négatif.
En somme, l’innovation dans le domaine de l’IA repose sur des avancées technologiques réelles, et non sur la manipulation ou l’exploitation de faiblesses pour attirer l’attention. Cette affaire de fraude nous rappelle d’être vigilants face aux résultats exagérés et de considérer la reproductibilité comme critère essentiel pour évaluer les progrès de l’IA.