虎嗅

Titre français : Un « cheat » nommé comme Anthropic fait le buzz : il permet à DeepSeek V4-Pro de dominer Fable5, mais personne ne parvient à reproduire ce résultat ; en revanche, les coûts liés aux tokens ont doublé.

原文:撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压Fable5”但无人能复现,Token开销反而翻倍

Résumé des points clés

Un projet communautaire récent appelé J-Space Cognition Suite a fait beaucoup de bruit, affirmant que l'on peut améliorer considérablement les performances d'un modèle DeepSeek V4-Pro sans modifier le modèle lui-même, simplement en y ajoutant un outil d'assistance appelé Harness. Cependant, cette affirmation soulève trois grands débats :

1. Aucun résultat n'a été reproduit par des tiers (tous les données ont été mesurées par l'équipe du projet) ;

2. Le nom J-Space peut prêter à confusion avec celui d'Anthropic, mais les technologies sont complètement différentes ;

3. **L'utilisation de l'outil entraîne une augmentation du consommation de tokens, augmentant ainsi les coûts*.

Cet événement reflète également les tendances actuelles dans le développement des outils d'assistance pour les modèles AI : ils visent à combler les lacunes des modèles et à diverger en termes de conception (universels ou personnalisés).

1. Le projet est prometteur, mais personne ne peut reproduire les résultats

Selon l'équipe du projet, l'ajout de l'Harness améliore significativement les scores de DeepSeek V4-Pro dans plusieurs tests (par exemple, NL2Repo est passé de 61,5 à 73,4 et Terminal-Bench 2.1 de 87,9 à 90,1). Cependant, ces données ont été mesurées uniquement par eux, et aucune autre équipe n'a encore obtenu les mêmes résultats sous les mêmes conditions (version du modèle, environnement de test, paramètres).

Pourquoi la reproduction des résultats est-elle importante ? Car les mesures effectuées en interne peuvent être biaisées (ajustements secrets des conditions de test ou aléatoireité des données). Sans validation par des tiers, ces améliorations ne sont pas crédibles. Certains développeurs ont tenté de reproduire les résultats, mais sans succès, voire avec des résultats pires.

2. Ne confondez pas ! J-Space n'a rien à voir avec Anthropic

Beaucoup de personnes pensent que J-Space est lié à Anthropic (l'entreprise qui a développé le modèle Claude), mais en réalité, il s'agit de deux projets distincts :

  • J-Space d'Anthropic : étudie les mécanismes neuronaux internes du modèle Claude (transmission des informations, stockage de la mémoire, etc.).
  • Le projet communautaire J-Space : un outil d'assistance externe conçu pour le modèle DeepSeek, qui gère le processus d'exécution des tâches (réessayes, enregistrement des progrès, détermination de l'achèvement des tâches).

La similitude des noms est purement fortuite (ou peut-être une tentative de capitaliser sur la notoriété d'Anthropic), mais elle a induit de nombreuses erreurs chez les utilisateurs, qui pensaient utiliser une technologie d'Anthropic.

3. L'utilisation de l'outil coûte plus cher ? Consommation de tokens doublée

Les tokens sont l'unité de coût des modèles AI ; plus on en utilise pour exécuter des tâches, plus cela coûte cher. Certains développeurs ont constaté que l'utilisation de J-Space augmentait la consommation de tokens de 2 à 4 fois (par exemple, le coût d'exécution de la version V4 Flash était de 50 % à 3 fois plus élevé). Non seulement les performances n'ont pas été améliorées, mais certaines tâches se sont même détériorées.

Cela signifie que, même si les améliorations annoncées par l'équipe du projet sont réelles, l'augmentation des coûts peut rendre l'outil moins avantageux. Pour les entreprises utilisant de l'IA, le coût est un facteur clé à prendre en compte.

4. Les outils d'assistance comblent les lacunes des modèles

Le projet J-Space vise à résoudre des problèmes courants chez tous les modèles AI lorsqu'ils doivent effectuer des tâches longues :

  • Dérive de la représentation : le modèle oublie son objectif en cours d'exécution (par exemple, répétition de étapes déjà effectuées ou déviation vers du contenu non pertinent).
  • Arrêt prématuré : l'arrêt de la tâche avant qu'elle ne soit terminée.

Les outils d'assistance actuels tentent de combler ces lacunes (par exemple, enregistrer l'état externe des tâches pour éviter les déviations, ou en compressant le contexte pour réduire la consommation de mémoire, tout en minimisant les pertes d'informations). Cependant, aucune solution parfaite n'a encore été trouvée.

5. Les deux directions possibles pour les outils d'assistance : universels ou personnalisés ?

Il existe deux approches principales dans le développement des outils d'assistance :

  • Universels (comme OpenCode) : visent à s'adapter à tous les modèles en divisant les tâches en plusieurs sous-agentes, mais présentent des problèmes de gestion des droits (par exemple, les sous-agentes peuvent modifier les fichiers sans autorisation).
  • Personnalisés (comme le Harness de DeepSeek ou l'Agents SDK d'OpenAI) : développés par les fabricants de modèles pour répondre aux spécificités de leurs produits, offrant une stabilité supérieure, mais sont limités à ces seuls modèles.

Chaque approche a ses avantages et inconvénients ; il n'existe pas encore de solution idéale.

Conclusion

Le projet J-Space semble plutôt être une tentative de marketing, proposant des idées pour résoudre les problèmes liés aux tâches longues, mais manquant de validation et présentant des coûts plus élevés. Cela montre que l'amélioration des performances des modèles AI dépend non seulement du modèle lui-même, mais également des outils d'assistance utilisés. À l'avenir, le développement des outils d'assistance se concentrera sur un équilibre entre amélioration des performances et maîtrise des coûts, tout en explorant à la fois des solutions universelles et personnalisées. Pour les utilisateurs et les entreprises, il est important de ne pas croire aveuglément aux promesses d'améliorations significatives sans vérification par des tiers et d'évaluer soigneusement les coûts avant de prendre une décision.