虎嗅

Test pratique de DeepSeek V4.1 : pour 300 millions de tokens et 14 groupes de tâches, le prix est finalement plus élevé que celui de la version précédente.

原文:DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

Résumé du contenu principal

Voici le rapport d'un blogueur technologique sur les tests du nouveau modèle V4.1 Flash de DeepSeek, qui vient de débuter sa phase de test interne : ce modèle se caractérise par une architecture entièrement nouvelle et des capacités multimodales natives. L’équipe officielle a même directement sondé les utilisateurs dans les questionnaires de test pour savoir s’il pourrait remplacer le modèle V4 Pro, qui était auparavant considéré comme plus performant. Le blogueur a comparé le nouveau modèle avec l’ancienne version V4 Flash en exécutant 14 séries de tâches, consommant un total d’informations équivalent à 300 millions de caractères chinois. Il a constaté que les capacités de visualisation du nouveau modèle ont été considérablement améliorées, mais il présente également des inconvénients tels qu’une rapidité d’écriture élevée accompagnée d’une lenteur dans l’exécution des tâches, une difficulté à retenir des contenus longs et un coût plus élevé pour les tâches complexes. Il s’agit donc pas d’une mise à niveau parfaite par rapport à l’ancienne version.

---

Interprétation simplifiée par dimension

1. L’amélioration la plus remarquable : enfin, le modèle dispose d’une “vision” intégrée, il n’est plus nécessaire d’utiliser des outils externes pour interpréter les images

L’ancienne version Flash n’était capable de traiter que du texte. Lorsque vous lui fournissiez une image, elle ne pouvait pas l’analyser elle-même et devait faire appel à des outils externes pour reconnaître le texte et à des outils d’identification d’images pour reconstituer l’information visuelle, ce qui prenait des dizaines de secondes voire des minutes, avec souvent des erreurs (par exemple, elle ne reconnaissait pas les mots en anglais imprimés sur une affiche). La version V4.1 Flash est maintenant multimodale, ce qui signifie qu’elle peut analyser une image en quelques secondes et fournir une interprétation claire des données, éliminant ainsi le besoin d’utiliser des outils supplémentaires. De plus, elle est capable d’évaluer elle-même si l’image qu’elle crée est esthétiquement satisfaisante. Par exemple, lorsqu’on lui demande de dessiner un pélican en train de faire du vélo, elle pouvait parfois dessiner un cygne avec un bol ; cette nouvelle version peut détecter ces erreurs et modifier elle-même le bec de l’oiseau ou l’attitude.

2. Une vitesse d’écriture trois fois supérieure, mais pourquoi le résultat final n’est-il pas beaucoup plus rapide ? Le modèle aime trop “se réfléchir”

La vitesse d’écriture de V4.1 Flash est de plus de 200 caractères par seconde, soit trois fois celle de l’ancienne version. Cela semble très rapide au début, mais le blogueur a constaté que le temps total nécessaire pour l’exécution des tâches n’a pas vraiment diminué. Même pour créer de petits jeux, le nombre de caractères utiles produits était moins élevé et le temps total passé était même plus long que pour l’ancienne version. En analysant les logs d’exécution, il s’est avéré que le modèle consacrait le temps économisé sur la rédaction du code à des vérifications internes : après avoir écrit le code, il le testait pour détecter d’éventuelles erreurs et les corrigeait. Par exemple, pour créer un jeu, il passait 18 minutes à attendre que les outils valident le code, alors que l’ancienne version ne prenait pas autant de temps. C’est comme si vous demandiez à un stagiaire trois fois plus rapide qu’un autre de créer un PPT, mais qu’il devait vérifier les informations dix fois et demander de l’aide à trois collègues avant de vous remettre le résultat final. Vous, en tant que patron, vous vous souciez seulement du PPT final utilisable, pas de la vitesse à laquelle il écrit.

3. Des capacités très inégales : un roi pour la création de contenu, mais une mémoire défaillante pour les longs textes

Les avantages et les inconvénients du nouveau modèle sont très clairs. Il est très performant pour transformer des idées en applications fonctionnelles (par exemple, pour créer une représentation visuelle de systèmes stellaires contenant des nombres jumeaux), mais sa mémoire est très limitée pour les longs textes. Lorsqu’on lui demande de rédiger un article de 100 000 mots, il peut facilement confondre des informations. De même, lors de la création de rapports financiers, les chiffres peuvent être incorrects. Cela montre que le modèle est très efficace pour des tâches concrètes, mais pas pour des tâches de rédaction de documents longs et complexes.

4. Le nouveau modèle est-il plus coûteux ? Il recrute toute une équipe externe pour les tâches difficiles ?

Surprenant, pour les mêmes 14 tâches, le nouveau modèle a coûté 62 unités, contre 45 pour l’ancienne version, soit une augmentation de 36 %. Le blogueur a découvert que le surcoût était dû au fait que le modèle utilisait plusieurs intelligences artificielles pour gérer les tâches complexes. Par exemple, pour écrire un article de 100 000 mots, il employait plusieurs rédacteurs et vérificateurs de texte, ce qui augmentait considérablement les coûts. Pour créer un jeu vidéo, il utilisait 13 intelligences artificielles pour différents modules. L’ancienne version, en revanche, gérait tout elle-même, ce qui réduisait les coûts. L’équipe officielle a annoncé une réduction des prix le 10 septembre, avec une réduction de 60 % sur les appels de contenu déjà en cache, ce qui devrait rendre les utilisations futures moins coûteuses.