Résumé du contenu principal
Ce qui semble être un simple compte-rendu pratique d'un utilisateur ordinaire enseignant à un AI à traiter des enregistrements de conversation est en réalité un exemple concret d'un projet exigeant un niveau élevé de précision : la création de séquences de captures d'écran de conversation utilisables comme preuves. Ce projet illustre l'intégralité du processus par lequel un utilisateur non expérimenté peut utiliser un AI pour accomplir des tâches complexes et non standard. À partir d'une instruction vague de « tri des captures d'écran de conversation », l'auteur a dû surmonter plusieurs obstacles, établir une quarantaine de règles de vérification rigoureuses, et finalement produire 131 captures d'écran sans aucune erreur. Cela démontre clairement le mythe selon lequel « un prompt universel suffirait pour que l'AI fasse tout ». Il s'agit d'une logique de travail pratique qui peut être réutilisée tant par les particuliers que par les entreprises souhaitant intégrer l'AI dans leurs activités.
---
Analyse détaillée
90 % des gens ne savent pas utiliser correctement l'AI ; le problème réside dans des critères d'acceptation trop vagues
Lorsque les gens rencontrent des problèmes avec l'AI, leur première réaction est souvent que « l'AI est trop stupide ». Cependant, en observant les erreurs commises par l'auteur au début, on comprend que le problème vient du fait que les critères d'acceptation étaient trop flous. L'auteur avait demandé à l'AI de proposer une solution avant de procéder, mais le rapport de qualité fourni par l'AI indiquait que « le nombre de phrases non transcrites était de 0 », alors que la moitié des captures d'écran contenait en réalité des phrases manquantes. Il ne s'agissait pas d'une tromperie de la part de l'AI : les deux parties avaient des définitions complètement différentes de ce qu'était une capture d'écran « conforme ». Pour vous, une capture d'écran conforme signifie que toutes les phrases ont été transcrites, que les éléments sont cohérents et qu'elle peut être utilisée comme preuve ; pour l'AI, cela signifie simplement qu'il n'y a pas de zones vides dans la transcription. C'est exactement le même problème que lorsqu'on confie la création d'une application à un prestataire extérieur ou qu'on assigne des tâches à des subordonnés : les résultats ne correspondent jamais aux attentes. Des exigences floues ne peuvent pas mener à des résultats précis ; si vous n'êtes pas suffisamment clair, l'AI agira selon sa logique la plus simple.
L'AI a une grande capacité d'exécution, mais il ne peut pas « comprendre » les subtilités humaines ; il faut décomposer les tâches en éléments vérifiables sans nécessiter de jugement subjectif
Les étapes suivantes de l'auteur ont consisté à transformer toutes les exigences vagues en critères de vérification objectifs. Par exemple, pour vérifier si une transcription est correcte, il ne suffit pas de regarder s'il y a des zones vides dans la transcription ; il faut vérifier trois critères : ① aucune zone vide ou en chargement, ② des textes apparaissent bien sous les bulles de voix, et ③ aucune animation de boucle dans la zone audio. De même, pour déterminer si deux captures d'écran sont continues, il ne suffit pas de comparer leur apparence ; il faut trouver un élément commun (un message, une image ou une date) entre les deux pour les considérer comme continues. L'AI, bien qu'il ait une grande capacité d'exécution, ne comprend pas les subtilités humaines. Si vous pouvez décomposer vos exigences en éléments vérifiables, il peut vérifier des milliers de captures en une seconde, avec une précision supérieure à celle de dix stagiaires travaillant manuellement toute l'après-midi. De nombreuses entreprises achètent des modèles d'IA coûteux sans parvenir à les utiliser efficacement parce qu'elles n'ont pas effectué cette étape de décomposition des tâches, espérant que l'AI fera tout tout seul, ce qui mène à des résultats inutilisables.
Pour les tâches impliquant la « véracité », il ne faut pas laisser d'espace à l'AI pour « improviser »
L'erreur commise par l'auteur au quatrième étape est très instructive : lorsque WeChat affichait des transcriptions de longues conversations avec des sauts de frame, l'AI, qui tentait de créer des captures d'écran cohérentes en suivant le sens de la conversation, se heurtait à des règles strictes : si les éléments ne correspondaient pas réellement, il ne pouvait pas inventer de contenu fictif. Cela met en évidence une faiblesse majeure des modèles d'IA : ils ont tendance à compléter les informations de manière automatique, ce qui peut conduire à des erreurs graves. Lorsque l'on utilise l'AI pour la préparation de rapports financiers ou la vérification d'informations, il est essentiel de spécifier clairement que tout doit provenir des matériaux originaux et que toute invention est interdite. Il n'existe pas de « prompt universel » ; un flux de travail efficace repose sur des itérations progressives et l'accumulation de règles de vérification.
Un flux de travail efficace pour l'AI passe par des itérations et l'ajout constant de règles
L'auteur a conclu que même si l'on demandait à l'AI de proposer une solution dès le début, il serait impossible de prévoir tous les cas particuliers (par exemple, le retour automatique à des parties précédentes de la conversation ou le saut de frame lors de l'écoute de longues vidéos). De nombreux tutoriels en ligne proposent des « prompts magiques » pour faire travailler l'AI, mais en réalité, un flux de travail efficace nécessite de tester des exemples et d'ajuster les règles progressivement. En utilisant 10 % des données pour tester et en intégrant les erreurs rencontrées dans une base de règles, on peut éviter les mêmes erreurs lors du traitement de l'ensemble des données. Cette approche est valable dans tous les domaines où l'AI est utilisé, car aucune technologie miracle ne peut réduire les coûts de 90 % dès le début ; les outils efficaces sont le résultat d'une itération continue basée sur le traitement de données réelles.