虎嗅

De una instrucción vaga a 131 capturas de pantalla de conversaciones: ¿cómo fui corrigiendo constantemente los errores del AI?

原文:从一句模糊指令到131张聊天截图,我是怎样不断纠正AI的

Resumen del contenido principal

Este artículo, que parece ser una nota práctica de un usuario común sobre cómo entrenar a la IA para procesar capturas de pantalla de conversaciones, en realidad demuestra el proceso completo de cómo una persona común puede utilizar la IA para completar tareas complejas y no estándar a través de un proyecto sencillo pero de alta exigencia: comenzando con una instrucción vaga de “organizar las capturas de pantalla de la conversación”, pasando por cuatro rondas de errores y la adición de varias docenas de reglas de verificación fiables, hasta finalmente obtener 131 capturas de pantalla sin errores. Esto demuestra completamente el mito de que “con un prompt universal, la IA puede hacer todo”, y ofrece una lógica de trabajo práctica que puede ser aplicada tanto por individuos como por empresas que utilizan la IA.

---

Desglose detallado del contenido

1. El 90% de las personas no utiliza bien la IA porque sus “criterios de aceptación” son demasiado vagos

Cuando las personas tienen problemas con la IA, su primera reacción es pensar que “la IA es demasiado tonta”, pero al ver los errores cometidos por el autor en la primera ronda, se entiende el problema: inicialmente pidió a la IA que primero elaborara un plan antes de comenzar el trabajo, pero el informe de calidad que recibió indicaba que “el número de transcripciones de voz no era cero”, aunque al abrir algunas capturas de pantalla, se descubría que había voces que no habían sido transcritas. Esto no es intención de la IA; simplemente, ambos tienen definiciones muy diferentes de lo que significa que algo es “calificado”. Para usted, una captura de pantalla es calificada si todas las voces han sido transcritas a texto, las partes de la conversación están conectadas y puede usarse como evidencia; para la IA, lo que es calificado es simplemente que no hay espacios en blanco evidentes en la transcripción. Esto es similar a cuando contratas a alguien externo para desarrollar una aplicación o asignas tareas a subordinados: lo que recibes no cumple con tus expectativas. Un requisito vago no puede dar como resultado algo preciso; si no defines claramente tus requisitos, la IA simplemente seguirá su lógica más fácil.

2. La IA tiene una gran capacidad de ejecución, pero no entiende las intenciones humanas; debes descomponer las reglas de manera que pueda verificarlas sin pensar

En las rondas posteriores, el autor descompuso todos los requisitos vagos en puntos de verificación objetivos que no requieren juicio subjetivo. Por ejemplo, para determinar si la transcripción de una voz es correcta, no basta con verificar si hay espacios en blanco; se deben verificar tres condiciones: ① no hay espacios en blanco ni barras de carga en la transcripción, ② realmente aparece texto debajo del balón de voz, y ③ no hay animaciones de relleno en la zona de la voz. Si se cumplen todas estas condiciones, la transcripción es considerada correcta. Del mismo modo, para verificar si dos capturas de pantalla son consecutivas, no basta con que se parezcan; se deben encontrar mensajes comunes en ambas, imágenes idénticas o marcas de tiempo coincidentes. La IA es muy eficiente, pero no entiende las sutilezas humanas; si puedes descomponer lo que deseas en puntos de verificación claros, puede verificar miles de capturas en un segundo, con mayor precisión que 10 estudiantes practicantes trabajando durante toda la tarde. Muchas empresas gastan millones en modelos IA grandes pero no los utilizan efectivamente porque no realizan este paso de descomposición de las reglas, esperando que la IA haga todo por sí misma, lo que resulta en productos inútiles.

3. En tareas que involucran “veracidad”, no se debe dar a la IA ningún margen de libertad

Los errores cometidos en la cuarta ronda por el autor son muy ilustrativos: cuando WeChat comenzó a procesar transcripciones de voz larga, saltaba automáticamente las partes del vídeo que no contenían ambos segmentos de la conversación. La IA, al intentar crear una captura de pantalla continua basada en el sentido de la conversación, se topó con esta restricción: no se podía crear contenido falso; si no se podía encontrar una conexión real entre las partes, se debía indicar claramente los errores o dividir la captura en segmentos. Esto demuestra el punto más débil de los modelos IA: tienen una tendencia natural a “completar la lógica” (lo que se conoce como ilusión). Muchas personas utilizan la IA para organizar informes financieros o analizar evidencia, y uno de los errores más comunes es darle a la IA la autoridad para “inferir razonablemente basándose en el sentido común”. Si no especificas que todo el contenido debe provenir 100% de los materiales originales y que no se permite inventar nada, la IA puede crear registros de conversaciones o datos financieros inexistentes. Cuando estos se utilizan como evidencia o materiales publicables, cualquier problema es difícil de rastrear.

4. No existe ningún “prompt universal”; un flujo de trabajo eficiente con IA requiere iteraciones y la creación de una biblioteca de reglas

Al final, el autor señaló que, incluso si se le pidiera a la IA que elaborara un plan desde el principio, sería imposible anticipar todos los casos especiales (como que la captura de pantalla se desplazara automáticamente al inicio de la conversación o que WeChat saltara partes de la transcripción de voz sin aviso). Estos detalles son impredecibles. Los “promptes universales” que circulan en internet son en realidad una forma de engaño; un flujo de trabajo eficiente con IA no se basa en una instrucción perfecta de una vez, sino en iteraciones pequeñas y la acumulación de reglas. Se comienza con un pequeño conjunto de datos para probar las funciones de la IA y se convierten en reglas fijas (las 43 reglas de verificación mencionadas por el autor). Cada nuevo problema encuentra su lugar en esta biblioteca de reglas, evitando que se repitan los mismos errores en futuras iteraciones. Este enfoque es común en todos los campos que utilizan la IA, ya que ninguna tecnología puede reducir costos significativamente de inmediato; los herramientas útiles se desarrollan a través del procesamiento repetido de datos reales, eliminando errores y mejorando gradualmente su funcionamiento.