虎嗅

Un artículo de Agent revela la verdad sobre la producción: las capacidades pueden ser acopladas, pero la ejecución debe estandarizarse.

原文:一篇Agent 论文揭开了生产真相:能力可以耦合,执行必须标准化

¡Hola! Soy tu amigo periodista financiero y economista. Hoy vamos a hablar sobre un artículo publicado en la cuenta WeChat oficial “AIGC from 0 to 1”. Aunque el título contiene términos como “artículo académico”, “agente” y “pesos” que pueden sonar técnicos, en realidad revela una verdad muy simple e incluso un poco contraintuitiva sobre la industria.

Para que lo entiendas fácilmente, he dividido este texto largo en una “resumen esencial” y una “interpretación sencilla en cinco dimensiones”.

---

📝 Resumen esencial: Entiende la noticia en una frase

Punto clave:

Antes, la gente pensaba que para hacer que los asistentes AI (agentes) fueran más inteligentes, o bien tenías que cambiar a un “cerebro” (modelo) más potente, o bien proporcionarle un “conjunto de herramientas y instrucciones” (framework/indicaciones/herramientas) mejores. Pero el último artículo científico WHALE demuestra que no se pueden optimizar por separado; es necesario hacerlo de manera alternada para obtener los mejores resultados.

Pero (aquí viene lo importante):

Aunque la optimización conjunta es más efectiva desde el punto de vista técnico, en el entorno de producción empresarial no se puede permitir que ambos evolucionen sin restricciones. Porque si el “cerebro” y las “herramientas” se adaptan demasiado bien (se acoplan profundamente), el costo de reemplazarlos puede ser exorbitante (esto se llama “impuesto de acoplamiento”).

Conclusión final:

Las capacidades pueden evolucionar juntas, pero la ejecución debe estandarizarse (los interfaces deben ser uniformes y las versiones controlables). Las empresas deben tratar al AI como un “producto de software” completo para su lanzamiento y gestión, y no como un experimento en constante cambio.

---

🔍 Desglose en profundidad: Entiende la verdad detrás de la producción de agentes AI en cinco aspectos

1. ¿Por qué no funciona solo entrenar el “cerebro” o solo modificar las “instrucciones”? (La lógica central del WHALE)

Metáfora sencilla:

Imagina que el modelo es un estudiante universitario inteligente recién graduado, y el framework ( Harness) es su caja de herramientas y flujo de trabajo.

  • Enfoque anterior:
  • O bien entrenas al estudiante (ajustes finos al modelo), sin importar si las herramientas son buenas o no. Resultado: el estudiante es inteligente, pero las herramientas son malas y no puede aprovechar su potencial.
  • O bien optimizas la caja de herramientas (cambias indicaciones, agregas funciones de búsqueda), sin importar la capacidad del estudiante. Resultado: la caja de herramientas es perfecta, pero el estudiante no puede manejarla.
  • Nueva descubrimiento del WHALE:
  • Si mantienes fija la caja de herramientas y solo entrenas al estudiante, este aprenderá a usar esas herramientas ineficientes en lugar de desarrollar habilidades reales.
  • Si mantienes fijo al estudiante y solo modificas la caja de herramientas, esta se adaptará a las limitaciones del estudiante. Cuando cambies a un estudiante más inteligente, la caja de herramientas anterior se convierte en una restricción.
  • Enfoque correcto:
  • Optimización alternada: primero entrena al “cerebro”, luego ajusta la caja de herramientas según sus nuevas características; repite el proceso. Esto permite que ambos evolucionen juntos.
  • Resultado: Los datos de los experimentos muestran que este enfoque aumenta la precisión en un 4% a 24%.

💡 Comentario del periodista:

Es como remodelar una casa: no puedes comprar el sofá más bonito (el modelo) sin considerar la ubicación de los enchufes (el framework); tampoco puedes cambiar solo los enchufes sin pensar en la comodidad del sofá. Ambos deben complementarse, pero el proceso debe ser dinámico.

2. ¿Por qué lo que funciona en el laboratorio puede convertirse en un desastre en la producción? (Diferencias en los objetivos)

Metáfora sencilla:

  • Objetivo en el artículo académico: obtener la puntuación más alta en los exámenes.
  • Objetivo en la empresa: ganar dinero, ahorrar costos y evitar problemas.

Diferencias específicas:

En el laboratorio, obtener 5 puntos adicionales en precisión puede requerir solo ejecutar el código unas cuantas veces más. Pero en el entorno empresarial, esos 5 puntos pueden significar:

  • Aumento de costos: necesidad de más servidores y más tiempo de entrenamiento.
  • Aumento de riesgos: nuevas combinaciones pueden generar errores no previstos que requieren solución manual.

Pesadilla de mantenimiento: agregar 10 parches al código por esos 5 puntos, y nadie se atreve a eliminarlos por miedo a que causen problemas.

💡 Comentario del periodista:

El mundo académico busca rendimiento óptimo, mientras que el mundo empresarial busca estabilidad y eficiencia.

Esto explica por qué muchos modelos AI que funcionan bien en las listas de clasificación no se adaptan bien a las empresas. Las empresas consideran el costo total: beneficio = valor - costo de entrenamiento - costo de mantenimiento - costo de riesgo. Si mejorar el rendimiento un 5% implica duplicar los costos de mantenimiento, no vale la pena.

3. ¿Qué es el “impuesto de acoplamiento” y por qué es más caro que el modelo en sí?

Metáfora sencilla:

El acoplamiento ocurre cuando dos componentes están tan bien conectados que no se pueden separar.

El impuesto de acoplamiento es el alto costo que se debe pagar al intentar separarlos.

Escenario real:

Supongamos que tu sistema AI consta de un modelo A y un framework B que funcionan muy bien juntos.

  • El modelo A está acostumbrado a un formato específico del framework B.
  • La lógica de manejo de errores del framework B está diseñada para las características del modelo A.
  • Ahora quieres actualizar a un modelo C (más económico o más potente).
  • Descubrirás que gran parte de la lógica del framework B ya no funciona con el nuevo modelo.
  • Tendrás que reescribir el framework B o incluso ajustar todas las interfaces.

Este proceso es doloroso y propenso a errores.

Peor aún es el “deuda técnica”:

Con el tiempo, el sistema se llena de parches para resolver problemas menores:

  • Si el modelo no funciona bien, se agrega un analizador.
  • Si el análisis falla, se añade un mecanismo de intento.
  • Si el intento entra en bucle, se añade una regla de detención.

Al final, nadie sabe qué código es realmente útil, y nadie se atreve a eliminarlo. Esto convierte el acoplamiento de un ventaja de rendimiento en una deuda técnica.

💡 Comentario del periodista:

El MLOps (mantenimiento de aprendizaje automático) enfatiza la modularidad y la reemplazabilidad para reducir el impuesto de acoplamiento. Si cada cambio de modelo requiere reescribir todo el sistema, este se vuelve frágil.

4. ¿Cómo será el sistema AI en el futuro? El “framework” se dividirá en dos partes

El artículo plantea una idea interesante: el framework no desaparecerá, pero se dividirá.

Primera categoría: Frameworks cognitivos (serán eliminados/simplificados)

  • Qué son: parches diseñados para compensar las limitaciones del modelo. Por ejemplo, recordarle al modelo que continúe si se detiene o hacer que repita sus acciones si actúa de manera incoherente.
  • Tendencia: A medida que los modelos se vuelven más inteligentes (como GPT-5, Claude 4), estos parches se vuelven innecesarios, ya que los modelos pueden hacerlo por sí mismos.
  • Ejemplo: Antes, los modelos tenían problemas con el contexto; los ingenieros agregaban funciones para reestablecerlo. Ahora, esos ajustes pueden interferir con su funcionamiento.

Segunda categoría: Frameworks sistémicos (serán cada vez más importantes)

  • Qué son: relacionados con la seguridad, los permisos y la gestión del estado.
  • ¿Tiene permiso el AI para acceder a datos sensibles?
  • ¿Qué código modificó recientemente?
  • ¿Cómo se puede recuperar si se bloquea?
  • ¿Quién aprobó su acción?
  • Tendencia: Cuanto más potente sea el modelo, más cosas puede hacer (como operar entornos de producción o interfaces de pago), mayor es el riesgo. Por lo tanto, estos mecanismos de seguridad y gestión del estado deben ser más robustos y estandarizados.

💡 Comentario del periodista:

Antes nos preguntábamos si el AI podía hacer las cosas correctamente; en el futuro, nos preguntaremos si se puede confiar en que lo haga. La inteligencia puede cambiar, pero los permisos y el estado deben mantenerse bajo control. Es por esto que empresas como Anthropic separan la gestión de sesiones, entornos de ejecución y modelos.

5. Consejos prácticos para las empresas: No busques una evolución infinita, sino lanzamientos de versiones controladas

Estrategia clave: WHALE-lite (optimización conjunta ligera)

No intentes que los sistemas AI evolucionen continuamente como seres vivos. Las empresas deben seguir un proceso de congelación-verificación-lanzamiento:

1. Fase de desarrollo: Permite que el modelo y el framework se ajusten juntos para encontrar la combinación óptima. Puedes cambiar indicaciones, herramientas y ajustar el modelo a voluntad.

2. Fase de congelación: Una vez que estés satisfecho con los resultados, congela esta combinación en una versión (por ejemplo, v1.0).

  • Esta versión incluye: pesos del modelo, código del framework, indicaciones, interfaces de herramientas, políticas de permisos y un entorno de pruebas.

3. Fase de lanzamiento: Despliega este “paquete de lanzamiento de AI” en el entorno de producción.

  • Punto clave: Lo que se lanza no es solo un modelo, sino un paquete de software completo, reproducible y auditable.

4. Actualizaciones posteriores: Solo inicia un nuevo ciclo de entrenamiento del modelo si las evaluaciones muestran que su capacidad es un cuello de botella. También modifica el framework si cambian las necesidades del negocio.

  • Cada actualización debe pasar por pruebas de regresión para asegurarse de no introducir errores.

Escenarios adecuados para la optimización conjunta: Tareas fijas, de alta frecuencia y con resultados verificables automáticamente (por ejemplo, reparación de código, mantenimiento de procesos estándar, revisión de reglas).

Escenarios inadecuados: Tareas cambiantes, que requieran juicio subjetivo, bajos volúmenes de tráfico o grandes diferencias en las necesidades de los clientes.

En estos casos, mantener la reemplazabilidad de los componentes es más importante que buscar el rendimiento óptimo.

💡 Comentario del periodista:

Es como la fabricación de automóviles:

  • Enfoque incorrecto: Cada vez que un vehículo sale de fábrica, el motor y la transmisión siguen ajustándose; cambiar el inyector hoy y la relación de engranajes mañana puede causar problemas.
  • Enfoque correcto: Ajustar el motor y la transmisión en fábrica para que funcionen de manera óptima, luego ensamblarlos en un vehículo completo y venderlo con un certificado de calidad. Si el cliente quiere funciones adicionales, compra un modelo nuevo, no esperar que el mecánico lo modifique en el camino.

---

📌 Resumen y perspectivas

El artículo concluye con una visión futurista: El MCP (Model Context Protocol) no se convertirá en el estándar universal en el mundo del AI.

  • El MCP se encarga de cómo conectar los componentes.
  • El A2A se encarga de cómo los AI se comunican entre sí.
  • Lo que realmente necesita estandarización son las acciones subyacentes: creación de tareas, cambios de estado, solicitudes de aprobación, almacenamiento de puntos de control, etc.

La infraestructura AI del futuro no será un único y completo “sistema operativo AI”, sino que estará dividida en capas:

1. Capa superior: Aplicaciones empresariales específicas.

2. Capa intermedia: Optimización de modelos y frameworks (indicaciones, ajustes, flujos de trabajo).

3. Capa inferior: Substrato del AI (identidad, permisos, entornos de pruebas, almacenamiento de estados, registros de auditoría).

Un consejo para los profesionales: Las capacidades pueden evolucionar juntas, pero la ejecución debe estandarizarse. No dejes que tus sistemas AI sean “cajas negras”; asegúrate de que sean “cajas blancas” donde puedas ver cada paso que toman, quién lo aprobó y cómo se puede revertir un error. Eso es clave para que el AI se integre con éxito en el entorno de producción.