虎嗅

**Titular traducido:** En la búsqueda de la inteligencia artificial general, múltiples modelos mundiales avanzan de manera simultánea

原文:追逐通用人工智能,世界模型多头并进

Resumen del contenido principal

Este artículo se centra en los “modelos mundiales” del campo de la IA, señalando que los actuales modelos de lenguaje grande (como ChatGPT) tienen deficiencias cruciales en tareas como el razonamiento físico y la planificación espacial debido a la falta de experiencia en el mundo real. Los “modelos mundiales”, por otro lado, son sistemas capaces de simular las consecuencias reales y se consideran un camino clave hacia la inteligencia artificial general (IAG). El artículo también explora los orígenes científicos cognitivos de estos modelos, los avances en su aplicación comercial (aflujo de capital y participación de empresas líderes), las diferencias en los enfoques tecnológicos (reconstrucción a nivel de píxeles vs. representaciones abstractas), así como las muchas distancias que todavía hay para alcanzar la IAG.

Interpretación detallada

1. Las deficiencias fatales de los modelos de lenguaje grande: la falta de “conocimiento común” del mundo real

Un ejemplo simple lo ilustra: si le preguntas a una IA qué pasará cuando una taza cae al suelo, te dará una lista de términos técnicos como “energía potencial gravitacional” y “ondas de tensión”, mientras que un niño de cinco o seis años simplemente diría que la taza se romperá. ¿Por qué? Porque el núcleo de los modelos de lenguaje grande (LLM) es predecir la siguiente palabra, y aunque están entrenados con una gran cantidad de texto, nunca han visto realmente cómo cae una taza al suelo; sin experiencia en el mundo real, no pueden comprender las leyes físicas. Por ejemplo, un LLM puede recitar una ruta para navegar, pero se perdería si tuviera que desviarse (ya que solo tiene descripciones textuales y no cuenta con un “mapa mental” como el humano); tareas cotidianas como doblar la ropa son completamente fuera de su alcance, ya que solo entienden las descripciones, no la realidad. Este es el defecto fundamental de los LLM: son expertos en texto, no en el mundo real.

2. Los modelos mundiales: sistemas que permiten a la IA “imaginar” las consecuencias como lo hacen los humanos

La idea de los modelos mundiales proviene del psicólogo Clark en 1943, quien sugirió que el cerebro humano tiene un “pequeño modelo” capaz de simular las consecuencias de diferentes acciones (por ejemplo, al pensar que una taza se romperá al caer, no la tocaría intencionalmente). La posterior teoría del procesamiento predictivo sostiene que la percepción humana consiste en predecir continuamente el mundo y luego corregir esas predicciones con información visual y auditiva. Los investigadores de IA quieren que las AI tengan esta capacidad: simular las consecuencias internamente antes de actuar para evitar errores en el mundo real. Por ejemplo, Yang Likun (ganador del Premio Turing) dijo: “Una IA sin la capacidad de predecir no es verdaderamente inteligente; la inteligencia consiste en usar ideas para probar y errar en lugar nuestro”.

3. El capital se concentra en los modelos mundiales: una nueva dirección para la IA

En los últimos dos años, los modelos mundiales se han convertido en un objetivo muy codiciado por inversores y gigantes tecnológicos:

  • Li Feifei (una destacada experta en IA) fundó World Labs, que recaudó 230 millones de dólares para desarrollar inteligencia espacial;
  • Yang Likun dejó Meta para crear el laboratorio AMI, que recaudó 1000 millones de dólares dedicados a los modelos mundiales;
  • El sistema Dreamer4 de Google DeepMind ha visto muchas grabaciones de “My World” y puede buscar diamantes por sí mismo (lo que implica varios pasos, como recolectar recursos y fabricar herramientas).

Sin embargo, estos son solo prototipos: por ejemplo, Marble de World Labs es un generador de escenas 3D, mientras que Genie3 funciona más como un simulador de juegos; todavía están lejos de ser robots capaces de realizar tareas domésticas.

4. Diferencias en los enfoques tecnológicos: reconstrucción a nivel de píxeles vs. representaciones abstractas

Actualmente hay dos enfoques principales que generan intensos debates:

  • Reconstrucción a nivel de píxeles: como Dreamer4, que debe recrear cada píxel para simular con precisión el mundo después de una acción. La ventaja es la gran detalle, pero requiere una cantidad enorme de datos;
  • Representaciones abstractas: el enfoque JEPA de Yang Likun no reproduce los detalles, sino que se centra solo en la información clave necesaria para el razonamiento (por ejemplo, sabe que una taza se romperá al caer, pero no necesita conocer la ubicación de cada fragmento). La ventaja es que requiere menos datos, pero la pregunta es: ¿son las representaciones abstractas suficientes para soportar razonamientos complejos? Por ejemplo, V-JEPA2 puede aprender las leyes del movimiento de los objetos, pero aún no se ha demostrado que pueda sustentar a entidades inteligentes en entornos abiertos.

Ambos enfoques tienen sus razones: Hafner (responsable de Dreamer4) cree que también es posible aprender cosas abstractas a nivel de píxeles, mientras que Yang Likun considera que las representaciones abstractas son más eficientes.

5. Aún falta mucho para alcanzar la IAG: no solo necesitamos modelos mundiales

Incluso si los modelos mundiales se desarrollan bien, todavía hay muchos obstáculos para llegar a la IAG (inteligencia capaz de hacer todo como un humano):

  • Abstractación del tiempo: las AI solo pueden predecir lo que ocurrirá en el próximo segundo; no pueden pensar en consecuencias a largo plazo (como los humanos, que planean estudiar ahora para encontrar un buen trabajo en el futuro);
  • Metacognición: las AI no saben qué entienden y qué no; responden al azar sin darse cuenta de sus errores;
  • Causas múltiples y comprensión del pensamiento humano: los humanos pueden entender causas complejas (como “el camino está resbaladizo porque está lloviendo”) y adivinar lo que otros piensan (por ejemplo, “frunce el ceño porque está enojado”), algo que las AI aún no pueden hacer.

Los expertos dicen que los modelos mundiales son una condición necesaria, pero no suficiente; la IAG requiere una combinación de muchas otras capacidades.

Conclusión

Los modelos mundiales representan un paso importante hacia la IAG, pero no son la solución milagrosa. Aún hay un largo camino por recorrer para que las AI piensen realmente como los humanos.