虎嗅

**GPT-6 reconoce todo; ¿qué queda del modelo de base encarnado?**

原文:GPT-6认出了万物,具身基座模型还剩什么

¿Un golpe de reducción de dimensiones en la industria de los robots? Cómo GPT-6 Astra cambia las reglas del juego de la inteligencia corpórea?

Hola a todos, soy vuestro periodista financiero y economista. Hoy vamos a hablar sobre un artículo muy interesante sobre la industria.

En resumen, durante los últimos dos años, la industria de los robots (inteligencia corpórea) ha estado contando la siguiente historia: “Los grandes modelos son inteligentes, pero no entienden el mundo físico, por lo que necesitamos entrenar un ‘cerebro’ especial para los robots”.

Sin embargo, con el reciente lanzamiento de GPT-6 Astra por parte de OpenAI, esta historia ha sido puesta en duda. Astra ha demostrado una capacidad sorprendente: puede reconstruir un entorno simulado interactivo simplemente con una imagen, sin necesidad de entrenamiento adicional.

Es como alguien que nunca ha estado en una cocina, que ve una foto de un plato, reconoce todos los ingredientes, sabe dónde deben colocarse y hasta puede simular el proceso de cocinar (aunque quizás no tenga el mismo sabor).

Esto es una gran alerta para las empresas que están invirtiendo mucho dinero en entrenar los “cerebros” de los robots. A continuación, desglosaré este artículo en cinco partes para que lo entiendáis completamente.

---

1. La capacidad central: de “hablar a partir de imágenes” a “construir mundos”, ¿qué ha hecho Astra?

Primero, debemos entender qué capacidad ha demostrado Astra y por qué es tan impresionante.

Antes, hacer que los robots comprendieran el mundo físico era un problema difícil, conocido como “Real2Sim” (del mundo real al mundo simulado). Por ejemplo, si le mostrabas a un robot una foto de una mesa con una taza y líquido, generalmente solo podía reconocer “esta es una taza” y “este es líquido”.

Pero esta vez, los desarrolladores le dieron a Astra esa imagen y le pidieron que generara un entorno simulado interactivo. Y lo logró:

  • Reconocimiento de objetos: sabía que era un recipiente y que había líquido dentro.
  • Comprensión del espacio: sabía que el líquido estaba en el recipiente y que este estaba en la mesa.
  • Restauración de detalles: incluso reprodujo el color del líquido de manera muy realista.
  • Generación de código: convirtió estas imágenes estáticas en una escena programable.

El punto clave es: Astra no recibió entrenamiento específico para esta tarea. Aprendió todo simplemente observando una gran cantidad de imágenes, videos y manuales en internet.

El único punto débil: no pudo simular la reacción química al mezclar los líquidos. Sabía cómo se ve el agua, pero no que la mezcla de agua y ácido sulfúrico puede explotar. Esto muestra que entiende lo visual, pero aún no comprende las causas físicas profundas.

En resumen: Astra es como un estudiante con mucho conocimiento teórico, pero sin experiencia práctica. Conoce el 99% de los objetos comunes del mundo y sabe cómo usarlos en general, pero no sabe cuánta es la fricción ni cuánta fuerza debe aplicar.

---

2. La crisis cognitiva: “Reconocer una manzana” ya no es una ventaja

El artículo señala que la aparición de GPT-6 ha reducido significativamente el espacio de negocio para las empresas de inteligencia corpórea, especialmente aquellas que todavía se enfocan en los “modelos base”.

Antes, si una empresa podía hacer que un robot reconociera una manzana en la mesa, eso era una capacidad técnica importante. Ahora, modelos multimodales como GPT-6, gracias a su gran cantidad de datos de entrenamiento (incluyendo imágenes, videos y artículos de internet), han creado un enorme “guía del mundo físico”.

  • No ha tocado una taza, pero ha visto a muchas personas hacerlo.
  • No ha estado en una fábrica, pero puede reconocer brazos mecánicos y líneas de ensamblaje.
  • No ha abierto cajones, pero sabe dónde están las manijas y cómo abrirlos.

Esto significa que “reconocer objetos” y “comprender escenas” se están convirtiendo en habilidades comunes, no en algo escaso. Para las empresas, si su principal ventaja es que “sus robots entienden instrucciones y reconocen objetos”, están compitiendo directamente con gigantes como OpenAI. En términos de potencia de cálculo, escala de datos y velocidad de iteración, las empresas no tienen posibilidades. Continuar entrenando modelos generales grandes y completos es costoso y probablemente solo repita lo que ya han hecho los modelos generales.

En resumen: Antes, saber “reconocer” era una habilidad valiosa; ahora, es algo básico. Si solo te basas en eso para competir, los modelos generales te quitarán tu posición.

---

3. Los límites de la capacidad: ¿por qué Astra no simuló la reacción química?

Aquí hay un detalle muy importante que marca la diferencia entre modelos generales e inteligencia corpórea:

Astra pudo reproducir el color del líquido, pero no la reacción química al mezclarlo. ¿Por qué? Porque el color es información visual que se puede aprender de muchas imágenes, mientras que las reacciones químicas involucran propiedades materiales, leyes físicas y cambios causales, lo que requiere datos y modelos más precisos.

Esto revela una lógica fundamental: reconocer objetos no significa poder manipularlos de manera fiable.

Un robot puede señalar con precisión la posición de una taza y generar instrucciones para “extender la mano, agarrarla y levantarla”, pero al ejecutarlas:

  • ¿Cuánta fuerza debe usar la garra?
  • ¿Se deslizará si el punto de contacto se desvía 2 milímetros?
  • ¿Cómo debe ajustar la velocidad después de que el líquido en la taza se mueva?
  • ¿Cuánta fricción tienen diferentes materiales?

Estas preguntas requieren información del mundo real: tacto, sensación de fuerza y experiencia de errores. Los modelos generales (como Astra) carecen de esta experiencia práctica; saben cómo es una taza, pero no su peso, su nivel de deslizamiento o su fragilidad.

En resumen: Astra es teórico; sabe cómo hacerlo, pero no cómo se siente al hacerlo. El valor de la inteligencia corpórea radica en llenar este vacío.

---

4. El desplazamiento del valor: del “cerebro” a la “experiencia práctica”

Dado que los modelos generales ya han resuelto los problemas cognitivos, ¿dónde están las oportunidades para las empresas de inteligencia corpórea? El artículo ofrece una conclusión clara: el valor se está desplazando hacia la experiencia práctica.

La futura división del trabajo podría ser la siguiente:

1. Capa cognitiva: proporcionada por modelos generales como GPT-6. Se encargan de entender instrucciones, reconocer objetos y planificar pasos de tareas.

2. Capa de predicción de acciones: realizada por modelos corporales. Predecen cómo cambiará el entorno después de una acción.

3. Capa de control: combinada con el robot físico. Resuelve problemas de precisión, control de fuerza, retrasos y seguridad en los últimos centímetros.

El nuevo obstáculo para las empresas no es la escala de sus parámetros, sino si tienen datos sobre las acciones reales que se llevan a cabo.

  • Datos de videos comunes: les dicen al modelo “una persona ha agarrado una taza” (los modelos generales ya lo han aprendido).
  • Datos de interacción con robots: registran desde qué dirección se acerca el brazo mecánico, cómo se mueven las articulaciones, cuánta fuerza aplica la garra, si el agarre es exitoso y cómo se recupera en caso de error.

Estos datos que incluyen información visual, táctil, de fuerza, estado de las articulaciones y resultados de las acciones son la verdadera experiencia para que los robots entren en el mundo físico. Son difíciles de obtener directamente de internet y difíciles de generar con solo potencia de cálculo.

En resumen: Deja de crear cerebros que saben de todo; eso es trabajo para OpenAI. Lo que debes hacer es acumular “experiencia práctica”: hacer que los robots toquen, agarren, fallen y corrijan. Quien tenga estos datos de interacción real tendrá la ventaja en la próxima etapa.

---

5. El final de la industria: La línea de salida se ha desplazado, pero el juego no ha terminado

Finalmente, el artículo llega a la conclusión de que GPT-6 no ha puesto fin a la inteligencia corpórea, sino que ha adelantado la línea de salida de la industria.

  • Antes: la línea de salida era “hacer que los robots reconozcan el mundo”.
  • Ahora: la línea de salida es “hacer que los robots cambien el mundo de manera segura y precisa”.

Si la capacidad central de una empresa es solo hacer que los robots reconozcan objetos y entiendan el lenguaje, su distancia con GPT-6 aumentará y eventualmente serán marginados. Pero si una empresa acumula una gran cantidad de datos de interacción real, puede usar GPT-6 como su “cerebro superior”, mientras que ella misma se convierte en el ejecutor físico esencial.

Consejos para los inversores:

  • Cuidado: las empresas que aún hablan de entrenar modelos generales de robots sin datos reales únicos corren un gran riesgo.
  • Oportunidades: aquellas que se enfocan en escenarios específicos (como fábricas, hogares) y pueden crear un ciclo cerrado de “despliegue-ejecución-errore-corrección-reentrenamiento”, acumulando datos de interacción de alta calidad, tienen grandes posibilidades.

En resumen: Reconocer el mundo se está convirtiendo en una habilidad común; lo que realmente importa para las empresas de inteligencia corpórea es cómo cambiar el mundo de manera segura y precisa. No compitas con AI por cuánto saben, sino por cuán bien lo hacen.