虎嗅

“GPT-6 ha llegado: hemos conversado con varias personas del sector sobre los puntos fuertes y los obstáculos de la inteligencia encarnada”

原文:GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

GPT-6 ha llegado, ¿permanece el “foso de defensa” de la inteligencia encarnada? – Un análisis profundo sobre ansiedad, oportunidades y fundamentos

Hola a todos, soy vuestro periodista financiero. Recientemente, el mundo de la tecnología se ha vuelto un hervidero: OpenAI ha lanzado la versión Astra de GPT-6 y ha anunciado claramente su intención de desarrollar robots humanoides. Es como un gigante con una “espada para matar dragones” que de repente dice: “Voy a ir a cultivar”.

Para las empresas de inteligencia encarnada que están trabajando arduamente en el hardware de los robots y los algoritmos, esto no solo representa presión, sino también una crisis existencial: ¿y si la IA es lo suficientemente inteligente, necesitarán especialistas en robots? ¿Me quitarán mi trabajo?

Hoy, combinaremos las opiniones de varios expertos de la industria (como Zhu Zheng de Jijia Shijie, Zhu Xing de Ant Lingbo, Wang Qian de Zi Bian Liang) para explicar esto de manera sencilla y clara: ¿Qué ha traído realmente GPT-6? ¿Dónde está el foso de defensa de la inteligencia encarnada? ¿Debemos preocuparnos o mantener la calma?

---

I. El lobo realmente ha llegado: ¿por qué de repente todos están ansiosos?

Primero, debemos admitir que esta ansiedad tiene razones reales y no es infundada.

1. La sensación de un “ataque de reducción de dimensión”

Antes, se pensaba que desarrollar modelos de lenguaje (como ChatGPT) y robots (inteligencia encarnada) eran dos cosas diferentes. Pero ahora, GPT-6 Astra no solo puede charlar, sino también controlar brazos mecánicos directamente. En los videos de demostración, puede agarrar palillos y colocarlos en tazas de manera muy hábil.

Zhu Zheng de Jijia Shijie lo dijo muy claramente: “El lobo ya ha llegado, dejad de soñar”. Su lógica es que los modelos de lenguaje ya han “devorado” las capacidades multimodales (ver imágenes, escuchar sonidos) y ahora están empezando a afectar a la inteligencia encarnada. Además, gigantes como OpenAI tienen una ventaja abrumadora en términos de talento, potencia de cálculo y capital. Si deciden participar personalmente, será difícil para las empresas emergentes resistir.

2. La urgencia del tiempo

Zhu Zheng cree que los próximos uno o dos años son un período crítico. Las empresas de inteligencia encarnada aún no han establecido un “foso de defensa” real que otros no puedan replicar. Si los gigantes entran ahora, con su poderosa capacidad cognitiva general, podrían reducir rápidamente la brecha tecnológica y hacer que las empresas que aún están trabajando en su primera generación de productos queden fuera.

**3. La esencia de la ansiedad: temor a ser “recompensados antes de tiempo”

El corazón de esta ansiedad es que el valor de la inteligencia encarnada originalmente requeriría años de trabajo por parte de las empresas para ser verificado y realizado. Pero ahora, las empresas de modelos de gran escala podrían “recompensar” este valor al lanzar un modelo más potente, llevándose los beneficios para sí mismas. Es como si tú hubieras desarrollado un nuevo medicamento con esfuerzo, y luego una gran compañía lanzara una fórmula universal que reemplazara el tuyo.

---

II. No te apresures a llorar: no es tan fácil para los modelos de gran escala entrar en el mundo físico

Aunque la ansiedad es real, en la misma conferencia también hubo voces que ofrecieron un punto de vista más tranquilo. Zhu Xing de Ant Lingbo y Wang Qian de Zi Bian Liang hicieron una pregunta muy aguda: Si OpenAI es tan poderoso, ¿por qué no se dedica al automóvil autónomo y acaba con Tesla?

1. “Entender las reglas” no significa “saber cómo actuar”

Los modelos de lenguaje son buenos en “semántica” y “lógica”, como saber qué es un “taza” o qué significa la instrucción “colocar una taza en la mesa”. Pero el mundo físico es complejo, dinámico y lleno de fricción.

  • Capa semántica (cerebro): saber dónde está algo y a dónde enviarlo. GPT-6 es muy fuerte en esto.
  • Capa física (manos y pies): saber cómo aplicar la fuerza, cómo ajustar el ángulo, cómo manejar el deslizamiento de los objetos. Esta es la debilidad actual de GPT-6.

2. La brecha entre datos y verificación

Wang Qian señaló que el progreso de los modelos de lenguaje se debe a una gran cantidad de datos de programación y un sistema de verificación completo. Aunque hay avances en la generación de videos, esto no resuelve directamente los problemas del control de movimientos de los robots.

Las empresas de modelos de gran escala también necesitan completar la infraestructura para entrar en el mundo físico:

  • Datos reales: datos de robots que fallen o fallen al agarrar objetos en el mundo real.
  • Adaptación de hardware: diferentes brazos mecánicos y sensores requieren estrategias de control diferentes.
  • Sistema de verificación: cómo demostrar que el robot realmente hizo lo correcto. Esto requiere un sistema de evaluación complejo.

3. La distancia en capacidad industrial

Zhu Xing hizo una analogía con el automóvil autónomo: tener una capacidad de modelo líder no significa que puedas prescindir de la comprensión del escenario ni obtener datos maduros de inmediato. Determinar qué son “buenos datos” y acumular el “Know-how” para obtener datos es el trabajo más difícil.

En resumen, OpenAI tiene el cerebro más fuerte, pero no el cuerpo más ágil, ni la experiencia necesaria para lidiar con las dificultades del mundo físico.

---

III. Desglosando la verdad: ¿qué puede hacer realmente GPT-6? ¿Y qué no puede?

Para entender el verdadero lugar de GPT-6 en la inteligencia encarnada, el equipo de investigación de Xu Huazhe de Breakout Robot y RoboDojo realizó algunas pruebas muy específicas. Los resultados fueron interesantes: no es ni un “dios” ni un “inútil”, sino más bien un **“asesor poderoso”.

1. Puntos fuertes: comprensión semántica y espacial (“ver” y “pensar”)

En las pruebas, Astra se desempeñó muy bien:

  • Pudo reconocer objetos en la mesa.
  • Pudo agarrar palillos delgados e incluso ponerlos de pie para insertarlos en tazas.
  • Pudo planificar acciones como “empujar” y “desplazar” que no involucran agarrar.

Esto demuestra que GPT-6 es muy fuerte en saber qué hacer y comprender las relaciones espaciales.

2. Puntos débiles: contacto complejo y operaciones delicadas (“hacer” y “controlar”)

Cuando las tareas se vuelven más complejas, como:

  • Usar palillos para levantar objetos.
  • Apilar ropa.
  • Entregar objetos con ambas manos.

El rendimiento de Astra no fue ideal, con una tasa de éxito muy baja.

Razón: hay muchas variables “invisibles” en las interacciones físicas, como la fricción, la elasticidad de los objetos y los pequeños cambios en el centro de gravedad. Estos no se pueden determinar solo por la apariencia (visión) y deben resolverse a través de retroalimentación táctil y ajustes en tiempo real.

3. Los datos clave: la arquitectura mixta es la clave

El estudio de RoboDojo mostró un dato clave:

  • Control directo de GPT-6 Astra: tasa de éxito del 26%.
  • Control mixto de GPT-6 Astra + modelo de inteligencia encarnada especial (π₀.₅): tasa de éxito del 48%.
  • Detalles: en la arquitectura mixta, GPT-6 solo corrigió el 14.4% de los movimientos; el 85.6% restante fue realizado por el modelo de inteligencia encarnada subyacente.

Interpretación:

Esto demuestra que la combinación de razonamiento general + experiencia local es la solución óptima actual. GPT-6 se encarga de la planificación a alto nivel (como “primero tomar la taza, luego la cuchara”), mientras que el modelo subyacente se encarga de la ejecución específica (como “cómo aplicar la fuerza con los dedos”).

Conclusión: GPT-6 no “resuelve” el problema de la inteligencia encarnada, pero aumenta significativamente el potencial del sistema. Es como un comandante con experiencia, pero los soldados (modelos de control subyacentes) siguen siendo esenciales.

---

IV. ¿Dónde está el foso de defensa? Una redefinición de “datos” a “ciclo cerrado”

Dado que GPT-6 es tan poderoso, ¿dónde está realmente el foso de defensa para las empresas de inteligencia encarnada? Antes, la gente decía “tengo datos”, pero ahora esta afirmación necesita ser revisada.

1. El “barrera de datos” se está diluyendo

Li Tianyu de Yuan Ce Future compartió una tendencia: ya están utilizando GPT-6 para generar escenarios de simulación.

  • Antes: crear un escenario 3D requería mucho modelado manual, lo que era costoso y llevaba mucho tiempo.
  • Ahora: GPT-6 puede generar rápidamente activos de escenario 3D lógicos y completos mediante programación.

Esto significa que tener datos ya no es escaso, ya que el costo de producción de datos está disminuyendo. La ventaja que se obtenía acumulando datos está siendo erosionada por la capacidad de los modelos generales.

2. La verdadera barrera: la capacidad de descubrir problemas continuamente

Si los datos son fáciles de obtener, ¿qué es difícil de obtener?

  • Saber en qué situaciones los robots tienden a fallar.
  • Poder entrar en esos escenarios para recopilar datos de fallas.
  • Poder identificar la información realmente falta a partir de los fracasos.
  • Confirmar las mejoras a través del entrenamiento y la evaluación.

Esto es lo esencial. Las empresas de modelos de gran escala pueden ser buenas para “producir datos en masa”, pero las empresas de inteligencia encarnada son buenas para tropezar en el mundo real.

El foso de defensa ya no es “cuántos datos tengo”, sino “tengo un sistema cerrado que puede aprender continuamente de los fracasos y convertirlo en productos más fiables.

3. Nativo físico vs. ajuste semántico

Shen Yujun de Ant Lingbo y Min Wei de Ying Shen Zhi Neng enfatizaron un concepto: “nativo físico”.

  • El camino antiguo: ajustar modelos basados en modelos de lenguaje (VLM) o modelos de video (Video Gen) para obtener modelos de inteligencia encarnada.
  • Riesgo: si el modelo base (como GPT-6) mejora drásticamente, tu modelo ajustado se volverá obsoleto rápidamente.
  • El camino nuevo: desarrollar modelos nativos basados en leyes físicas y cambios espaciales (como modelos de mundo 4D).

Metáfora: el camino antiguo es como construir una casa en la playa; el agua (el modelo base) la destruirá con la marea; el nuevo camino es como construir una casa en roca, lo cual es más difícil, pero más estable.

---

V. El futuro del sector: no es una cuestión de “quién devora a quién”, sino de “síntesis y división del trabajo”

Finalmente, debemos salir de la mentalidad del “juego de suma cero”. La aparición de GPT-6 no significa el fin de la industria de inteligencia encarnada, sino una reorganización de la división del trabajo.

1. Infraestructura vs. entrega de aplicaciones

Min Wei de Ying Shen Zhi Neng cree que en el futuro, OpenAI podría ser más como un proveedor de infraestructura, como las redes de agua, electricidad y telefonía.

  • OpenAI/Anthropic: proporciona una poderosa capacidad cognitiva general (cerebro) como API de base o modelo base.
  • Empresas de inteligencia encarnada: se encargan de la integración de hardware, adaptación a escenarios, optimización de interacciones físicas y servicio postventa.

Lógica comercial: en un producto de robot implementado, la capacidad semántica del modelo de gran escala podría representar menos de la mitad del valor; el valor central proviene de la comprensión de las leyes físicas, la ingeniería mecánica y la interacción en escenarios complejos. Estos son trabajos difíciles y los gigantes pueden no querer hacerlos, ni pueden externalizarlos completamente.

2. Empoderamiento inverso: los robots hacen que la IA sea más inteligente

Shen Yujun planteó un punto de vista inverso: la inteligencia encarnada podría influir a su vez en los modelos de gran escala.

Los robots, a través de sus sensores, reciben información continua del entorno; estos datos reales del mundo físico son materiales de aprendizaje valiosos que los modelos puramente digitales carecen.

  • Los datos de fallas de los robots pueden enseñar a la IA sobre la gravedad.
  • Los datos de fallas en el agarramiento de los robots pueden enseñar a la IA sobre la fricción.

Conclusión: el mundo físico ofrece un nuevo camino para el desarrollo de la IA. Las empresas de inteligencia encarnada no solo son usuarios de la IA, sino también proveedores de “alimento” para su evolución.

3. Cambios en los indicadores de competencia

La competencia futura no será sobre cuál modelo tiene más parámetros, sino sobre:

  • Quién puede lograr un mayor éxito con menos experiencia de interacción.
  • Quién tiene costos de implementación más bajos.
  • Quién puede manejar mejor las anomalías en el campo y controlar los costos de mantenimiento.
  • Quién puede crear un ciclo rápido de implementación, retroalimentación y optimización.

---

Conclusión: consejos para el público en general y los profesionales

1. Para los inversores: no sigan ciegamente los conceptos de inteligencia encarnada “puramente software”, ni rechacen completamente a las empresas de hardware por la aparición de GPT-6. Centrense en aquellas empresas que tienen datos de escenarios reales en un ciclo cerrado, capacidad de desarrollo de modelos nativos físicos y pueden controlar los costos de implementación.

2. Para los emprendedores:

  • No fantasíen que pueden sobrevivir simplemente ajustando modelos de gran escala: ese es un callejón sin salida.
  • Inviertan esfuerzo en el nivel físico: dediquen su tiempo a la integración de sensores, optimización de estructuras mecánicas, recolección de datos del mundo real y análisis de casos de fallas**.

Aprovechen herramientas: utilicen herramientas como GPT-6 para reducir los costos de simulación y limpieza de datos, y inviertan los recursos ahorrados en la investigación de interacciones físicas más esenciales**.

Establezcan un ciclo cerrado: su foso de defensa no son los datos en sí, sino su capacidad de extraer “intuición física” a partir de ellos.

3. Para el público en general: GPT-6 no hará que los robots se popularicen de repente, pero los hará más inteligentes y más económicos. En los próximos años, veremos más robots “semiautomáticos” en fábricas y hogares; pueden cometer errores, pero serán cada vez más fiables.

En resumen:

GPT-6 es un “acelerador” para la inteligencia encarnada, no un “exterminador”. Acorta el tiempo necesario para que la industria demuestre su valor, pero también eleva los barreras. Los límites siguen moviéndose, pero aquellos que puedan convertir la complejidad del mundo físico en una capacidad de producto difícil de replicar mantendrán su posición.