Resumen del contenido central
La industria de la inteligencia corpórea (IA de robots capaces de interactuar con el mundo físico) está en auge, pero existe un malentendido sobre la idea de que "un millón de horas de datos llevarán al momento del GPT". La efectividad de los datos (densidad de información, cobertura de casos difíciles, transferibilidad) es más importante que su cantidad. Actualmente, la industria está pasando de acumular datos a mejorar la eficiencia, priorizando escenarios industriales y comerciales (los robots con ruedas son más prácticos que los humanoides). A corto plazo, no es necesario elegir entre los enfoques VLA (Learning from Anterior Videos) y los modelos basados en el mundo real. El valor de las empresas de datos radica en un ciclo cerrado que incluye la recolección, entrenamiento, despliegue y análisis de los fracasos, no simplemente en la cantidad de datos. No hay una diferencia significativa entre China y Estados Unidos; China tiene ventajas en cadena de suministro y hardware.
Desglose detallado
1. ¿Un millón de horas es solo un truco? Los datos efectivos son lo que realmente importa
Muchas personas creen que la inteligencia corpórea necesita "un millón de horas de datos", pero Peng Pai de Kuwa Technology proporcionó un ejemplo contraintuitivo: un modelo no aprenderá mucho al recorrer 100 kilómetros por una carretera común; en cambio, un plástico flotante en un mercado puede revelar las diferencias en el reconocimiento de obstáculos flexibles entre los sensores láser y visuales. Este es el ejemplo del "beneficio informativo" que proporcionan los datos reales.
Criterios clave para evaluar la calidad de los datos:
- La fuente digital no es fiable: muchos casos de "un millón de horas" se calculan a partir del número de tokens de modelos de lenguaje, lo que no permite verificar ni refutar su validez.
- Los datos efectivos deben cumplir con tres criterios: ① ser explicables (los fracasos deben atribuirse a factores específicos como el ángulo, la fuerza o la estrategia); ② tener una alta densidad de casos difíciles (escenarios poco comunes pero propensos a errores, como tormentas o tráfico mixto); ③ ser reutilizables en diferentes robots (no ser un costo único).
- El punto de inflexión económico para dejar de acumular datos es cuando el valor empresarial de los nuevos datos es menor que el costo de su recolección; por ejemplo, si los datos de un escenario alcanzan una tasa de éxito del 99%, seguir recolectándolos no es rentable.
2. La pirámide de datos ha cambiado: videos humanos como base y casos difíciles reales como elemento clave
La "receta" para entrenar la inteligencia corpórea ya no es fija; ahora existe una pirámide dinámica de datos:
- Base: Videos en primera persona realizados por personas (como videos de cocinar o limpiar) son de gran escala y facilitan el aprendizaje entre diferentes robots.
- Medio: Datos simulados/sintéticos utilizados para simular escenarios extremos (como fallos en centrales nucleares) y complementar casos de fracaso difíciles de recolectar en la realidad.
- Cima: Casos difíciles reales (problemas que surgen durante el funcionamiento del robot) son los más valiosos, ya que mejoran directamente la estabilidad del modelo.
Lógica central: Estos tres niveles deben interactuar de manera circular; por ejemplo, si un robot tiene problemas con plásticos en la realidad, se pueden usar simulaciones para replicar el problema y luego videos humanos para complementar ese escenario.
3. Enfoques de modelado: VLA o modelos basados en el mundo real, no hay necesidad de elegir a corto plazo
Existen dos enfoques principales en la industria: VLA (aprender acciones directamente a partir de videos) y modelos basados en el mundo real (aprender primero las leyes físicas antes de tomar decisiones). Los expertos coinciden en que cuando se dispone de suficientes datos, los resultados de ambos enfoques son similares.
- Sistemas jerárquicos son más prácticos: Google Gemini Robotics es un ejemplo; modelos superiores se encargan de comprender las tareas (como "limpiar"), mientras que modelos VLA inferiores se ocupan de la ejecución (como "girar el cepillo"); capacidades existentes como SLAM pueden utilizarse directamente.
- Escenarios comerciales no requieren una solución única: Muchos clientes solo necesitan que los robots completen tareas de manera estable, sin que un único modelo haga todo.
4. Comercialización: comenzar por escenarios intermedios; los robots humanoides no son esenciales
La automatización anterior se centraba en "adaptar el entorno al robot" (por ejemplo, robots de limpieza en centros comerciales cerrados), mientras que la inteligencia corpórea actual busca que "el robot se adapte a la sociedad humana" (por ejemplo, robots de limpieza en calles abiertas).
Prioridades de implementación:
- Excluir escenarios extremos: escenarios industriales altamente personalizados (donde la automatización tradicional ya está consolidada y los beneficios son bajos); escenarios domésticos (demasiado complejos, con ancianos, niños y mascotas, lo que dificulta obtener ganancias rápidamente).
- Escenarios intermedios como fábricas y centros comerciales: hay demanda de personalización pero también necesidad de generalización; la interacción humano-robot no es frecuente.
- Los robots humanoides no son una necesidad absoluta: Guo Junliang de Qianxun Intelligence señala que un chasis con ruedas y mecanismos de elevación puede cubrir más del 95% de las tareas actuales; para los clientes, lo importante es que el robot funcione de manera estable, tenga un bajo costo de mantenimiento y un buen retorno sobre la inversión, no su apariencia.
5. Cómo sobrevivir en la industria de datos: la eficiencia del ciclo cerrado es más importante que la cantidad
La competitividad de las empresas de datos no radica en recolectar la mayor cantidad de datos, sino en garantizar que los fracasos sean analizados y utilizados para mejorar los modelos:
- Un ciclo cerrado (recolección → selección → entrenamiento → despliegue → análisis de fracasos) es clave para el éxito; por ejemplo, si un robot se atasca con un plástico mientras limpia la calle, la empresa debe registrar este error para que el modelo lo evite en el futuro.
- Los datos deben ser flexibles y transferibles a diferentes dispositivos (por ejemplo, cambiar las pinzas no impide el uso de los datos existentes).
- Las empresas de datos deben trabajar estrechamente con los equipos de modelado; saber qué capacidades necesitan los modelos y proporcionar datos relevantes (datos repetitivos en escenarios comunes son poco útiles, mientras que los casos difíciles sí lo son).
Conclusión
La competencia en la inteligencia corpórea ha pasado de ver quién tiene más datos a quién es más eficiente. Un millón de horas es solo el punto de partida; el verdadero umbral es saber cómo convertir los errores costosos de la realidad en experiencias que ayuden a los modelos a no repetirlos. Para los usuarios comunes, los robots del futuro probablemente no serán humanoides, pero sí más inteligentes: serán capaces de evitar obstáculos en el mercado o en las calles y integrarse mejor en nuestras vidas diarias.