第一财经

Los datos de inteligencia corporativa están creciendo rápidamente, pero aún no se ha completado la verificación de los modelos.

原文:具身智能数据“狂飙”,但还未完全实现模型验证

---

Resumen del contenido principal de la noticia

Este artículo señala directamente el punto de inflexión más importante en la actual industria de robots humanoides: hasta ahora, toda la industria se enfrentaba al problema crítico de una grave escasez de datos de entrenamiento. Ahora, un grupo de empresas nacionales ha sido pionero en implementar un modelo de “fábricas de recolección de datos” para la producción industrial de datos de entrenamiento de robots, logrando una capacidad de producción de datos de alta calidad que alcanza las cientos de miles de horas al año, lo que ha resuelto el problema inicial de la falta de datos. Sin embargo, la industria también ha descubierto rápidamente que los datos recopilados en escenarios simulados creados manualmente tienen un límite claro. Para crear robots humanoides que realmente puedan trabajar, es necesario seguir un ciclo positivo en el que primero se entrena al robot hasta alcanzar un nivel de competencia del 70%, luego se los coloca en escenarios reales para que trabajen y, mientras trabajan, generen datos que sirvan para mejorar los modelos. Actualmente, toda la industria se encuentra en un cruce de caminos crucial, pasando de competir en la cantidad de datos a lograr la efectividad real en los escenarios prácticos.

---

Interpretación detallada del contenido

1. ¿Por qué toda la industria está compitiendo desenfrenadamente por datos? La razón esencial es que los “libros de texto” necesarios para el entrenamiento de los robots estaban completamente agotados.

Los grandes modelos de IA que utilizamos normalmente se basan en contenido textual y de video almacenado en internet, lo que equivale a haber revisado todo el conocimiento escrito acumulado por la humanidad a lo largo de miles de años. Pero los robots humanoides necesitan aprender cómo realizar tareas en el mundo real: cómo sostener una taza sin dejarla caer, cómo evitar los jarrones al limpiar una mesa, cómo cruzar cables en el suelo, etc. No hay suficientes datos de etiquetación precisa sobre estos detalles, fuerzas y lógicas de respuesta en internet. Antes, la falta de datos era tan grave que muchos robots ni siquiera podían realizar acciones básicas como abrir una puerta. Ahora, las empresas están acumulando datos en grandes cantidades para crear una base de conocimientos “profesional” para los robots; de lo contrario, los robots humanoides seguirían siendo simplemente juguetes que mueven brazos y piernas sin propósito.

2. La industria ha creado “escuelas de conducción exclusivas para robots” y el modelo de producción industrial de datos ya está funcionando.

Antes, la recolección de datos para el entrenamiento de robots era muy ineficiente: o los robots grababan movimientos al azar, lo que resultaba en datos inútiles, o se contrataban personas para filmar videos, pero los detalles de los movimientos no eran precisos. Ahora, las empresas líderes han establecido bases especializadas para la recolección de datos, lo que es como crear escuelas de conducción gigantes para robots. Estas bases replican con precisión escenarios cotidianos como cocinas domésticas, estantes de supermercados, líneas de producción en fábricas y estantes de farmacias. Operadores especializados controlan a los robots para que realicen diferentes tareas (limpiar hornillos, organizar productos, clasificar paquetes), y cada acción se registra con precisión en términos de movimientos de las articulaciones, fuerzas y rutas. Luego, un sistema de calidad automático elimina los datos inútiles las 24 horas del día, y el contenido recolectado se procesa en la nube por la noche para ser entregado al equipo de entrenamiento al día siguiente. Este modelo ya está completamente industrializado; las bases líderes pueden producir cientos de miles de horas de datos de alta calidad al año, y algunas empresas ya han acumulado hasta un millón de horas de datos útiles, lo que equivale a proporcionar a los robots con la experiencia de “maestros experimentados”. El problema de la falta de datos se ha resuelto en gran medida.

3. Los robots entrenados en estas escuelas tienen defectos inherentes y los datos simulados tienen un límite claro.

Aunque el modelo de las fábricas de recolección de datos es rápido, los robots entrenados con ellos son como conductores novatos que han obtenido las calificaciones máximas en los exámenes teóricos, pero que se sienten perdidos en situaciones reales. Tienen tres problemas inherentes:

1. Los escenarios son demasiado “artificiales”: todos los objetos en las escuelas de conducción están colocados de manera ordenada, sin imprevistos reales (por ejemplo, el hornillo en la escuela está siempre limpio y la bayeta siempre seca, mientras que en la cocina real puede haber botellas de salsa de soja, bayetas grasientas y agua acumulada que puede causar resbalones).

2. Los estándares son inconsistentes: las reglas para la recolección de datos varían de una empresa a otra; si los datos se registran incorrectamente, los robots pueden aprender información errónea.

3. El ritmo es lento: los operadores en las fábricas de recolección de datos realizan las tareas lentamente, pero en las fábricas y restaurantes reales hay prisa. Los movimientos practicados en las escuelas no son adecuados para el ritmo real del trabajo.

4. La clave para superar estos problemas es hacer que los robots trabajen primero para luego mejorarlos en un ciclo positivo.

El camino óptimo que ha encontrado la industria es utilizar datos de alta calidad para entrenar a los robots hasta alcanzar un nivel de competencia del 70%, permitiéndoles realizar tareas básicas. Luego, se los coloca en escenarios reales para que trabajen y generen datos que mejoren los modelos. Este ciclo hace que los robots mejoren rápidamente en sus habilidades. Por ejemplo, los robots mencionados en el artículo tenían una tasa de precisión baja al principio, pero después de acumular datos, se volvieron mucho más útiles. En el futuro, adaptarse a nuevos escenarios tomará menos tiempo; aquellos que logren poner en marcha este ciclo primero serán los primeros en crear robots humanoides realmente funcionales.

5. Los “millones de horas de datos” que se muestran ahora son solo un pase para entrar al juego; la industria aún no ha decidido quién ganará.

Actualmente, las empresas compiten por acumular grandes cantidades de datos, pero ninguna se atreve a asegurar que esos datos sean suficientes para crear robots humanoides perfectos. Incluso la fórmula básica para determinar cuántas horas de datos son necesarias para desarrollar modelos útiles aún está en fase de prueba. Los “millones de horas de datos” son solo un pase para participar; el verdadero ganador será aquel que primero recopile datos reales de escenarios de trabajo reales. En los próximos uno o dos años, veremos más noticias sobre robots trabajando en centros de envío, restaurantes y fábricas. Estos escenarios aparentemente simples son, en realidad, el verdadero campo de prueba para la industria de robots humanoides.