Resumen del contenido principal
Se trata de una mesa redonda en la industria en la que participaron jóvenes académicos de primera línea del campo de la IA de varias universidades de Hong Kong. Durante toda la reunión no se habló de conceptos abstractos ni se promovieron tendencias falsas, sino que se analizaron los problemas prácticos relacionados con los llamados “modelos mundiales”, que actualmente son muy populares pero cuyas definiciones son extremadamente vagas. Se corrigió la creencia común de que “si la IA puede generar videos, entonces se trata de un modelo mundial”, se desmontaron las ilusiones de que “al analizar todos los videos de internet se podría crear un robot universal” o que “pronto aparecería una versión robótica de ChatGPT”, y se señaló que la cantidad de horas de entrenamiento mencionada con frecuencia en la industria (un millón de horas) es en realidad un número publicitario sin fundamento. El consenso alcanzado por los académicos fue que la ruta tecnológica de los modelos mundiales aún no está definida y que no se trata de un juego exclusivo para grandes empresas; pequeños equipos y emprendedores todavía tienen muchas oportunidades de hacer avances al abordar escenarios específicos.
---
Interpretación sencilla de los puntos clave
1. El 99% de los llamados “modelos mundiales” en el mercado son inútiles
Muchas personas piensan que si la IA puede generar videos coherentes, como uno en el que un gato derriba una taza de agua, eso ya constituye un modelo mundial. Sin embargo, esto es completamente erróneo: las tecnologías actuales de generación de videos simplemente combinan píxeles de manera que resulten reconocibles visualmente, pero no entienden que la taza se romperá al caer o que el agua se derramará. Un modelo mundial verdadero debería comprender las reglas del mundo real; por ejemplo, si se le pide que empuje una taza, debería poder predecir cómo se deslizará y cuánto agua se derramará, incluso si la taza está oculta por algo. Los equipos que trabajan en generación de videos, conducción autónoma o robótica utilizan el término “modelo mundial”, pero siguen caminos muy diferentes y aún están lejos de llegar a un punto de convergencia.
2. ¿Pensar que analizando todos los videos de internet se puede crear un robot universal? No es tan sencillo
Anteriormente, había la ilusión de que ChatGPT se convirtió en un modelo universal al procesar todo el texto de internet. ¿Acaso al proporcionarle videos de personas cocinando o haciendo otras actividades, se podría crear un robot que haga todo? Los académicos desestimaron esta idea: no funciona. Los videos de internet muestran solo casos de éxito, pero los robots necesitan aprender de los errores, algo que no se encuentra fácilmente en la red. Además, la flexibilidad y amplitud de movimiento de las manos humanas son muy diferentes de las de los brazos mecánicos o los robots humanoides; ver videos de campeones olímpicos no ayuda a los robots a aprender cómo actuar en situaciones reales.
3. Dejen de hablar de la “era de la inteligencia corporal de ChatGPT”: aún no hemos alcanzado ni siquiera el umbral básico
Muchas empresas de robots anuncian demostraciones de abrir puertas o verter agua y dicen que ha llegado la “era de la inteligencia corporal de ChatGPT”. Pero esto no es significativo. La capacidad central de ChatGPT es responder a problemas desconocidos de manera fiable, mientras que los robots actuales simplemente ejecutan instrucciones aprendidas previamente (por ejemplo, abrir puertas en entornos específicos). Además, los robots no mejorarán de repente; primero deben demostrar su eficiencia en entornos industriales antes de poder usarse en hogares comunes.
4. La cantidad de horas de entrenamiento mencionada es inútil
Las empresas de inteligencia corporal suelen promover que sus robots han sido entrenados durante millones de horas, pero esto no indica realmente lo que han aprendido. Por ejemplo, un robot que solo recorre el mismo camino en su casa durante 100 horas no aprende nada nuevo. En contraste, los modelos lingüísticos antiguos usaban “tokens” como unidad de datos, ya que cada palabra era nueva; sin embargo, los robots pueden repetir acciones sin aprender nada. En el futuro, la unidad de medida de datos debería basarse en cambios significativos en sus acciones, como si han interactuado con objetos nuevos o han fallado al intentar realizar tareas.
5. Los futuros robots no necesitarán personalizaciones específicas para cada tipo de cuerpo
Los robots actuales tienen la desventaja de que cualquier cambio en su diseño requiere un entrenamiento completo desde cero. Los modelos mundiales futuros deberán ser capaces de adaptarse a diferentes tipos de cuerpos y capacidades, sin necesidad de reentrenamiento para cada nuevo uso. Esto reducirá significativamente los costos de desarrollo.