Resumen del contenido principal
Este es el texto inicial de “Breve historia de los grandes modelos en China”, que relata los dos años de incertidumbre y caos en la industria de los grandes modelos en el país desde el verano de 2021 hasta la lanzamiento de ChatGPT a finales de 2022. En ese momento, no existían casos de éxito ya establecidos, y nadie sabía qué forma finalmente adoptarían estos modelos. Instituciones de investigación, grandes empresas y emprendedores incipientes estaban actuando a ciegas: algunos crearon modelos de dimensiones diez veces superiores a las de GPT-3 sin encontrar una dirección clara para su aplicación; otros, con fondos obtenidos, ni siquiera habían pensado bien en qué producto lanzar. No fue hasta finales de 2022 que dos acontecimientos cambiaron completamente el curso del desarrollo de la industria: los Estados Unidos impusieron restricciones a la exportación de chips de IA de alta gama y ChatGPT se puso a disposición del público de forma gratuita, lo que encaminó a la industria hacia la competencia generalizada por los grandes modelos que hoy conocemos.
---
Interpretación sencilla de cada punto
1. Los grandes modelos de 2021 no estaban destinados a usuarios comunes
Actualmente, la primera imagen que asociamos con los grandes modelos es la de robots de conversación, pero los modelos de escala trillonaria desarrollados en China en ese año no tenían nada que ver con la conversación. Por ejemplo, el modelo “Wudao 2.0”, con 1.75 billones de parámetros (diez veces más que GPT-3), incluía funciones de reconocimiento multimodal y predicción de proteínas, pero carecía de una interfaz de usuario pensada para el público general. La imaginación de los profesionales de la época era muy ambiciosa: algunos veían los grandes modelos como centrales eléctricas que generaban inteligencia a partir de datos para abastecer a todos los productos de IA; otros los consideraban líneas de producción industriales que eliminarían la necesidad de que cada empresa comenzara desde cero al crear y entrenar sus propios modelos. Nadie imaginó que acabarían convirtiéndose en simples cuadros de diálogo con los que cualquiera pudiera charlar al escribir texto… Era como si hubieran construido una central eléctrica gigante con el propósito de abastecer fábricas, solo para que la gente la usara, por ejemplo, para calentar sopas, algo completamente fuera de las expectativas iniciales.
2. La competencia inicial por la cantidad de parámetros no era más que una forma de obtener fondos
Muchos criticaron posteriormente que la competencia basada en el tamaño de los parámetros no tenía sentido. Sin embargo, en ese momento, los científicos estaban descubriendo nuevas leyes: antes, el desarrollo de IA se concentraba en áreas específicas (traducción, análisis emocional, etc.). Pero con el lanzamiento de GPT-3, se dieron cuenta de que un modelo lo suficientemente grande y bien entrenado podía realizar múltiples tareas sin necesidad de entrenamiento separado. También se estableció una “ley de escala” que demostraba que cuanto más parámetros, datos y potencia de cálculo se utilizara, mayor sería la capacidad del modelo. Mientras que antes se necesitaban unas pocas tarjetas de video para la investigación, ahora se requerían cientos para verificar esta ley, similar a cómo en los juegos se necesitaba un equipo completo de equipamiento avanzado para superar desafíos.
3. Los diferentes actores del sector tenían conceptos muy dispares sobre los grandes modelos
En 2021, no existía un consenso entre los primeros desarrolladores de grandes modelos en China: algunos los veían como infraestructura pública (como centrales eléctricas), otros como herramientas para eliminar la repetitividad en el desarrollo de IA, y otros aún utilizaban métodos tradicionales. Estas diferencias se debían a que nadie había visto un modelo realmente útil en acción, por lo que nadie podía afirmar que su enfoque estuviera equivocado.
4. Los esfuerzos iniciales en la creación de grandes modelos eran extremadamente arriesgados
Aquellos que apostaron todo por ellos en 2021 eran considerados locos por la mayoría. Por ejemplo, Yan Junjie, quien más tarde desarrolló MiniMax, no tenía ni idea de qué producto lanzar; los inversores lo apoyaron porque sentían que, aunque sus ideas eran difíciles de comprender, representaban el futuro. Cuando finalmente lograron un modelo con 30 mil millones de parámetros, descubrieron que no era útil como asistente de oficina y tuvieron que crear un producto de conversación virtual. En ese momento, el desarrollo de grandes modelos no se basaba en planes comerciales claros, sino en crear modelos y luego buscar aplicaciones para ellos.
5. Dos acontecimientos a finales de 2022 cambiaron completamente las reglas del juego
Antes de octubre de 2022, la industria de los grandes modelos en China carecía de una dirección clara: se buscaba aumentar la potencia de cálculo y seguir desarrollando modelos más grandes. Pero dos eventos importantes desbarataron todos los planes: las restricciones a la exportación de chips y la disponibilidad gratuita de ChatGPT. Estos cambios indicaron que la interfaz más intuitiva para los usuarios de los grandes modelos era la conversación, lo que llevó a una competencia generalizada por su uso.