Resumen del contenido principal
Este artículo analiza un cambio significativo en la lógica de entrenamiento de los grandes modelos: en el pasado, el foco se ponía en el Modelo Base (Base Model), con el objetivo de que absorbiera todo el conocimiento humano posible; sin embargo, ahora el papel del Modelo Base ha cambiado. Ya no es un “contenedor de conocimiento”, sino más bien una “caja de herramientas básicas” que proporciona habilidades fundamentales como Python y estructuras de código. Las capacidades complejas del modelo (como desarrollar software o resolver tareas extensas) se logran mediante el aprendizaje reforzado (Reinforcement Learning, RL) y un nuevo proceso llamado entrenamiento intermedio (Mid-training). Además, los datos de preentrenamiento han pasado de ser una mezcla aleatoria de páginas web a ser información dirigida y precisa, y las fronteras entre las diferentes fases del entrenamiento se han vuelto cada vez más difusas. El proceso se simplifica en dos pasos: aprendizaje supervisado para establecer las bases + RL para desarrollar aplicaciones.
1. El Modelo Base: de “biblioteca universal” a “caja de herramientas básicas”
En el pasado, el Modelo Base era como una biblioteca que contenía internet, Wikipedia y libros; en la era de GPT-3, el 85% de los datos de preentrenamiento provenían de páginas web y Wikipedia, y se creía que cuanto mejor fuera el entrenamiento previo, más potente sería el modelo. En ese entonces, el entrenamiento posterior se limitaba a ajustar ligeramente el estilo de conversación, y el RL jugaba un papel menor.
Ahora, el objetivo del Modelo Base es diferente: no necesita ser capaz de completar tareas complejas por sí solo (como desarrollar software durante 10 horas), pero debe dominar habilidades básicas como la sintaxis de Python, las estructuras de código y las operaciones con Git. Es como aprender a cocinar: el Modelo Base te enseña a cortar ingredientes, revolver en la sartén y mezclar condimentos, mientras que el RL te ayuda a combinar estas habilidades para preparar un plato completo. El Modelo Base ha pasado de ser “que lo sabe todo” a ser una fuente de habilidades fundamentales.
2. Los datos de preentrenamiento: de una mezcla aleatoria a información dirigida
Antes, los datos de preentrenamiento eran una colección indiscriminada de páginas web; ahora, este porcentaje ha disminuido al 15%, y el código es la principal fuente de datos. ¿Por qué? Porque las empresas que desarrollan modelos saben exactamente qué habilidades necesitan (como programación, razonamiento o capacidad para resolver tareas complejas) y proporcionan datos específicos según estas necesidades.
Otro cambio importante es la importancia creciente de los datos sintéticos: en lugar de recopilar datos reales de internet, se diseñan datos artificialmente adaptados a las tareas específicas. Por ejemplo, un conjunto de datos de entrenamiento puede incluir pasos como encontrar y corregir errores en el código, llamar a herramientas y completar tareas de manera continua, lo que permite que el modelo se familiarice con escenarios reales durante la etapa de preentrenamiento, no solo con el conocimiento en sí, sino también con su aplicación práctica. Es similar a aprender palabras: en lugar de memorizar simplemente vocabulario, ahora se aprenden palabras junto con ejemplos y diálogos contextuales, lo que es mucho más útil.
3. RL y el entrenamiento posterior: de un ajuste fino a un potenciador de habilidades
Antes, el entrenamiento posterior servía principalmente para mejorar pequeños detalles (como mejorar el estilo de conversación del modelo); ahora, el RL se ha convertido en el elemento clave para mejorar las capacidades del modelo. Si el RL se realiza correctamente, el modelo puede mejorar significativamente incluso después del preentrenamiento. Algunos expertos afirman que la inversión en recursos computacionales para el preentrenamiento y el entrenamiento posterior es similar.
Esto significa que las capacidades finales del modelo no dependen únicamente del preentrenamiento; el entrenamiento posterior y el RL son los factores que determinan su potencial máximo. Es como comprar una casa en bruto: antes, la renovación requería poco dinero, pero ahora el costo de la renovación es similar al de la compra de la casa en sí, y la calidad de esta renovación afecta directamente la comodidad de vivir en ella.
4. El entrenamiento intermedio: una transición entre preentrenamiento y entrenamiento posterior
Antes, el preentrenamiento se basaba en conocimiento estático (páginas web, libros), mientras que el entrenamiento posterior involucraba tareas dinámicas (razonamiento, interacción con agentes, uso de herramientas), lo que causaba problemas de compatibilidad entre los datos. Esto es especialmente evidente en modelos multiexpertos (como MoE), donde la división del trabajo entre los expertos está establecida y un cambio repentino en los datos puede perturbar su funcionamiento.
El entrenamiento intermedio resuelve este problema, proporcionando una etapa de transición entre el preentrenamiento y el entrenamiento posterior, lo que permite al modelo familiarizarse con contextos extensos, datos de razonamiento y escenarios de tareas. Es como pasar directamente de la escuela primaria a la universidad; el entrenamiento intermedio actúa como una etapa de transición para que todo sea más fluido.
5. Simplificación del paradigma de entrenamiento: dos pasos para desarrollar grandes modelos
El proceso de entrenamiento se puede simplificar en dos etapas principales:
- Primera etapa: Aprendizaje supervisado (que incluye el preentrenamiento y el entrenamiento intermedio): permite que el modelo adquiera conocimientos y habilidades básicas (como reconocer palabras, usar Python y comprender la lógica).
- Segunda etapa: Aprendizaje reforzado (RL): permite que el modelo experimente y reciba feedback en un entorno real, combinando las habilidades adquiridas para resolver problemas complejos (como desarrollar software o tomar decisiones).
Las fronteras entre las diferentes fases del entrenamiento se han vuelto más difusas, y el enfoque general es “establecer primero las bases y luego desarrollar aplicaciones”, lo que hace que el proceso sea más lógico.
Conclusión
El título del artículo (“El Modelo Base está muerto”) es exagerado, pero el papel del Modelo Base ha cambiado de ser el elemento central a ser un punto de partida. Sigue siendo importante, ya que sin las habilidades básicas no se pueden desarrollar capacidades avanzadas mediante el RL. Este cambio representa una evolución clave en la industria de los grandes modelos, que ha pasado de buscar una gran cantidad de conocimiento a enfocarse en la capacidad para aplicarlo efectivamente.