虎嗅

**Le modèle de base est mort.**

原文:The Base Model Is Dead。

Résumé des points clés

Cet article met en évidence un changement majeur dans la logique d'entraînement des grands modèles : par le passé, l'accent était mis sur le Base Model (modèle de base), qui devait absorber autant que possible de connaissances humaines. Aujourd'hui, le rôle du Base Model a évolué ; il n'est plus considéré comme un simple « récipient de connaissances », mais plutôt comme un « kit d'outils de compétences fondamentales ». Il fournit des capacités élémentaires telles que le Python et les structures de code, tandis que les capacités complexes du modèle (comme la programmation ou la résolution de tâches longues) sont acquises grâce à l'apprentissage par renforcement (RL) et à une nouvelle méthode appelée Mid-training. De plus, les données d'entraînement préparatoires ont évolué, passant d'un mélange aléatoire de pages web à des données ciblées et précises. Les frontières entre les différentes étapes de l'entraînement se brouillent de plus en plus, et le processus global peut être résumé en deux étapes : apprentissage supervisé pour poser les bases + apprentissage par renforcement pour perfectionner les applications.

1. Le Base Model : du « super bibliothèque » au « kit d'outils de base**

Auparavant, le Base Model était comme une super bibliothèque contenant Internet, Wikipédia et des livres ; à l'époque de GPT-3, 85 % des données d'entraînement préparatoires provenaient de pages web et de Wikipédia, et on pensait que plus le pré-entraînement était performant, mieux le modèle serait. L'entraînement ultérieur se limitait à un fine-tuning du style de conversation, avec un rôle limité de l'apprentissage par renforcement (RL).

Aujourd'hui, le Base Model a un autre objectif : il n'est plus chargé de réaliser directement des tâches complexes (comme la programmation d'un logiciel sur 10 heures), mais doit maîtriser des compétences fondamentales telles que la syntaxe Python, les structures de code, les opérations Git et l'appel d'API. C'est comme apprendre à cuisiner : le Base Model vous enseigne à couper les légumes, à manier la poêle et à préparer les sauces, tandis que l'apprentissage par renforcement vous apprend comment combiner ces éléments pour créer un plat complet. Le Base Model est passé d'un modèle qui sait tout à un modèle qui possède des compétences de base essentielles.

2. Les données d'entraînement préparatoires : d'un mélange aléatoire à des données ciblées

Auparavant, les données d'entraînement préparatoires étaient un ensemble hétérogène, avec 85 % de pages web ; aujourd'hui, la proportion de pages web est tombée à 15 %, et le code est devenu la principale source de données. Pourquoi ? Parce que les entreprises qui développent ces modèles savent précisément quelles compétences sont nécessaires (comme la programmation, le raisonnement ou la résolution de tâches longues), et elles fournissent donc des données adaptées à ces besoins.

De plus, les données synthétiques deviennent importantes : il s'agit de données conçues artificiellement pour correspondre aux tâches à réaliser. Par exemple, on peut modifier un code standard pour en faire un échantillon d'entraînement qui inclut la recherche de bogues, des modifications et l'appel d'outils pour résoudre des tâches. Cela permet au modèle de se familiariser avec des scénarios réels pendant le pré-entraînement, afin d'apprendre non seulement les connaissances, mais aussi comment les appliquer. C'est comme apprendre des mots en lisant des livres de vocabulaire : aujourd'hui, on apprend directement les mots, des exemples et des dialogues contextuels, ce qui est plus pratique.

3. L'apprentissage par renforcement (RL) et l'entraînement ultérieur : du « fine-tuning » à un « amplificateur de compétences**

Auparavant, l'entraînement ultérieur n'avait qu'un rôle limité dans l'amélioration des performances du modèle (par exemple, pour améliorer le style de conversation). Aujourd'hui, l'apprentissage par renforcement est devenu un élément clé : si celui-ci est bien mené, les capacités du modèle peuvent être considérablement améliorées après le pré-entraînement. Certains experts affirment que les ressources allouées au pré-entraînement et à l'entraînement ultérieur sont maintenant similaires.

Cela signifie que les capacités finales du modèle ne dépendent plus uniquement du pré-entraînement ; l'entraînement ultérieur et l'apprentissage par renforcement sont les éléments décisifs pour atteindre le potentiel maximal du modèle. C'est comme acheter une maison en état brut : auparavant, quelques modifications suffisaient, mais aujourd'hui, le coût des travaux de rénovation est comparable à celui de l'achat de la maison elle-même, et la qualité de ces travaux détermine directement le confort d'habitation.

4. Le Mid-training : une étape de transition entre le pré-entraînement et l'entraînement ultérieur

Auparavant, le pré-entraînement utilisait des données statiques (pages web, livres), tandis que l'entraînement ultérieur impliquait des tâches dynamiques (résolution de problèmes, interaction avec des agents, appel d'outils). Cette différence de style de données pouvait provoquer des difficultés pour le modèle, surtout pour les modèles multi-experts (MoE), dont les rôles étaient déjà bien définis. Le Mid-training pallie à ce problème en créant une étape de transition entre le pré-entraînement et l'entraînement ultérieur, permettant au modèle de s'habituer progressivement aux tâches complexes et aux données associées.

5. Simplification du paradigme d'entraînement : deux étapes pour développer des grands modèles

Le processus d'entraînement peut maintenant être simplifié en deux étapes principales :

  • Première étape : apprentissage supervisé (équivalent au pré-entraînement et au Mid-training) : le modèle apprend des connaissances et des compétences de base (comme les mots, le Python, la logique).
  • Deuxième étape : apprentissage par renforcement (équivalent à l'entraînement ultérieur) : le modèle teste ses capacités dans un environnement réel, apprend à combiner ces compétences pour résoudre des problèmes complexes (comme la programmation ou la prise de décisions).

Les frontières entre les différentes étapes d'entraînement se brouillent de plus en plus, et l'idée principale est de « poser d'abord les bases avant de perfectionner les applications », ce qui rend le processus plus logique.

En conclusion

Le titre de l'article (“The Base Model Is Dead”) est exagéré, mais le rôle du Base Model a effectivement évolué : il n'est plus le centre de tout, mais plutôt un point de départ essentiel. Il reste crucial, car sans ces compétences de base, l'apprentissage par renforcement ne peut pas fonctionner efficacement. Cependant, l'attention se porte désormais davantage sur la manière d'utiliser l'apprentissage par renforcement pour transformer ces compétences de base en capacités pratiques. C'est un changement majeur dans l'industrie des grands modèles, qui passe d'une approche axée sur la quantité de connaissances à une approche axée sur les capacités applicatives.