Zusammenfassung der Kerninhalte
Dieser Artikel beschreibt einen bedeutenden Wandel in der Logik des Trainings großer Modelle: Früher lag der Fokus darauf, Basismodelle (Base Models) so zu entwickeln, dass sie so viel menschliches Wissen wie möglich aufnehmen konnten; heute hat sich die Rolle der Basismodelle verändert – sie sind nicht mehr „Container für Wissen“, sondern werden zu „Toolboxen für grundlegende Fähigkeiten“. Sie stellen „atomare Fähigkeiten“ wie Python und Codestrukturen bereit, während die endgültigen komplexen Fähigkeiten des Modells (z. B. Softwareentwicklung, Lösung langer Aufgaben) durch Verstärktes Lernen (Reinforcement Learning, RL) sowie das neu aufkommende Mid-training erreicht werden. Zudem haben sich die Vorverarbeitungsdaten von einer „Mischung aus unzähligen Webseiten“ zu gezielt ausgewählten und präzisen Datenquellen entwickelt, und die Grenzen zwischen den Trainingsphasen verschwimmen zunehmend. Das gesamte Prozessverlauf lässt sich nun auf zwei Schritte reduzieren: überwachtes Lernen zur Grundlage legen + RL für die Anwendungsfähigkeiten trainieren.
1. Basismodelle: Von einer „Superbibliothek“ zu einer „Toolbox“
Frühere Basismodelle waren wie Superbibliotheken, die das Internet, Wikipedia und Bücher enthielten – in der Ära von GPT-3 stammte 85 % der Vorverarbeitungsdaten aus Webseiten und Wikipedia. Man glaubte, dass je besser die Vorverarbeitung erfolgte, desto stärker das Modell würde. Die Nachtrainingsphasen beschränkten sich dabei meist auf Feinabstimmungen des Chat-Stils; der Einfluss von RL war gering.
Heute hat sich das Ziel der Basismodelle verändert: Sie müssen nicht mehr in der Lage sein, komplexe Aufgaben direkt auszuführen (z. B. 10 Stunden lang Software zu entwickeln), sondern müssen grundlegende Fähigkeiten beherrschen – wie Python-Syntax, Codestrukturen, Git-Operationen und API-Aufrufe. Das Basismodell ist wie ein Koch, der einem beibringt, Gemüse zu schneiden, das Pfannen zu wenden und Soßen zuzubereiten; anschließend lernt RL, wie man all diese Schritte kombiniert, um ein vollständiges Gericht zu erstellen. Das Basismodell ist nicht mehr „alleswissend“, sondern stellt die Grundlage für weitere komplexere Fähigkeiten dar.
2. Vorverarbeitungsdaten: Von einer „Mischung“ zu gezielter Auswahl
Früher bestanden die Vorverarbeitungsdaten aus einer „Mischung aller möglichen Informationen“; Webseiten machten dabei 85 % aus. Heute ist der Anteil von Webseiten auf 15 % gesunken – Code ist die wichtigste Datenquelle. Der Grund dafür ist, dass Modellentwickler genau wissen, welche Fähigkeiten das Modell benötigt, und entsprechend gezielte Daten bereitstellen.
Außerdem gewinnen synthetisierte Daten an Bedeutung: Anstatt reale Daten aus dem Internet zu sammeln, werden diese künstlich erstellt, um den Anforderungen der Modelle gerecht zu werden. Beispiel: Ein einfacher Codeabschnitt wird in Trainingsbeispiele umgewandelt, die das Finden von Fehlern, Modifikationen sowie die Ausführung von Aufgaben beinhalten – so lernt das Modell bereits während der Vorverarbeitung, wie es diese Fähigkeiten im echten Einsatz anwendet. Das ist praktischer als das bloße Auswendiglernen von Wörtern.
3. RL und Nachtrainingsphasen: Von Feinabstimmungen zu „Fähigkeitserweiterern“
Früher dienten die Nachtrainingsphasen nur dazu, bestehende Mängel des Modells zu beheben (z. B. Verbesserung der Chat-Funktionen); der Einfluss von RL war begrenzt. Heute ist RL entscheidend für die Steigerung der Fähigkeiten – eine gute RL-Implementierung kann das bereits vorverarbeitete Modell deutlich stärken. Branchenexperten gehen sogar davon aus, dass die Investitionen in Rechenleistung für Vor- und Nachtrainings etwa gleich hoch sind.
Das bedeutet: Die endgültigen Fähigkeiten des Modells hängen nicht mehr nur von der Vorverarbeitung ab; Nachtrainings und RL bestimmen den tatsächlichen Höchststand der Leistung. Es ist, als würde man ein Rohhaus kaufen – früher reichten geringe Kosten für die Renovierung aus, heute sind die Kosten für die Renovierung fast genauso hoch wie die des Rohhauses selbst, und die Qualität der Renovierung entscheidet darüber, ob das Haus bequem zu bewohnen ist.
4. Mid-training: Die „Pufferzone“ zwischen Vor- und Nachtrainingsphasen
Früher basierten die Vorverarbeitungsdaten auf „statischem Wissen“ (Webseiten, Bücher), während die Nachtrainingsphasen plötzlich auf dynamischen Aufgaben (Logikschritte, Interaktion mit Agenten, Tool-Aufrufe) beruhten. Dies führte oft zu Problemen bei den Modellen – insbesondere bei MoE-Modellen (Multi-Expert-Modellen), da die Aufgaben der verschiedenen Experten fest definiert waren und ein Wechsel der Daten diese Struktur störte.
Mid-training löst dieses Problem: Es schafft eine Übergangsphase zwischen Vor- und Nachtrainingsphasen, in der das Modell zuerst mit langen Kontexten, logischen Daten und Aufgabenszenarien in Berührung kommt und sich so auf die späteren Anforderungen einstellen kann. Das ist wie der Übergang von der Grundschule direkt zur Universität – ohne eine Zwischenschule würde man Schwierigkeiten haben.
5. Vereinfachung des Trainingsparadigmas: „Zwei Schritte“ zum erfolgreichen Training großer Modelle
Der gesamte Trainingsprozess lässt sich nun auf zwei Schritte reduzieren:
- Erster Schritt: Überwachtes Lernen (Vorverarbeitung + Mid-training): Das Modell lernt Wissen und grundlegende Fähigkeiten (atomare Fähigkeiten), wie z. B. das Erkennen von Wörtern, Python-Kenntnisse und logisches Denken.
- Zweiter Schritt: Verstärktes Lernen (RL): Das Modell lernt in einer realen Umgebung durch Fehlerbehebung und Feedback, wie es diese grundlegenden Fähigkeiten kombiniert, um komplexe Aufgaben zu lösen (z. B. Softwareentwicklung, Entscheidungsfindung).
Die Grenzen zwischen den früheren Phasen (Vorverarbeitung, Mid-training, Nachtraining) verschwimmen zunehmend; das Kernkonzept bleibt: Zuerst die Grundlagen legen und anschließend die Anwendungsfähigkeiten trainieren – ähnlich wie beim Lernen der Grundrechenarten vor dem Lösen von Aufgaben.
Fazit
Der Titel des Artikels „The Base Model Is Dead“ ist übertrieben, aber die Rolle der Basismodelle hat sich tatsächlich verändert: Sie sind nicht mehr das „Zentrum“ des gesamten Prozesses, sondern dienen nun als Ausgangspunkt für weitere Entwicklungen. Ohne grundlegende Fähigkeiten wäre RL nutzlos – heute liegt der Fokus jedoch darauf, wie man diese Fähigkeiten mithilfe von RL in praktische Anwendungen umsetzt. Dies markiert einen wichtigen Wandel in der Entwicklung großer Modelle: Von der Orientierung an der Menge des gesammelten Wissens hin zu einer Betonung der tatsächlichen Anwendungsfähigkeiten.