虎嗅

Deutscher Titel: Gegendestillation – Ist Zhang Yiming nur auf Ruhm aus oder versucht er wirklich, die Wahrheit ans Licht zu bringen?

原文:反蒸馏:张一鸣到底是沽名钓誉,还是正本清源?

Zusammenfassung der Kerninhalte

Am 6. August trafen zwei bedeutende Ereignisse in der AI-Branche aufeinander: Der Gründer von Google DeepMind trat zurück, da sein Modell (Gemini) hinter den Erwartungen zurückblieb; Zhang Yiming von ByteDance entschied, dass „große Modelle nicht verdünnt“ (d.h. nicht mithilfe anderer Modelle trainiert) werden sollen. Diese Entscheidung sorgte für Kontroversen in der Branche – einige kritisierten sie als Versuch, Ruhm zu erlangen, andere lobten sie als Schritt zur Wiederherstellung der Authentizität der Technologie. Der Artikel geht auf die Essenz des Prozesses der „Verdünnung“ (Modelldistillation), die Hintergründe von Zhang Yimings Entscheidung, die Kontroversen in der Branche sowie die unterschiedlichen Wege chinesischer AI-Unternehmen ein. Er zeigt, dass ByteDance einen „teuren und schwierigen“ Weg gewählt hat – doch genau diese Vielfalt ist notwendig für das Wachstum der chinesischen AI-Ökologie.

Detaillierte Analyse

1. Was bedeutet eigentlich „Modelldistillation“ – und warum wird sie so häufig verwendet?

„Modelldistillation“ ist kein chemisches Verfahren, sondern eine Methode beim Training von KI-Modellen, die in zwei Arten erfolgt:

  • Selbstverdünnung: Man verwendet ein großes Modell, um ein kleineres zu trainieren (z. B. GPT-4 zum Trainieren von GPT-3.5). Dies ist eine gängige Praxis in der Branche und wird nicht in Frage gestellt.
  • Andere Modelle verwenden: Man nutzt die Ausgaben anderer Modelle (z. B. Antworten von ChatGPT), um sein eigenes Modell zu trainieren – dies ist Gegenstand von Kontroversen.

Um es verständlicher zu machen: Die Verwendung anderer Modelle ähnelt dem Kopieren der Hausaufgaben eines guten Schülers, um schnell bessere Ergebnisse (z. B. höhere Platzierungen in Modell-Rankings) zu erzielen – doch das eigentliche Verständnis der Lösungswege bleibt oft unerprobt. Warum wird diese Methode so häufig angewendet? Weil sie schnelle Ergebnisse liefert und Rechenressourcen spart. Beispielsweise konnte DeepSeek mit nur 800.000 Datensätzen des R1-Modells die Leistung seines kleinen Modells auf ein Niveau bringen, das dem von OpenAI’s o1-preview entspricht – bei sehr geringen Rechenkosten.

Doch jetzt entstehen Probleme: Die USA nutzen die Praxis der Modelldistillation als Grund für Sanktionen; die White House wirft Unternehmen vor, Technologie zu stehlen, und Anthropic behauptet, chinesische Unternehmen würden Daten mit falschen Accounts sammeln. Zudem kann man mithilfe von IP-Informationen und Zugriffsmustern solche Praktiken nachweisen.

2. Zhang Yiming entscheidet: „Keine Modelldistillation“ – aus Angst vor Strafen oder aus Überzeugung?

Viele vermuten, dass ByteDance Angst davor hat, dass TikTok von den USA ins Visier genommen wird. Der Artikel widerlegt diese Annahme: Sogar inländische Open-Source-Modelle (wie Kimi K3) dürfen nicht mithilfe anderer Modelle trainiert werden – und dies beeinträchtigt TikTok überhaupt nicht. Die wahre Motivation könnte sein:

  • Technische Reinlichkeit: ByteDance hat letztes Jahr ein Modell ohne synthetische Daten veröffentlicht, um zu vermeiden, dass diese die Grundlagenforschung beeinträchtigen könnten.
  • Businessaspekte: Obwohl dies nicht der Hauptgrund ist: ByteDance verfügt über den größten internationalen Geschäftsbereich und möchte keine Angriffe auf sich ziehen (erinnert man sich an Project Seed, dessen Account von OpenAI gesperrt wurde).
  • Persönliche Überzeugungen: Zhang Yiming konzentriert sich nach seinem Rücktritt weiterhin auf die AI-Forschung – er besucht Reviews des Seed-Teams, liest wissenschaftliche Arbeiten bis spät in die Nacht und lässt sich von einem Professor aus Singapur beraten. Seine Entscheidung zeigt: Lieber kurzfristig zurückbleiben, als nur oberflächliche Fähigkeiten zu entwickeln.

3. Ist Modelldistillation ein „Abkürzungsweg“ oder ein „Toter Weg“?

Die Argumente auf beiden Seiten sind überzeugend:

  • Befürworter: Modellldistillation ist effektiv und spart Ressourcen; Forschungen der Tsinghua-Universität belegen, dass verdünnte Modelle leistungsfähiger sind. Auch Anthropic erkennt an, dass dies eine legitime Trainingsmethode ist.
  • Gegner: Häufig führt die ständige Nutzung anderer Modelle zu Informationsverlusten („Modellkollaps“).
  • Neutraler Standpunkt: Laut dem AI-Forscher Lambert ist Modellldistillation eher eine Form der Nachahmung, während Deep Learning ein Prozess des eigenen Erkundens ist. Die eigentliche Stärke eines KI-Systems entsteht durch eigenes Experimentieren – und diese Fähigkeiten sind in anderen APIs nicht zu finden. Allerdings kann die Nutzung von synthetischen Daten (in Kombination mit echten Daten) zu besseren Ergebnissen führen.

4. Chinesische AI-Unternehmen: Sie setzen auf mehr als nur Modelldistillation

Der Artikel zeigt anhand von drei Beispielen, dass Modelldistillation nur ein Werkzeug ist – nicht der alleinige Schlüssel zum Erfolg chinesischer KI-Entwicklung:

  • Zhipu GLM-5.3: Ohne Modellldistillation und ohne zusätzliche Parameter verbesserte das Unternehmen die Leistung mithilfe von Deep Learning und einer langfristigen Trainingsstrategie.
  • DeepSeek: Das Unternehmen trainiert seine Modelle durch Selbstspiel, unabhängig von externen Daten – sogar der Chefforscher von OpenAI anerkennt ihre innovative Herangehensweise.
  • Alibaba’s Qianwen: Obwohl es Vorwürfe der Modelldistillation gibt, dient das Modell vielen kleinen Unternehmen als Grundlage für ihr eigenes Training.

Fazit: Die Kontroversen um Modelldistillation dienen meist dazu, chinesische KI-Unternehmen zu diskreditieren; sie beeinflusst jedoch nicht die potenziellen Leistungsgrenzen der Technologie.

5. Der Wette von ByteDance: Ein schwieriger Weg – könnte der Sieg die Geschichte verändern?

Innerhalb von ByteDance wird darüber diskutiert, Modelle mit mehr als 5 bis 10 Billionen Parametern zu entwickeln. Wie schwierig ist dieser Weg?

  • Kurzfristige Herausforderungen: Liang Rubo räumt ein, dass der Abstand zu führenden ausländischen Modellen zunimmt.
  • Langfristiger Wert: Ein Erfolg würde ByteDance zu einem wichtigen Akteur auf dem globalen KI-Markt machen und die Entwicklung der chinesischen AI-Branche verändern. Fehlschlag könnte jedoch zu teuren Lehren führen.

Der Artikel betont, dass diese Vielfalt in den Ansätzen positiv ist – schließlich benötigt die chinesische AI-Ökologie unterschiedliche Strategien und Ansätze. Zhang Yimings Entscheidung verdient Respekt – sie sollte jedoch nicht als allgemeine Richtlinie für die Branche angesehen werden.

Fazit

Modelldistillation ist kein Symbol für politische Haltungen, sondern ein technisches Werkzeug. ByteDance hat sich für einen schwierigen Weg entschieden – doch genau diese Unabhängigkeit ist notwendig für Innovation in der KI-Branche. Egal wie das Ergebnis ausfällt: Es eröffnet neue Möglichkeiten für die chinesische AI-Entwicklung.