虎嗅

Chinesische Großmodelle – Eine kurze Geschichte 01: Die Modelle werden immer größer – doch niemand weiß, wozu sie eigentlich werden sollen

原文:中国大模型简史01:模型越做越大,却没人知道它该变成什么

---

Zusammenfassung des Kerninhalts

Dies ist der Beginn der Analyse „Eine kurze Geschichte der chinesischen Großmodelle“, der die chaotischen ersten zwei Jahre der Branche in China vom Sommer 2021 bis zum Ende 2022, bevor ChatGPT veröffentlicht wurde, nachzeichnet: Zu dieser Zeit gab es keine erfolgreichen Beispiele für die Anwendung von Großmodellen, niemand wusste, in welcher Form diese letztendlich erscheinen würden. Forschungseinrichtungen, große Unternehmen und frühe Unternehmer setzten alles aufs Spiel – einige entwickelten riesige Modelle mit einer Parametergröße, die zehnmal so groß war wie die von GPT-3, fanden aber keine Anwendungsmöglichkeiten dafür. Andere hatten nach der Finanzierung noch nicht einmal eine klare Vorstellung davon, welches erste Produkt sie erstellen sollten. Erst Ende 2022 veränderten zwei Ereignisse die Entwicklung der Branche grundlegend: Die USA verhängten Beschränkungen für den Export hochentwickelter AI-Chips, und ChatGPT wurde der Öffentlichkeit kostenlos zugänglich gemacht, was die Entwicklung in die Richtung eines breiten Wettbewerbs um Großmodelle lenkte, wie wir ihn heute kennen.

---

Verständliche Erläuterung der Punkte

1. Die Großmodelle von 2021 waren nicht für normale Nutzer gedacht

Heute assoziiert man Großmodelle mit Chatbots, aber die in China entwickelten Modelle mit einer Parametergröße von mehreren Billionen hatten nichts mit dem Chatten zu tun. Zum Beispiel verfügte das Modell „Wudao 2.0“ über 1,75 Billionen Parameter – zehnmal so viele wie GPT-3 – und enthielt zahlreiche wissenschaftliche Funktionen wie Mehrmodalspeicherung und Proteinvorhersage, jedoch keine Interaktionsmöglichkeiten für die Allgemeinbevölkerung. Die Vorstellungen der Fachleute waren sehr „grandios“: Einige sahen Großmodelle als Kraftwerke, die Daten verarbeiteten, um Intelligenz zu erzeugen und alle kleinen AI-Produkte mit Energie zu versorgen; andere betrachteten sie als industrielle Produktionslinien, die es Unternehmen ersparen würden, von Grund auf Daten zu erheben und Modelle zu trainieren. Niemand hätte gedacht, dass Großmodelle schließlich zu einfachen Chatfenstern werden würden, in denen jeder einfach mittippen und plaudern kann – es war, als hätten sie ein riesiges Kraftwerk gebaut, das ursprünglich für die Industrie gedacht war, aber letztendlich von Privatpersonen für andere Zwecke genutzt wurde.

2. Das Wettrennen um die größte Parametergröße diente nicht der Reklame oder dem Betrug bei der Finanzierung

Viele kritisierten später, dass das Wettrennen um die größte Parametergröße sinnlos war. Tatsächlich entdeckten die Forscher damals neue Prinzipien: Bisher arbeiteten die Bereiche der KI in Isolation – Übersetzungsforschung konzentrierte sich auf Übersetzungen, Emotionsanalyse auf die Erkennung von Stimmungen – und ein Forscher konnte mit einem solchen Spezialgebiet ein Leben lang arbeiten. Doch mit dem Erscheinen von GPT-3 stellte sich heraus, dass ein großes Modell ohne zusätzliches Training verschiedene Aufgaben wie Übersetzen, Texterstellung und Mathematikaufgaben erledigen konnte. Später wurde sogar eine „Skalengesetz“ bestätigt: Je mehr Parameter, Daten und Rechenleistung man einsetzte, desto besser wurden die Fähigkeiten des Modells – es gab keine sichtbare Obergrenze. Während früher nur zwei oder drei Grafikkarten für die Forschung ausreichten, benötigte man heute Hunderte von Karten, um diese Gesetze zu überprüfen. Das Wettrennen um die größte Parametergröße diente also nicht dem Betrug von Investoren.

3. Die unterschiedlichen Ansichten der Akteure zu Großmodellen

Die ersten Akteure in China hatten keine einheitliche Vorstellung von Großmodellen und versuchten, ihre alten Methoden auf die neuen Technologien anzuwenden:

  • Die Forschungseinrichtung „Zhiyuan“ in Peking arbeitete mit Universitäten wie Tsinghua und Peking sowie Unternehmen wie Baidu und ByteDance zusammen und betrachtete Großmodelle als öffentliche Infrastruktur für die gesamte Industrie.
  • Huawei, das bisher AI-Lösungen für Unternehmen entwickelt hatte, sah Großmodelle als Mittel, um die wiederholenden Arbeiten im AI-Entwicklungsbereich zu eliminieren.
  • Baidu, mit einem Wissensgraphen von 5 Milliarden Einträgen, wollte die in der Menschheit gesammelten Erkenntnisse in die Modelle integrieren.

Wenn man diese Akteure 2021 in einer Diskussion zusammenbrachte, sprachen sie völlig unterschiedliche Dinge – niemand konnte behaupten, dass die eigene Herangehensweise falsch sei, denn niemand hatte zu diesem Zeitpunkt ein wirklich nutzbares Großmodell gesehen.

4. Die Absurdität der frühen Großmodelle-Unternehmertum

Diejenigen, die Ende 2021 ihr ganzes Kapital in Großmodelle investierten, galten als „Verrückte“. Zum Beispiel wusste Yan Junjie, der später das Modell MiniMax entwickelte, bei der Suche nach Finanzierung nicht einmal, welches erste Produkt er erstellen sollte – obwohl es weltweit noch kein vergleichbares Chatprodukt gab. Die Investoren investierten, weil sie das Potenzial des jungen Mannes erkannten, auch wenn sie seine Ideen nicht verstanden. Als sie schließlich ein Modell mit 30 Milliarden Parametern entwickelten, stellten sie fest, dass es nur Unsinn produzierte – daher entwickelten sie stattdessen ein Produkt namens Glow, das als „AI-Gesprächspartner“ diente. Die frühe Unternehmertätigkeit in der KI-Branche basierte nicht auf klaren Geschäftsplänen, sondern darauf, erst ein Modell zu erstellen und dann nach geeigneten Anwendungsszenarien zu suchen.

5. Zwei Ereignisse Ende 2022 veränderten die Spielregeln der Branche

Bis Oktober 2022 hatte die chinesische Großmodelle-Branche zwar keine klare Richtung, aber zumindest ein Ziel: Die Entwicklung größerer Modelle mit mehr Rechenleistung. Doch innerhalb von zwei Monaten veränderten zwei Ereignisse alles: Die USA verhängten Beschränkungen für den Export von AI-Chips, und ChatGPT wurde kostenlos verfügbar. Dadurch erhielt die Branche eine klare Richtung: Großmodelle sollten als Chatdienste genutzt werden. Die bisherigen Diskussionen darüber, wozu Großmodelle gut sein könnten, wurden beantwortet – plötzlich wurde klar, dass die direkteste Anwendung von Großmodellen das Chatten war. Alle bisherigen Konzepte wurden überholt, und die Branche ging von einer Phase des „Blinden tastens“ in einen Wettbewerb um die Nutzung dieser Technologie über.