虎嗅

Die Engpässe in der Transformer-Architektur werden immer deutlicher – vier verschiedene technische Ansätze versuchen, eine Lösung zu finden. Wer wird der nächste Trend im Bereich Künstlicher Intelligenz sein?

原文:Transformer 架构瓶颈日益凸显,四大技术路线突围,谁会成为下一轮AI 风口?

---

Kurzzusammenfassung der Kerninhalte

Diese Berichtsarbeit ist wie ein Eimer kalten Wassers, der auf die derzeit hochkarätige Großmodell-Industrie gegossen wurde: Alle aktuellen Haupt-AI-Produkte – von GPT über die chinesische Plattform Tongyi Qianwen – basieren auf der im Jahr 2017 von Google entwickelten Transformer-Technologie. Diese Technologie hat die AI-Branche in den letzten sieben Jahren zu bisher unerreichten Höhen geführt, doch nun ist sie an ihre natürliche Leistungsgrenze gestoßen. Neuere Funktionen wie die Verarbeitung langer Kontexte oder die Beschleunigung von Schlussfolgerungen sind im Grunde nur Versuche, die inhärenten Mängel der alten Technologie zu beheben – sie lösen jedoch die grundlegenden Probleme wie den explosionsartigen Anstieg der Rechenkosten, die hohen Energieverbrauche sowie die Unfähigkeit, komplexe Aufgaben zu bewältigen, nicht wirklich.

Aktuell haben einige AI-Start-ups, die keine historischen Belastungen tragen, vier völlig unterschiedliche technische Ansätze entwickelt, die es ermöglichen, die Geschwindigkeit von Großmodellen um das Vielfache zu erhöhen, die Kosten auf ein Bruchteil zu reduzieren und sogar komplexe Schlussfolgerungsprozesse durchzuführen, die mit der aktuellen Transformer-Technologie nicht möglich sind. Diese Ansätze könnten die nächste Wachstumswelle in der AI-Branche auslösen und sogar das Wettbewerbsszenario der Branche grundlegend verändern.

---

Detaillierte und verständliche Erklärung

1. Warum ist die einst „göttliche“ Basis der AI heute zu einem Hindernis geworden?

Der Kernvorteil des Transformers ist zugleich auch seine größte Schwäche: Seine Logik bei der Textverarbeitung ist äußerst starr – wenn man 10.000 Wörter einfügt, muss das System jedes Wort einzeln mit den restlichen 9.999 Wörtern vergleichen und Zusammenhänge berechnen. Das ist vergleichbar damit, wenn man einen 10.000 Wörter langen Artikel liest und jede mögliche Wortkombination überdenken muss, um den Sinn des gesamten Textes zu verstehen. Diese Methode ist zwar sehr präzise, aber extrem kostspielig: Für 10.000 Wörter sind 50 Millionen Multiplikationsoperationen erforderlich. OpenAI gibt allein jährlich 50 Milliarden US-Dollar für Rechenleistung aus. Die Internationale Energieagentur prognostiziert, dass der Stromverbrauch von Rechenzentren bis 2030 verdoppelt wird – das entspricht dem Stromverbrauch von fast der gesamten Europäischen Union.

Noch problematischer ist, dass die Aufgaben, die AI heute lösen muss, immer komplexer werden. Zum Beispiel die Analyse ganzer Codebibliotheken, die unabhängige Durchführung wissenschaftlicher Forschung über mehrere Wochen oder die Lösung von Hunderttausenden mathematischer Aufgaben – all das übersteigt die Fähigkeiten des Transformers. Die aktuellen Funktionen, die auf der alten Technologie basieren, sind nur vorübergehende Lösungen, vergleichbar damit, einem 20 Jahre alten Computer zehn externe Festplatten anzuschließen, um moderne Spiele zu spielen.

2. „Abnehmen“ des Aufmerksamkeitsmechanismus: 90 Prozent der unnötigen Berechnungen entfernen – ohne Leistungseinbußen

Der erste praktische Ansatz besteht darin, das „wortweise Vergleichen“ des Transformers zu optimieren und alle unnötigen Berechnungen zu streichen, ohne das gesamte Framework zu verändern. Es gab bereits ähnliche Ansätze wie die „dünne Aufmerksamkeit“ („sparse attention“), doch diese führten zu einem Verlust der semantischen Verständnisfähigkeit der AI. Zwei Start-ups haben dieses Problem gelöst: Ein Unternehmen namens Subquadratic hat einen dynamischen Selektionsmechanismus entwickelt, der beim Lesen von Artikeln sofort entscheidet, welche Wörter wichtig sind und welche unwichtig sind; nur die wichtigen Wörter werden verglichen. Die Leistung dieses Modells hat sich nun mit den der aktuellen Marktführer angeglichen, und Tausende von Nutzern warten darauf, es auszuprobieren. Ein weiteres Unternehmen, Manifest AI, hat den traditionellen Aufmerksamkeitsmechanismus durch einen „rollenden Zusammenfassungsmodus“ ersetzt – ähnlich wie bei einer Sitzung, bei der man nur die relevanten Punkte notiert und alte Informationen automatisch löscht. Dadurch wird der Rechenaufwand um ein Vielfaches reduziert; selbst alte, offene Quellmodelle können ohne Neutraining diese Funktion nutzen.

3. Gegenintuitive Herangehensweise: Kleine Modelle sind schlauer und energieeffizienter

Während die Branche allgemein annimmt, dass größere Modelle intelligenter sind, geht das von MIT ins Leben gerufene Unternehmen Liquid AI genau den entgegengesetzten Weg. Sie kombinieren die „flüssigen neuronalen Netzwerke“, die von Würmern inspiriert sind, mit der Transformer-Technologie und erzielen Modelle, die nur ein Bruchteil der Größe herkömmlicher Modelle haben, aber viermal so leistungsfähig sind. Herkömmliche Transformer-Modelle sind nach dem Training wie „geprägte CDs“ – alle Verhaltensmuster sind festgelegt; neue Fähigkeiten können nur durch Neutraining und das Hinzufügen von Parametern erlangt werden. Die flüssigen Modelle hingegen passen ihre Denkweise dynamisch an neue Informationen an, ähnlich wie Menschen, die neue Wissen während des Lernens aufnehmen. Ihre Modelle können auf günstigen Plattformen wie dem Raspberry Pi ausgeführt werden und auch in kostengünstigen Fahrzeugschaltkreisen eingesetzt werden. Unternehmen mit einem Jahresumsatz von unter 10 Millionen US-Dollar können diese Technologie kostenlos nutzen – das senkt die Nutzungshürden für Großmodelle erheblich. In Zukunft wird es möglich sein, leistungsstarke AI-Funktionen direkt auf dem Handy zu nutzen, ohne Bedenken bezüglich Datenschutzproblemen oder langsamer Reaktionen.

4. Behebung des Problems des stufenweisen Ausgabens: AI soll ganze Abschnitte auf einmal verarbeiten

AI-Chattools zeigen, dass die Ausgabe von Inhalten oft stufenweise erfolgt – man muss lange warten, bis die Antwort vollständig ist. Dies ist auf eine inhärente Einschränkung des Transformers zurückzuführen. Ein Unternehmen hat die in der Bildgenerierung bewährte „Diffusionstechnologie“ auf die Textverarbeitung übertragen; dadurch kann AI eine Menge unsortierter Wörter direkt in einen zusammenhängenden Text umwandeln. Das neueste Modell von Inception erreicht die Leistung des GPT-4 aus dem Jahr 2023, ist jedoch nur ein Zehntel so kostspielig. Selbst Google arbeitet an Prototypen auf dieser Basis. In Zukunft werden Antworten sofort nach Eingabe der Frage bereitstehen, ohne dass man auf die stufenweise Verarbeitung warten muss.

5. Der radikale Ansatz: AI soll nicht mit Texten denken, sondern mit abstrakten Logiken

Alle aktuellen Transformer-Modelle haben eine natürliche Leistungsgrenze, da ihr gesamter Denkprozess in eine Textsequenz umgewandelt werden muss. Dies führt zu ineffizienten Prozessen und macht es schwierig, abstrakte Probleme zu lösen. Ein Unternehmen namens Pathway hat den Kernmechanismus des Transformers komplett durch eine mathematische Logik ersetzt, die es der AI ermöglicht, Informationen in abstrakte Strukturen zu komprimieren. Ihr Modell kann nun 97 Prozent der hochkomplexen Sudoku-Aufgaben lösen. Laut diesem Ansatz müssen AI-Systeme nicht nur fertige Texte lernen, sondern auch in der Lage sein, eigenständig wissenschaftliche Forschung durchzuführen oder unlösbare Probleme zu bewältigen. Dies ist die wahre Zukunft der AI.