Hallo! Ich bin Ihr Freund, der Finanzjournalist und Wirtschaftswissenschaftler. Heute möchten wir über einen Artikel aus dem WeChat-Kanal „AIGC von 0 zu 1“ sprechen. Obwohl der Titel Wörter wie „Paper“, „Agent“ und „Weight“ enthält, die sehr technisch klingen, enthüllt der Artikel tatsächlich eine sehr einfache – und sogar etwas „gegenintuitive“ – Wahrheit über die Branche.
Um es Ihnen leichter zu machen zu verstehen, habe ich diesen langen Artikel in eine „Kernzusammenfassung“ und eine „detaillierte Erklärung in fünf Dimensionen“ aufgeteilt.
---
📝 Kernzusammenfassung: Die wichtigste Erkenntnis aus dem Artikel
Hauptpunkt:
Früher dachte man, dass man AI-Assistenten (Agents) intelligenter machen könnte, entweder indem man ihnen ein besseres „Gehirn“ (Modell) gab oder indem man ihnen bessere „Hände und Anweisungen“ (Harness, also ein Ausführungsframework/Anweisungssatz/Toolchain) zur Verfügung stellte. Doch die neueste Forschung des WHALE-Papers zeigt: Beides kann nicht getrennt voneinander optimiert werden – es ist am besten, wenn man sie abwechselnd verbessert.
Aber (der wichtige Punkt):
Obwohl eine gemeinsame Optimierung technisch die beste Lösung ist, darf man dies in der praktischen Unternehmensumgebung nicht unbegrenzt tun. Denn wenn das „Gehirn“ und die „Hände“ zu eng miteinander verbunden sind („Kopplung“), werden die Kosten für einen Wechsel extrem hoch (das nennt man „Kopplungszoll“).
Fazit:
Fähigkeiten können zusammen verbessert werden, aber die Ausführung muss standardisiert sein (die Schnittstellen müssen einheitlich und die Versionen kontrollierbar sein). Unternehmen sollten AI als ein vollständiges „Softwareprodukt“ betrachten und verwalten – und nicht als ein ständig sich veränderndes Experiment.
---
🔍 Detaillierte Erklärung in fünf Aspekten: Die Wahrheit hinter der Entwicklung von AI-Assistenten
1. Warum „nur das Gehirn trainieren“ oder „nur die Anweisungen ändern“ nicht funktioniert? (Die Kernlogik des WHALE-Papers)
Verständliche Metapher:
Stellen Sie sich vor, das Modell ist ein intelligenter Universitätsabsolvent und das Harness ist die Werkzeugtasche und der Arbeitsablauf, die er verwendet.
- Frühere Ansätze:
- Entweder man trainiert nur das Modell (Feinabstimmung des Modells), ohne Rücksicht auf die Qualität der Werkzeugtasche. Ergebnis: Das Modell ist intelligent, aber die Werkzeugtasche ist schlecht, sodass es seine Fähigkeiten nicht voll ausschöpfen kann.
- Oder man optimiert nur die Werkzeugtasche (Änderung der Anweisungen, Hinzufügen von Suchfunktionen), ohne Rücksicht auf die Fähigkeiten des Modells. Ergebnis: Die Werkzeugtasche ist perfekt, aber das Modell ist nicht leistungsfähig genug.
- Neue Erkenntnis des WHALE-Papers:
- Wenn man die Werkzeugtasche festlegt und nur das Modell trainiert, lernt das Modell, mit dieser schlechten Werkzeugtasche zurechtzukommen – anstatt echte Fähigkeiten zu entwickeln.
- Wenn man das Modell festlegt und nur die Werkzeugtasche ändert, passt sich die Werkzeugtasche an die Besonderheiten des Modells an. Wenn man dann ein neueres, intelligenteres Modell verwendet, wird die alte Werkzeugtasche zu einer Einschränkung.
- Richtige Vorgehensweise:
- Abwechselnde Optimierung: Zuerst das Gehirn trainieren, dann die Werkzeugtasche an die neuen Eigenschaften des Gehirns anpassen; wiederholen Sie diesen Prozess. Die Experimente zeigen, dass diese Methode eine Genauigkeitssteigerung von 4 bis 24 Prozent bringt.
💡 Kommentar des Journalisten:
Das ist wie beim Hausbau: Man kann nicht nur das beste Sofa kaufen, ohne auf die Anordnung der Steckdosen zu achten; man kann auch nicht nur die Steckdosen ändern, ohne auf den Komfort des Sofas zu achten. Beides muss zusammenpassen – und dieser Prozess muss dynamisch sein.
2. Warum kann eine „hohe Punktzahl“ im Labor in der Praxis zu einem „Desaster“ werden? (Der Unterschied zwischen wissenschaftlichen und unternehmerischen Zielen)
Verständliche Metapher:
- Wissenschaftliches Ziel: Hohe Testergebnisse. Ein Plus von 5 Punkten bedeutet einen Sieg.
- Unternehmensziel: Gewinn erzielen, Kosten sparen, Fehler vermeiden.
Konkreter Unterschied:
Im wissenschaftlichen Kontext reichen oft nur wenige Codeänderungen aus, um die Genauigkeit zu verbessern. In der Unternehmenspraxis bedeutet ein Plus von 5 Punkten jedoch:
- Erhöhte Kosten: Mehr Server, längere Trainingszeiten.
- Zuhohe Risiken: Neue Kombinationen können unerwartete Fehler verursachen, die man manuell beheben muss.
- Wartungskatastrophen: Um diese 5 Punkte zu erreichen, werden oft viele Patches in den Code eingefügt. Nach einigen Monaten weiß niemand mehr, welche Patches entfernt werden dürfen, ohne dass das System zusammenbricht.
💡 Kommentar des Journalisten:
Die Wissenschaft strebt nach „extremer Leistung“, während die Industrie nach „stabiler Effizienz“ sucht. Das erklärt, warum viele AI-Modelle, die in Tests sehr gut abschneiden, in der Praxis nicht funktionieren. Unternehmen betrachten das Gesamtbild: **Gewinn = Wert – Trainingskosten – Wartungskosten – Risikokosten*. Wenn eine Verbesserung von 5 Prozent zu doppelt so hohen Wartungskosten führt, ist das keine gute Investition.
3. Was ist der „Kopplungszoll“ – und warum ist er teurer als das Modell selbst?
Verständliche Metapher:
Kopplung bedeutet, dass zwei Komponenten so eng miteinander verbunden sind, dass sie nicht getrennt werden können.
Kopplungszoll ist der hohe Preis, den man zahlen muss, wenn man eine dieser Komponenten entfernen will.
Beispiel: Stellen Sie sich vor, Ihr AI-System besteht aus Modell A und Framework B, die perfekt zusammenarbeiten.
- Probleme bei einem Upgrade: Wenn Sie auf Modell C upgraden wollen, funktioniert vieles im Framework B nicht mehr. Sie müssen das Framework neu schreiben oder alle Schnittstellen anpassen – ein sehr aufwendiger und fehleranfälliger Prozess.
Schlimmer noch: Technischer Schuldenberg:** Mit der Zeit sammeln sich viele Patches im System an, um kleine Probleme zu beheben:
- Unstabile Modellausgaben? Fügen Sie einen Parser hinzu.
- Fehlschläge bei der Ausführung? Fügen Sie einen Wiederholungsmechanismus hinzu.
- Endlose Wiederholungen? Fügen Sie ein Abbruchverfahren hinzu.
Am Ende weiß niemand mehr, welcher Code wirklich nützlich ist – und niemand wagt es, etwas zu entfernen. Das ist, wenn eine „Leistungsvorteil“ zu einem „technischen Schuldenberg“ wird.
💡 Kommentar des Journalisten:
MLOps (Machine Learning Operations) legt Wert auf Modularität und Austauschbarkeit, um den „Kopplungszoll“ zu reduzieren. Wenn man jedes Mal das gesamte System neu schreiben muss, wenn das Modell gewechselt wird, ist das System anfällig.
4. Wie wird das AI-System der Zukunft aussehen? Die **Harness**-Komponenten werden sich trennen
Der Artikel macht die interessante Aussage: Die Harness-Komponenten werden nicht verschwinden, aber sie werden sich weiterentwickeln.
Erste Kategorie: Kognitive Harness (werden überflüssig):
- Was das bedeutet: Patches, die dazu dienen, die Schwächen des Modells auszugleichen (z. B. Erinnerungen an fehlende Informationen, Wiederholungen von Aktionen).
- Trend: Je intelligenter die Modelle werden (z. B. GPT-5, Claude 4), desto weniger benötigen sie solche Hilfsmittel – sie wissen oft selbst, was zu tun ist.
Zweite Kategorie: Systemische Harness (werden wichtiger):
- Was das bedeutet: Funktionen, die unabhängig von der Intelligenz des Modells sind, z. B. Sicherheit, Berechtigungen, Zustandsmanagement.
- Beispiele: Werde das AI-System Berechtigungen zum Datenbankzugriff haben? Was hat es gerade geändert? Wie kann es Fehler beheben? Wer hat die Aktion genehmigt?
- Trend: Je leistungsfähiger die Modelle werden, desto mehr Aufgaben können sie übernehmen – und desto wichtiger wird das Sicherheitsmanagement.
💡 Kommentar des Journalisten:
Früher ging es darum, ob AI richtig handelt; in Zukunft geht es darum, ob AI vertrauenswürdig handeln kann. Die Fähigkeiten ändern sich, aber die Berechtigungen und der Zustand müssen stabil bleiben. Deshalb trennen Unternehmen Funktionen wie „Konversationen“, „Ausführungsumgebungen“ und „Modelle“ voneinander.
5. Praktische Ratschläge für Unternehmen: Keine „unbegrenzte Evolution“, sondern „Versionenveröffentlichung“
Strategie: WHALE-lite (verteilte Optimierung)
Versuchen Sie nicht, das AI-System wie ein lebendiges Wesen ständig weiterzuentwickeln. Unternehmen sollten einen „Einfrieren-Verifizieren-Veröffentlichen“-Prozess anwenden:
1. Entwicklung: Lassen Sie Modell und Framework gemeinsam entwickeln, um die beste Kombination zu finden. Ändern Sie Anweisungen, wechseln Sie Werkzeuge, feinabstimmen Sie das Modell.
2. Einfrieren: Sobald das Ergebnis zufriedenstellend ist, „frieren“ Sie die Kombination in eine Version (z. B. v1.0). Diese Version enthält: Modellgewichte, Framework-Code, Anweisungen, Schnittstellen, Berechtigungsrichtlinien, Sandlagerumgebung.
3. Veröffentlichung: Verwenden Sie diese „AI-Veröffentlichungspaket“ in der Produktion. Es geht nicht um ein einzelnes Modell, sondern um ein vollständiges, replizierbares, überprüfbares Softwarepaket.
4. Nach Updates: Erneuern Sie nur, wenn die Bewertungen zeigen, dass das Modell der Engpass ist – oder wenn sich die Geschäftsanforderungen ändern. Jeder Update muss durch Rücktests überprüft werden, um neue Fehler zu vermeiden.
Geeignete Anwendungen:
- Aufgaben, die fest sind, häufig ausgeführt werden und deren Ergebnisse automatisch überprüft werden können (z. B. Codekorrekturen, standardisierte Wartungsarbeiten, Regelüberprüfungen).
- Anwendungen, bei denen eine Steigerung der Genauigkeit um 1 Prozent große wirtschaftliche Vorteile bringt.
Nicht geeignete Anwendungen:
- Aufgaben, die sich häufig ändern, die auf subjektiven Entscheidungen beruhen, bei denen der Datenverkehr gering ist oder die Kundenanforderungen stark variieren. In solchen Fällen ist die Austauschbarkeit der Komponenten wichtiger als die Maximierung der Leistung.
💡 Kommentar des Journalisten:
Das ist wie in der Automobilindustrie: Man kann nicht jedes Auto nach der Produktion weiter optimieren – das würde den Kunden frustrieren und die Werkstatt ruinieren. Stattdessen muss man im Werkzeugwerk den Motor und das Getriebe optimal aufeinander abstimmen, das Auto zusammenbauen und es mit einem Zertifikat verkaufen. Wenn Kunden neue Funktionen wünschen, kaufen sie ein neues Auto, nicht dass der Mechaniker das Auto vor Ort modifiziert.
---
📌 Zusammenfassung und Ausblick
Der Artikel schließt mit einer zukunftsweisenden Aussage: Das MCP (Model Context Protocol) wird nicht zur allgemeinen Standardisierung in der AI-Branche werden.
MCP regelt die Verbindung von Modellen und Werkzeugen; A2A regelt die Kommunikation zwischen AI-Systemen. Was wirklich standardisiert werden muss, sind die grundlegenden Aktionen wie Aufgabenerstellung, Zustandsänderungen, Genehmigungsanfragen und Protokollierung von Schritten.
Die zukünftige AI-Infrastruktur wird nicht aus einem einzigen, umfassenden „AI-Betriebssystem“ bestehen, sondern aus mehreren Schichten:
1. Oberste Schicht: Geschäftsanwendungen.
2. Mittlere Schicht: Optimierung von Modellen und Frameworks (Anweisungen, Feinabstimmungen, Arbeitsabläufe).
3. Unterste Schicht: Basissysteme für AI (Identität, Berechtigungen, Sandlager, Zustandsmanagement, Protokollierung).
Ein Rat an die Branche:
Fähigkeiten können zusammen verbessert werden, aber die Ausführung muss standardisiert sein. Machen Sie Ihr AI-System zu einem „Offenen System“ – Sie sollten sehen können, was es tut, wer die Aktionen genehmigt hat und wie Fehler behoben werden. Das ist der Schlüssel, um AI in die Produktion zu bringen.