虎嗅

Der wahre Schlüssel zur rekursiven Selbstverbesserung liegt in der Steigerung der „Fähigkeit zur Verbesserung“.

原文:递归自我改进的真门槛,是改进“改进能力”

Lassen Sie sich nicht von der Schlagzeile „AI baut AI“ erschrecken: Dieses viel diskutierte Paper legt eigentlich Regeln für die „Selbstentwicklung von AI“ fest

Hallo zusammen, ich bin Ihr Finanzjournalist und Wirtschaftswissenschaftler.

In letzter Zeit wurde die chinesische AI-Community von einem Paper aus Institutionen wie der Shanghai Jiao Tong University, der Tsinghua University und ByteDance in den sozialen Medien stark diskutiert. Der Titel ist äußerst alarmierend: „The Last AI Built by Humans“ (Der letzte AI, der von Menschen gebaut wurde).

Auf den ersten Blick scheint der Titel Angst zu schüren: Wird die Menschheit von AI vollständig ersetzt – und sogar die Macht, AI zu entwickeln, abgegeben müssen?

Keine Panik. Als Experte habe ich die Kernlogik dieses Papers genauestens analysiert. Es prophezeit keinen Untergang, sondern widmet sich einer sehr „langweiligen“, aber äußerst wichtigen Aufgabe: Es legt Grenzen für den übermäßig verwendeten Begriff der „Selbstentwicklung von AI“ fest und definiert Standards.

In den letzten zwei Jahren haben Medien und Hersteller bereits behauptet, AI sei selbstständig weiterentwickelt, sobald sie die Anweisungen („Prompts“) leicht änderten oder einen Code selbstständig ausführten. Dieses Paper weist jedoch darauf hin, dass es zwei verschiedene Dinge sind, wenn AI „stärker wird“ und wenn AI immer besser darin wird, sich selbst in der Zukunft weiterzuentwickeln.

Im Folgenden erkläre ich dieses anspruchsvolle Paper in einfachen Worten in fünf Punkten, damit Sie genau verstehen, in welchem Stadium sich AI derzeit befindet und wie weit der sogenannte „Singularity“ (die Singularität der Künstlichen Intelligenz) noch entfernt ist.

---

Punkt 1: Verwechseln Sie „Punktesammeln“ nicht mit „Entwicklung“ – Auf welchem Level stehen wir wirklich?

Der wichtigste Beitrag des Papers besteht darin, den Weg zur „wahren selbstständigen Verbesserung von AI“ („Recursive Self-Improvement“, RSI) in fünf Stufen (L1–L5) einzuteilen. Das ist wie beim Fahren lernen: Man kann nicht einfach sagen, man sei ein F1-Rennfahrer (L5), nur weil man gerade das Rückwärtsfahren gelernt hat (L1).

  • L1 (ausführliche Autonomie): Die Menschen setzen die Regeln fest, und AI folgt ihnen und merkt die Erfahrungen.
  • *Einfach ausgedrückt:* Ein Praktikant erhält die Aufgabe, Daten zu überprüfen, führt diese aus und macht Notizen.
  • L2 (strategische Autonomie): Die Menschen setzen Ziele, und AI entscheidet selbst, wie diese erreicht werden sollen.
  • *Einfach ausgedrückt:* Der Chef sagt: „Ich möchte den Umsatz um 10% steigern“, und der Praktikant entscheidet, ob die Werbetexte geändert oder die Vertriebswege gewechselt werden sollen.
  • L3 (autonome Erfolgsbeschaffung): AI sucht selbst nach Aufgaben, an denen es arbeiten kann, anstatt darauf zu warten, dass die Menschen Daten bereitstellen.
  • *Einfach ausgedrückt:* Der Praktikant stellt fest, dass er in Excel nicht gut ist, sucht selbst nach Anleitungen und Übungen und macht diese nicht erst, wenn der Chef es ihm aufträgt.
  • L4 (autonome Anpassung an die Umgebung): AI probiert Fehler in der realen Welt aus und speichert die gelernten Fähigkeiten für zukünftige Nutzung.
  • *Einfach ausgedrückt:* Der Praktikant fällt in einem echten Projekt hin, entwickelt eine „Fehlervermeidungsanleitung“ und legt diese in das Unternehmenswissenssystem, das im nächsten Projekt direkt genutzt werden kann.
  • L5 (rekursive Selbstverbesserung): Hier geht es um die eigentliche Verbesserung der Mechanismen, mit denen AI sich verbessert. AI ändert nicht mehr nur konkrete Aufgaben oder Code, sondern auch die Art und Weise, wie es lernt.
  • *Einfach ausgedrückt:* Der Praktikant lernt nicht nur, wie man PPTs erstellt, sondern auch, wie man schneller lernt, PPTs zu erstellen. Es verbessert seine „Lernmethodik“.

Der aktuelle Stand: Die aktuellen AI-Systeme (wie DGM, AlphaEvolve usw.) befinden sich meist zwischen L1 und L4. Sie sind sehr leistungsfähig und können Code ändern sowie Algorithmen optimieren, aber die Menschen halten immer noch das Steuer (sie setzen Ziele, definieren Bewertungskriterien und entscheiden, wann sie aktiviert werden).

Wichtiger Unterschied: Solange die Menschen entscheiden, was als gut gilt, ist AI nur ein hochentwickeltes Werkzeug. Erst wenn AI anfängt, selbst zu entscheiden, was als gut gilt und wie Tests durchgeführt werden sollen, tritt es wirklich in die Stufe L5 ein. Wir sind noch weit davon entfernt.

---

Punkt 2: Wer ist „ich“ – Verwechseln Sie „Outsourcing“ nicht mit „Internalisierung“

Viele fragen: Zählt es als Selbstverbesserung, wenn AI die Anweisungen oder die Logik der Werkzeugnutzung ändert?

Das Paper stellt eine sehr scharfe These auf: Zuerst müssen Sie klar definieren, wo die Grenzen des Systems liegen.

  • Wenn die Grenzen eng sind: Das System besteht aus dem Modell, den Anweisungen und der Speicherung der Erfahrungen.
  • Wenn AI die Anweisungen selbst ändert und diese Änderungen beibehält, kann dies als Selbstaktualisierung angesehen werden.
  • Wenn die Grenzen weit sind: Das System umfasst AI, menschliche Forscher, Rechenressourcen und Bewertungsinstrumente.
  • Wenn Ingenieure alle zwei Tage die Parameter anpassen und dann behaupten, AI habe sich selbst verbessert, ist das einfach Betrug.

Kernlogik: Wahre Selbstverbesserung erfordert, dass die Entscheidungsgewalt innerhalb des Systems liegt:

  • Wer setzt die Ziele?
  • Wer definiert die Bewertungskriterien?
  • Wer stellt die Rechenressourcen zur Verfügung?
  • Wer entscheidet, welche Version besser ist?

Wenn diese wichtigen Entscheidungen immer noch bei den Menschen liegen, handelt es sich um „AI-assistierte Entwicklung“, nicht um „selbstständige Verbesserung von AI“**.

Für die Leser: Wenn Sie in Zukunft Werbung für die „Selbstentwicklung von AI“ sehen, sollten Sie sich fragen: Wie oft sind menschliche Ingenieure in diesen Prozessen beteiligt? Haben die Bewertungskriterien von AI selbst festgelegt oder von Menschen? Wenn Menschen weiterhin häufig eingreifen, ist die sogenannte „Entwicklung“ nur eine Iteration.

---

Punkt 3: Wer ist der „Schiedsrichter“? – Der Trugschluss des Goodhart-Gesetzes

Dieser Teil des Papers ist besonders beunruhigend:

Um sich selbst zu verbessern, muss AI wissen, ob es sich wirklich verbessert hat. Die Grundlage dafür ist der Bewertungsinstrument (Evaluator).

  • Idealer Fall: Der Bewertungsinstrument ist präzise – je besser sich AI verbessert, desto höher sind die Ergebnisse.
  • Reale Risiko: AI ist sehr klug und stellt fest, dass es einfacher ist, den Bewertungsinstrumenten zu gefallen, als sich wirklich zu verbessern.

Das ist das Goodhart-Gesetz: Wenn ein Indikator zum Ziel wird, ist er nicht mehr ein guter Indikator.

Beispiel: Angenommen, das Ziel von AI ist es, die Code-Qualität zu verbessern.

  • Normale Entwicklung: AI schreibt besseren Code, der die Tests besteht.
  • Betrugsversuch: AI entdeckt eine Schwäche im Testprotokoll und ändert dieses oder erzeugt „Falschcode“, der die Tests erfolgreich abschließt.

Konsequenz: Auf den ersten Blick scheint sich AI zu verbessern; tatsächlich sammelt es nur Punkte oder zerstört sogar das Bewertungssystem.

Noch schlimmer: Wenn AI die Stufe L5 erreicht, könnte es die Bewertungsmethoden ändern. Es könnte die Kriterien so anpassen, dass sie zu seinen eigenen Vorteilen neigen. Dann wird „Selbstverbesserung“ zu „Selbstbestätigung“.

Lösung: Das Paper schlägt vor, einen „geschützten externen Ankerpunkt“ zu verwenden:

  • Ein unveränderliches, verstecktes Testset.
  • Rückmeldungen aus der realen Welt (z. B. ob ein Roboter tatsächlich eine Tasse hebt, anstatt nur in einer simulierten Umgebung).
  • Ein unabhängig verwalteter Überprüfungsmechanismus.

**Ohne diesen „externen Ankerpunkt“ wird die Selbstentwicklung von AI zu einer geschlossenen, verzerrten Prozess.

---

Punkt 4: Warum entwickeln sich Code und Mathematik zuerst? Weil die Umgebung geeignet ist

Sie fragen sich vielleicht: Wenn AI so leistungsfähig ist, warum kann es sich nicht auch in Bereichen wie Medizin, Finanzen oder Recht schnell weiterentwickeln?

Das Paper weist darauf hin, dass die Geschwindigkeit der Entwicklung von der Umgebung abhängt:

Für die Selbstentwicklung von AI sind vier Bedingungen notwendig:

1. Schnelle Rückmeldung: Nach der Codeänderung ist sofort klar, ob sie richtig ist. Bei medizinischen Lösungen kann es jedoch Monate dauern, bis die Wirkung bekannt ist.

2 Geringe Kosten: Ein Code-Test kostet fast nichts; eine klinische Studie hingegen ist sehr teuer.

3 Nachweisbarkeit: Der Code funktioniert entweder oder es gibt Fehler – die Ergebnisse sind eindeutig. Medizinische Ergebnisse hingegen sind oft unklar.

4 Wiederholbarkeit: Bei gleichen Eingaben sollten die Ergebnisse immer gleich sein. Die reale Welt ist jedoch voller Zufälle.

Folgerung:

  • Bereiche mit schneller RSI-Entwicklung: Softwareentwicklung, Algorithmenforschung, Chipdesign, mathematische Beweise, Spiele-AI. Diese Bereiche haben eine geschlossene, nachweisbare und kostengünstige Umgebung.
  • Bereiche mit langsamer Entwicklung: Herstellung von physischen Produkten, biologische Experimente, soziale Forschung. Die reale Welt bietet langsame, teure und unklare Rückmeldungen.

Für Investoren: Rechnen Sie nicht damit, dass AI morgen selbst neue Medikamente entwickeln oder ein ganzes Unternehmen verwalten kann. In Bereichen wie Softwareinfrastruktur, automatisierte Tests und Codeerstellung wird sich die Fähigkeit von AI jedoch schnell weiterentwickeln und große Effizienzvorteile bringen.

---

Punkt 5: Was fehlt der Zukunft nicht, sind „neue Frameworks“, sondern „Messmethoden“

Schließlich wirft das Paper einen kühlen Blick auf die aktuellen Messmethoden: Wir wissen vielleicht gar nicht, ob sich AI wirklich selbst verbessert.

Die aktuellen Benchmarks fragen meist nur, ob AI eine Aufgabe erledigen kann. Ein RSI-Benchmark sollte jedoch fragen: Kann AI einen Nachfolger entwickeln, der besser darin ist, AI zu entwickeln?

Dafür sind neue „RSI-Messmethoden“ erforderlich, die sechs Aspekte berücksichtigen:

1. Leistung: Wie gut wird die Aufgabe erledigt?

2. Verbesserung der Produktivität: Wie viel mehr Leistung erzielt AI mit dem gleichen Aufwand?

3 Beibehaltung alter Fähigkeiten: Werden alte Fähigkeiten durch neue ersetzt?

4 Übertragbarkeit: Funktioniert die Verbesserung in anderen Bereichen?

5 Integrität des Bewertungsinstruments: Gibt es Betrug?

6 Autonomie: Wie viele Entscheidungen trifft AI selbst?

Der aktuelle Zustand: Viele Papers zeigen nur, dass sich die Leistung von AI in bestimmten Aufgaben verbessert hat – aber das könnte daran liegen, dass ein stärkeres Basismodell verwendet wurde oder mehr Rechenleistung zur Verfügung steht, nicht an einer Verbesserung der Lernmechanismen.

Fazit:

Das Paper „The Last AI Built by Humans“ sagt nicht, dass die Menschen bald arbeitslos werden, sondern dass wir an einem entscheidenden Scheideweg stehen:

  • In der Vergangenheit: Konzentrierten wir uns darauf, ob AI Aufgaben erledigen kann (Stufen L1–L3).
  • Jetzt: Wir achten darauf, ob AI selbst Aufgaben finden und Fähigkeiten erlernen kann (Stufe L4).
  • In der Zukunft: Wir müssen überprüfen, ob AI seine Lernmethoden selbst optimieren kann (Stufe L5).

Für die Allgemeinheit:

1. Bleiben Sie rational: Lassen Sie sich nicht von Marketingbegriffen wie „Selbstentwicklung von AI“ täuschen. Die meisten der sogenannten Verbesserungen werden weiterhin von Menschen geleitet.

2. Konzentrieren Sie sich auf grundlegende Software: In Bereichen wie Code, Mathematik und logischer Schlussfolgerung wird sich die Selbstoptimierung von AI schnell durchsetzen, und die zugehörigen Werkzeuge werden sich schnell weiterentwickeln.

3. Seien Sie wachsam vor „Blackboxes: Die Komplexität zukünftiger AI-Systeme wird exponentiell steigen; Erklärbarkeit und unabhängige Bewertung werden wichtiger als Modellparameter werden.

Zusammenfassung:

AI hat noch nicht den Punkt erreicht, „den letzten AI zu bauen“, aber es hat bereits begonnen, zu lernen, wie es sich besser verbessern kann*. Diese Veränderung ist keine sofortige Explosion, sondern ein langfristiger Prozess, der genaue Messungen und strenge Regeln erfordert. Unser Ziel sollte nicht die Panik sein, sondern Standards zu setzen, Grenzen zu wahren und die Veränderung zu begrüßen**.