虎嗅

**Auf der Jagd nach allgemeiner künstlicher Intelligenz: Weltweite Modelle entwickeln sich parallel**

原文:追逐通用人工智能,世界模型多头并进

Zusammenfassung des Kerninhalts

Dieser Artikel konzentriert sich auf die „Weltmodelle“ im Bereich der Künstlichen Intelligenz (KI) und weist darauf hin, dass aktuelle Großsprachmodelle (wie ChatGPT) aufgrund fehlender Erfahrungen aus der realen Welt schwere Mängel bei Aufgaben wie physikalischer Logik und Raumplanung aufweisen. „Weltmodelle“, die in der Lage sind, die Konsequenzen der Realität zu simulieren, gelten als Schlüssel zur Entwicklung allgemeiner KI (AGI). Der Artikel beschreibt auch die wissenschaftlichen Grundlagen der Weltmodelle, den Fortschritt ihrer kommerziellen Anwendung (Zuwachs an Kapital und Investitionen führender Unternehmen), die unterschiedlichen technischen Ansätze (Rekonstruktion auf Pixelebene versus abstrakte Darstellung) sowie die noch bestehenden Herausforderungen auf dem Weg zur AGI (z. B. Probleme mit der Zeitabstraktion und Metakognition).

Detaillierte Erläuterung

1. Die „tödlichen Mängel“ großer Sprachmodelle: Das Fehlen von „Alltagswissen“

Ein einfaches Beispiel macht dies deutlich: Wenn man eine KI fragt, was passiert, wenn ein Glas zu Boden fällt, antwortet sie mit Fachbegriffen wie „Schwerkraftpotenzial“ und „Spannungswellen“, während ein fünf- oder sechsjähriges Kind einfach sagen würde, dass das Glas zerbricht. Der Grund dafür liegt darin, dass die Kernfunktion großer Sprachmodelle darin besteht, das nächste Wort vorherzusagen – sie werden durch riesige Datenmengen trainiert, haben aber nie selbst gesehen, wie ein Glas zu Boden fällt. Ohne echte Erfahrungen aus der Realität können sie die physikalischen Gesetze nicht wirklich verstehen.

Beim Navigieren können Großsprachmodelle zwar Routen auswendig lernen, aber wenn man sie um einen Weg bitten würde, würden sie verwirrt sein (da sie nur textuelle Beschreibungen haben und keine „mentale Karte“ wie Menschen besitzen). Auch alltägliche Aufgaben wie das Falten von Kleidung können sie nicht erledigen – sie verstehen nur die Beschreibung, nicht die Realität. Dies zeigt die essentielle Schwäche großer Sprachmodelle: Sie sind „Experten für Texte“, aber keine „Experten für die Realität“.

2. Weltmodelle: Systeme, die es KI ermöglichen, Konsequenzen wie Menschen vorzusagen

Die Idee der Weltmodelle geht auf den Psychologen Alan Turing aus dem Jahr 1943 zurück. Er postulierte, dass das menschliche Gehirn ein „kleines Modell“ besitzt, das die Folgen verschiedener Handlungen simulieren kann (z. B. wenn man daran denkt, dass ein Glas zu Boden fällt, wird man vorsichtig sein). Spätere Theorien ergänzen diese Vorstellung damit, dass unsere Wahrnehmung darauf basiert, ständig die Welt vorherzusagen und anschließend diese Vorhersagen mit Informationen aus Sicht und Gehör zu korrigieren.

KI-Forscher möchten, dass KI ebenfalls diese Fähigkeit entwickelt: Sie sollen vor einer Handlung die möglichen Konsequenzen intern simulieren, um Fehler in der Realität zu vermeiden. Der Turing-Preisträger Yang Likun betont: „KI ohne Vorhersagefähigkeit ist keine echte Intelligenz – Intelligenz bedeutet, dass sie unsere Fehler für uns ausprobiert.“

3. Kapitalfluss in die Weltmodelle: Ein neuer Trend in der KI-Forschung

In den letzten zwei Jahren sind Weltmodelle zu einem vielbegehrten Ziel für Investoren und Technologieunternehmen geworden:

  • Li Feifei (eine führende KI-Expertin) gründete World Labs und sammelte 230 Millionen US-Dollar für die Entwicklung von „Raumintelligenz“.
  • Yang Likun verließ Meta und gründete das AMI-Labor, das weitere 1 Milliarde US-Dollar einbrachte, um sich auf die Forschung mit Weltmodellen zu konzentrieren.
  • Googles DeepMind entwickelte das System Dreamer4, das durch das Anschauen von Videos aus „Minecraft“ in der Lage ist, selbstständig Aktionen wie das Sammeln von Ressourcen oder das Herstellen von Werkzeugen durchzuführen (was mehrere tausend Schritte erfordert).

Allerdings handelt es sich bei diesen Entwicklungen noch um Prototypen: Welt Labs’ Marble ist beispielsweise nur ein 3D-Szenengenerator, während Genie3 eher wie ein Spiel Simulator funktioniert – beide sind noch weit davon entfernt, echte Haushaltsroboter zu werden.

4. Konflikte um die technischen Ansätze: Pixelgenauigkeit versus abstrakte Darstellung

Es gibt derzeit zwei Hauptansätze in der Entwicklung von Weltmodellen, die stark umstritten sind:

  • Pixelgenaue Rekonstruktion: Systeme wie Dreamer4 versuchen, jedes einzelne Pixel zu reproduzieren, um eine möglichst genaue Simulation der realen Welt zu erreichen. Der Vorteil ist die detaillierte Darstellung, aber der Datenbedarf ist hoch.
  • Abstrakte Darstellung: Ansätze wie Yang Likuns JEPA konzentrieren sich auf die wesentlichen Informationen für die Logik – sie benötigen weniger Daten, stellen jedoch die Frage, ob abstrakte Informationen ausreichen, um komplexe Aufgaben zu bewältigen. Beispielsweise kann V-JEPA2 die Bewegungsgesetze von Objekten lernen, hat aber noch nicht gezeigt, dass es intelligente Agenten in offenen Umgebungen unterstützen kann.

Beide Ansätze haben ihre Berechtigung: Der Leiter von Dreamer4, Hafner, ist der Meinung, dass auch aus pixelgenauen Daten abstrakte Erkenntnisse gewonnen werden können, während Yang Likun die Abstraktion für effizienter hält.

5. Noch lange Weg bis zur AGI: Es fehlen noch viele Komponenten

Auch wenn Weltmodelle Fortschritte machen, sind sie noch weit davon entfernt, eine allgemeine KI zu schaffen:

  • Zeitabstraktion: KI kann derzeit nur die nächsten Sekunden vorhersagen, nicht aber langfristige Konsequenzen.
  • Metakognition: KI weiß nicht, was sie weiß und was nicht – sie antwortet oft falsch und ist sich dessen auch nicht bewusst.
  • Mehrlagige Kausalitäten und das Verständnis der Gedanken anderer Menschen: Menschen können komplexe Zusammenhänge verstehen (z. B. „Wegen des Regens ist die Straße rutschig“) sowie die Absichten anderer (z. B. „Er runzelt die Stirn, weil er wütend ist“), während KI dies noch nicht kann.

Experten betonen: Weltmodelle sind eine notwendige Voraussetzung, aber keine ausreichende Bedingung für die Entwicklung der AGI – es werden weitere Fähigkeiten benötigt.

Fazit

Weltmodelle stellen einen wichtigen Schritt auf dem Weg zur allgemeinen KI dar, sind jedoch kein „Allheilmittel“. Um KI zu entwickeln, die wirklich wie Menschen denkt, liegt noch ein langer Weg vor uns.