Zusammenfassung der Kerninhalte
Es handelt sich um eine Branchentischrunde, an der junge Forscher aus verschiedenen Hochschulen in Hongkong im Bereich KI teilnahmen. Während der Diskussion wurden keine Konzepte übertrieben oder neue Trends propagiert, sondern vielmehr die praktischen Herausforderungen bei der Umsetzung der derzeit sehr beliebten, aber äußerst unklar definierten „Weltmodelle“ analysiert. Es wurde unter anderem korrigiert, dass viele Menschen denken, KI könne durch das Erstellen von Videos bereits ein „Weltmodell“ darstellen. Zudem wurden populäre Illusionen widerlegt – beispielsweise dass man durch das Auswerten aller Videos im Internet einen universellen Roboter entwickeln oder bald eine Roboter-Version von ChatGPT erhalten könnte. Außerdem wurde argumentiert, dass die oft genannte „Millionen Stunden an Trainingszeit“ keine aussagekräftige Kennzahl sei. Die Forscher kamen zu dem Schluss, dass die technische Richtung der Weltmodelle noch nicht festgelegt ist und es nicht nur großen Unternehmen vorbehalten ist, in diesem Bereich tätig zu sein; auch kleine Teams und Unternehmer haben durch die Betrachtung spezifischer Anwendungsszenarien große Chancen, Durchbrüche zu erzielen.
---
Verständliche Erläuterung der Punkte
1. 99 Prozent der derzeit als „Weltmodelle“ bezeichneten Systeme sind unzureichend
Viele Menschen glauben, dass KI, wenn sie ein zusammenhängendes Video erstellen kann, bereits ein „Weltmodell“ darstellt. Tatsächlich handelt es sich dabei jedoch um eine völlig andere Technologie: Die aktuellen Videoerstellungs-Algorithmen ordnen lediglich die Pixel so an, dass sie unserem visuellen Eindruck entsprechen – sie verstehen jedoch nicht, dass ein Wasserbecher beim Fallen zerbrechen oder das Wasser herausschütten kann, oder dass er durch einen Tischrand verdeckt werden kann. Ein wirklich qualifiziertes „Weltmodell“ sollte in der Lage sein, die Gesetzmäßigkeiten der realen Welt zu verstehen. Wenn man es beispielsweise bittet, einen Wasserbecher wegzuschieben, sollte es vorhersehen können, wie weit der Becher gleiten und wie viel Wasser verschüttet wird – auch wenn der Becher nicht sichtbar ist. Die Teams, die Videos erstellen, autonome Fahrzeuge entwickeln oder Roboter bauen, verwenden zwar den Begriff „Weltmodell“, verfolgen aber völlig unterschiedliche Ansätze und sind noch weit davon entfernt, zusammenzuarbeiten.
2. Der Versuch, einen universellen Roboter durch das Auswerten aller Videos im Internet zu entwickeln, ist illusorisch
Viele Menschen dachten, dass ChatGPT durch das Auswerten aller Texte im Internet zu einem universellen Modell wurde. Doch auch dieser Gedanke ist falsch: Die Videos im Internet zeigen meist erfolgreiche Szenen; Fehler oder Grenzfälle werden dabei nicht berücksichtigt. Zudem unterscheiden sich die Bewegungsfähigkeiten von Menschen und Robotern erheblich. Videos aus dem Internet können nur als Anregung für die Entwicklung von Robotern dienen, ersetzen aber nicht die Erfahrungen, die Roboter in der realen Welt sammeln müssen.
3. Die Rede von „ChatGPT mit körperlicher Intelligenz“ ist übertrieben
Viele Roboterunternehmen behaupten, ihre Technologie sei bereits auf dem Niveau von ChatGPT. Doch dies ist nicht der Fall: Roboter benötigen konkrete Erfahrungen aus der Praxis – beispielsweise im industriellen Umfeld, um beispielsweise Schrauben zu drehen oder Teile zu bewegen. Erst wenn diese Anwendungen stabil funktionieren, können sie schrittweise in den Alltag der Menschen eintreten. Die oft genannte „Millionen Stunden an Trainingszeit“ sind dabei oft nur eine Marketingstrategie, die keine tatsächlichen Fortschritte widerspiegelt.
4. Die von der Branche angegebenen Zahlen sind oft irreführend
Viele Unternehmen prahlen mit „Millionen Stunden an Trainingszeit“ ihrer Roboter. Dies ist jedoch keine aussagekräftige Kennzahl: Ein Roboter, der täglich denselben Weg in einem Wohnzimmer zurücklegt, lernt dabei nichts Neues. Die effektive Trainingszeit sollte anhand von Anzahl der verschiedenen Situationen und Fehlern bestimmt werden – nicht anhand der Gesamtzeit.
5. Die zukünftigen Roboter benötigen keine individuellen Anpassungen
Heutige Roboter sind oft an bestimmte Körperformen gebunden; ein Wechsel der Hardware erfordert oft komplexe Neuanpassungen des Codes, was sehr teuer ist. Zukünftige „Weltmodelle“ sollten in der Lage sein, sich an verschiedene Körperformen anzupassen – unabhängig von der Anzahl der Finger oder der Kraft des Arms. Dadurch könnten Roboter flexibler eingesetzt werden und ihre Kosten sinken.