虎嗅

Vom Basketballroboter auf den Wettstreit um die Entwicklungspfade der Physical AI

原文:从打球机器人,看Physical AI 的路线之争

Zusammenfassung des Kerninhalts

Dieser Artikel zeigt anhand der Analyse der Technologien von Robotern, die Tennis spielen, entwickelt von Teams wie MIT, DeepMind, Berkeley, Galaxy General und Sony AI, den Kernkonflikt im Bereich der Physical AI (physische Intelligenz) auf: Es geht nicht darum, ob physische Modelle oder maschinelles Lernen das andere ersetzen, sondern wie beide zusammenarbeiten. Physische Modelle liefern stabile und kostengünstige „bekannte Informationen“ (z. B. die Schwerkraft, die grundlegenden Bewegungsgesetze des Balls), während maschinelles Lernen hochdimensionale und komplexe „unbekannte Fähigkeiten“ (z. B. die koordinierte Bewegung eines humanoiden Roboters beim Schlag) erlernt. Die verschiedenen Ansätze der Teams zielen darauf ab, die Aufgaben beider zu neu zu verteilen – von der direkten Steuerung durch Modelle über die Erstellung von Simulationen zur Definition möglicher Szenarien mit Modellen. Letztendlich entsteht ein Mix aus „Physische Modelle liefern die Grundstruktur, Lernen füllt die Details“.

Detaillierte Analyse

1. Warum sind Tennisroboter ein guter Indikator für technische Entwicklungen?

Tennis scheint einfach, stellt aber die Kernprobleme der Robotik in extremer Form dar:

  • Sehr kurze Reaktionszeiten: Der Ball bewegt sich mit Geschwindigkeiten von über 20 m/s; die Zeit zwischen zwei Schlägen beträgt weniger als 0,5 Sekunden. Roboter müssen den Fallpunkt des Balls im Voraus vorhersagen – sonst reagieren sie zu spät.
  • Komplexe Dynamik: Die Drehung des Balls (z. B. 1000 Umdrehungen pro Sekunde) verändert die Flugbahn und die Kollisionsergebnisse; Luftwiderstand und Bodenreibung sind ebenfalls entscheidend.
  • Koordinierte Bewegung: Ein humanoider Roboter muss bei einem Tennis-Schlag mehr als 20 Gelenke gleichzeitig steuern (Beine, Taille, Schultern) und dabei das Gleichgewicht halten. Für denselben Schlag gibt es oft Dutzende mögliche Körperhaltungen.

Diese Herausforderungen machen den Konflikt zwischen „Modellen vs. Lernen“ offensichtlich: Die Berechnung aller Details mit Modellen ist zu komplex, während reines Lernen fehleranfällig ist – daher sind Tennisroboter ein hervorragendes Beispiel, um technische Entwicklungen zu beobachten.

2. Die Entwicklung der physischen Modelle: Von der direkten Steuerung zur Simulation zur Definition möglicher Szenarien

Physische Modelle sind nicht verschwunden, sondern haben ihre Rolle im System verändert:

  • MIT: Direkte Steuerung durch Modelle (2025: Tennisarm mit mechanischer Steuerung): Jeder Ball wird mit physikalischen Formeln berechnet, um die zukünftige Flugbahn zu bestimmen und die Schlagbewegung zu planen (ähnlich wie ein Ingenieur, der Schritt für Schritt anleitet).
  • DeepMind: Modelle werden in Simulationen eingesetzt (2024: Wettkampfsystem für Tennis): Der Roboter trainiert nicht in der realen Welt, sondern in einer virtuellen Umgebung, die nach physikalischen Gesetzen aufgebaut ist. Nach Millionen von Trainingsversuchen erlernt der Roboter die notwendigen Fähigkeiten, bevor er in die reale Welt wechselt (das Modell erstellt die virtuelle Trainingsumgebung).
  • Berkeley HITTER: Hierarchische Aufteilung der Aufgaben (2025: humanoider Tennisroboter): Die oberste Ebene verwendet Modelle, um den Fallpunkt des Balls und das Ziel des Schlägers zu berechnen; die untere Ebene lässt den Roboter selbst lernen, wie er sich bewegt (die Bewegungsgesetze des Balls werden mit Modellen berechnet, die Körperbewegungen werden erlernt).
  • Galaxy General LATENT: Modelle definieren mögliche Szenarien (2026: Tennisroboter): Bei der virtuellen Ausbildung werden die Eigenschaften des Balls (Gewicht, Bodenreibung, Luftwiderstand) zufällig innerhalb eines vernünftigen Bereichs verändert, damit der Roboter sich an verschiedene Bedingungen anpassen kann (das Modell strebt keine Perfektion an, sondern bietet „Fehlertoleranz“).
  • Sony Ace: Mischmodell (2026: Veröffentlichung in Nature): Der Schwerpunkt liegt auf maschinellem Lernen, aber es werden weiterhin physische Simulationen, Schätzungen der Balldrehung und Optimierungen der Kollisionen verwendet (Lernen ist der Hauptansatz, Modelle ergänzen die Berechnungen).

3. Warum wurden physische Modelle nicht abgelöst? Weil die Wiederverwendung von „Wissen“ kostengünstig ist

Der Hauptvorteil physischer Modelle besteht darin, dass sie kostengünstige, vorhandene Informationen liefern:

  • Beispielsweise die Schwerkraft: Eine Formel (F = mg) zu definieren kostet fast nichts, während es viel Daten und Rechenleistung erfordern würde, wenn der Roboter durch hunderttausend Versuche herausfinden müsste, dass der Ball herunterfällt.
  • Die Berechnung der Ballflugbahn mit den Newtonschen Gesetzen ist viel effizienter als das Lernen aus Videos.

Diese stabilen und allgemein gültigen Gesetze zu nutzen, ist für Roboter wesentlich kostengünstiger, als sie alles von Grund auf neu zu erlernen – ähnlich wie man einem Kind nicht beibringt, dass „1 + 1 = 2“ ist, sondern es ihm direkt zeigt.

4. Der wahre Konflikt: Es geht nicht um Ersatz, sondern um die effizienteste Verteilung der Aufgaben

Im Grunde handelt es sich um ein ökonomisches Problem: Welche Methode ist für eine bestimmte Aufgabe kostengünstiger – Gleichungen, Daten oder Rechenleistung?

  • Gleichungen bevorzugen: Stabile, einfache und kostengünstige Gesetze (z. B. Schwerkraft, grundlegende Bewegungsgesetze des Balls).
  • Lernen bevorzugen: Hochdimensionale, komplexe und schwer zu berechnende Verhaltensweisen (z. B. die koordinierte Bewegung eines humanoiden Roboters).
  • Mischmodelle: Eine Kombination aus beidem (z. B. die komplexe Drehung des Balls, die mit Modellen und realen Daten korrigiert wird).

Beispielsweise teilt sich der Berkeley HITTER die Aufgaben: Die Flugbahn des Balls wird mit Modellen berechnet (kostengünstig), die Körperbewegungen werden erlernt (effizient). Der Ansatz von LATENT nutzt Modelle, um den Bereich der möglichen Parameter zu definieren (vermeidet erneutes Kalibrieren) und ermöglicht es dem Roboter, sich an Veränderungen anzupassen (hohe Robustheit).

5. Die Zukunft der allgemeinen Roboter: Robustheit ist wichtiger als Perfektion?

Allgemeine Roboter müssen in verschiedenen Umgebungen eingesetzt werden (Zuhause, Fabriken, Außenbereiche), wo es nicht möglich ist, die Parameter jedes Mal genau einzustellen (z. B. Bodenreibung, Abnutzung des Balls). Daher:

  • Nicht mehr nach „absoluter Perfektion“ streben: Es ist praktischer, wenn Roboter sich an mögliche Szenarien anpassen können (wie bei LATENT), anstatt eine perfekte virtuelle Nachbildung zu erstellen.
  • Fortlaufende Optimierung der Aufgabenteilung: Mit wachsenden Datenmengen und Rechenleistung werden heute manuell erstellte Module (z. B. für komplexe Kontakte) möglicherweise durch Lernen ersetzt; heute durch Lernen erfüllte Funktionen (z. B. Sicherheitsbeschränkungen) könnten in Zukunft durch Modelle ergänzt werden.

Letztendlich wird sich die Physical AI auf ein Modell entwickeln, bei dem physische Modelle die Grundstruktur liefern und maschinelles Lernen die Details ergänzt – ohne die bekannten Gesetze aufzugeben und gleichzeitig die Flexibilität des maschinellen Lernens voll auszuschöpfen.

Zusammenfassung

Die technologische Entwicklung der Tennisroboter zeigt, wie Menschen ständig darüber nachdenken, welche Informationen man Roboter direkt mitteilen und welche sie selbst erkunden lassen sollte. Physische Modelle und maschinelles Lernen sind keine Gegner, sondern Partner, die gemeinsam dazu beitragen, Roboter intelligenter und an die reale Welt anzupassen.