虎嗅

**Deutscher Titel:** „1 Million Stunden körperlicher Intelligenz – Kann man daraus wirklich einen ‚intelligenten‘ Roboter erschaffen?“ | Die geheime AI-Konferenz „AI 100“

原文:拆透具身智能100万小时:真能喂出一个“聪明”机器人吗?|AI 100闭门会

Zusammenfassung der Kerninhalte

Der Markt für körperliche Intelligenz (Roboter-AI, die mit der physischen Welt interagieren kann), ist im Aufschwung. Allerdings besteht in der Branche ein Missverständnis hinsichtlich der Behauptung, dass „eine Million Stunden an Daten den Moment des GPT-Ereignisses herbeiführen“. Wichtiger als die Größe der Datenmenge sind deren Qualität (Informationsdichte, Abdeckung schwieriger Fälle und Transportfähigkeit). Derzeit wechselt die Branche von einer Strategie des „Datensammelns“ zu einer Strategie der Effizienzsteigerung. Die Anwendung findet vor allem in industriellen und Dienstleistungs-Szenarien statt – Radbasierte Roboter sind hier praktischer als humanoide Roboter. Für die Modelle (VLA vs. Weltmodelle) ist es kurzfristig nicht notwendig, sich für eine einzige Variante zu entscheiden. Der Schutzwall von Datenunternehmen besteht in einem geschlossenen Kreislauf von „Datenerfassung – Training – Bereitstellung – Fehleranalyse und Wiederanwendung“, und nicht einfach nur in der Menge der Daten. Zwischen China und den USA gibt es keine deutlichen Unterschiede; China verfügt über Vorteile bei der Lieferkette und dem Hardwarebereich.

Detaillierte Analyse

1. Sind eine Million Stunden wirklich notwendig? Effektive Daten sind das Wichtigste

Viele behaupten, dass körperliche Intelligenz „eine Million Stunden an Daten“ benötigt. Peng Pai von CoolWah Technology gibt jedoch ein gegenintuitives Beispiel: Ein Modell lernt nichts, wenn es nur 100 Kilometer auf einer normalen Straße fährt; ein herumwehender Plastikbeutel im Supermarkt hingegen zeigt Unterschiede in der Wahrnehmung von flexiblen Hindernissen durch Laserradar und visuelle Systeme – das ist der Unterschied beim „Informationsgewinn“.

Wichtige Kriterien für effektive Daten:

  • Zuverlässige Quellen der Daten: Viele Angaben zu „einer Million Stunden“ basieren auf der Anzahl von Token in Sprachmodellen und können weder verifiziert noch widerlegt werden.
  • Effektive Daten werden anhand folgender drei Indikatoren beurteilt:

1. Erklärbarkeit (Fehler lassen sich auf bestimmte Winkel, Kräfte oder Strategien zurückführen)

2. Häufigkeit schwieriger Fälle (Anteil seltener, aber fehleranfälliger Szenarien wie starker Regen oder Verkehr mit Menschen und Fahrzeugen)

3. Mehrfachnutzbarkeit der Daten (die Daten können für verschiedene Roboter verwendet werden, ohne dass es zu erneuten Kosten kommt)

Kriterium für das Ende des Datensammelns: Der Geschäftswert neuer Daten ist geringer als die Erhebungskosten – wenn beispielsweise in einem Szenario eine Erfolgsrate von 99% erreicht wurde, lohnt sich das Sammeln weiterer Daten nicht mehr.

2. Die Hierarchie der Daten hat sich geändert: Menschliche Videos bilden die Grundlage, echte Fälle aus der Praxis sind besonders wertvoll

Die „Datenzusammensetzung“ für die Ausbildung körperlicher Intelligenz ist nicht festgelegt. Es hat sich eine dynamische Hierarchie entwickelt:

  • Unterste Schicht: Videos in erster Person von Menschen (z. B. Koch- oder Putzvideos im Internet) – große Datenmenge, hohe Flexibilität bei der Anwendung auf verschiedenen Robotern
  • Mittlere Schicht: Simulierte/Synthetisierte Daten – zur Nachbildung extremer Szenarien (z. B. Störungen in Kernkraftwerken) und Ergänzung fehlender Fehlerbeispiele aus der Realität
  • Oberste Schicht: Echte Fälle aus der Praxis – höchster Wert, da sie die Stabilität der Modelle direkt verbessern

Kernlogik: Die drei Schichten sollten in einem Kreislauf verwendet werden (z. B.: Wenn ein Roboter auf ein Problem mit einem Plastikbeutel stößt, wird dies zunächst simuliert und anschließend mit menschlichen Videos ergänzt). Guo Junliang von QianXun Intelligence weist darauf hin, dass reine Menschenvideos fehltende Interaktionsdetails mit Robotern aufweisen; UMI-Geräte (mit Greifarmen) sind daher auch in der mittleren Schicht enthalten.

3. Modelle: VLA oder Weltmodelle – kurzfristig keine Entscheidung notwendig

Es gibt zwei Ansätze in der Branche: VLA (direkte Lernung von Bewegungen aus Videos) und Weltmodelle (erstes Lernen physikalischer Gesetze, dann Entscheidungsfindung). Die Experten sind der Meinung:

  • Bei ausreichend großen Datenmengen ist der Unterschied gering: Experimente von QianXun haben gezeigt, dass beide Ansätze ähnliche Ergebnisse liefern.
  • Etagierte Systeme sind praktischer: Google Gemini Robotics ist ein Beispiel – das oberste Modell versteht die Aufgabe (z. B. „Putzen“), während untere VLA-Systeme die Ausführung übernehmen (z. B. Drehen und Wischen); bestehende Fähigkeiten wie SLAM werden direkt genutzt.

In Geschäftsszenarien ist keine einheitliche Lösung notwendig: Guang Lun Lianhe betont, dass viele Kunden nur wollen, dass der Roboter eine Aufgabe stabil ausführt – es muss nicht ein einziges Modell für alles zuständig sein.

4. Kommerzialisierung: Beginnen Sie in den „mittleren Zonen“ – humanoide Formen sind nicht unbedingt erforderlich

Die vorherige Generation der Automatisierung zielt darauf ab, die Umgebung an die Maschinen anzupassen (z. B. Putzroboter in geschlossenen Einkaufszentren); körperliche Intelligenz soll nun „die Maschinen an die menschliche Gesellschaft anpassen“ (z. B. Reinigungsroboter auf öffentlichen Gehwegen).

Prioritäten bei der Implementierung:

  • Ausschluss extremer Szenarien: Hochgradig individualisierte industrielle Anwendungen (dort ist die Automatisierung bereits weit entwickelt und wenig profitabel) sowie Haushaltsanwendungen (zu komplex, mit älteren Menschen, Kindern und Haustieren – kurzfristig wenig Gewinnpotential)
  • Wahl geeigneter Szenarien: Industrie/Dienstleistungs-Anwendungen (z. B. Transport in Fabriken, Reinigung in Einkaufszentren) – es gibt spezifische Anforderungen, aber die Roboter sollten generalisierbar sein und selten mit Menschen interagieren

Humanoide Formen sind nicht zwingend erforderlich: Guo Junliang von QianXun betont, dass Radbasierte Roboter mit Hebevorrichtungen mehr als 95% der aktuellen Aufgaben bewältigen können. Für Kunden ist wichtig, ob die Roboter stabil arbeiten, wenig Wartung benötigen und einen guten ROI bieten – nicht, wie ähnlich sie Menschen sind.

5. Wie überleben Datenunternehmen? Der geschlossene Kreislauf ist wichtiger als die Datenmenge

Die Kernkompetenz von Datenunternehmen liegt nicht im Sammeln großer Datenmengen, sondern darin, Fehler effektiv zu analysieren und daraus zu lernen:

  • Ein geschlossener Kreislauf ist der Schutzwall: Datenerfassung → Auswahl → Training → Bereitstellung → Fehleranalyse und Wiederanwendung – dieser Prozess schafft einen positiven Effekt („Flugwheels“). Beispiel: Wenn ein Roboter auf einem Gehweg von einem Plastikbeutel blockiert wird, sollte das Datenunternehmen diesen Fehler dokumentieren, damit das Modell in Zukunft daraus lernen kann.
  • Die Daten müssen flexibel sein: Zheng Yujing von KeXing ShiTong betont, dass Daten nicht an einen bestimmten Roboter gebunden sein sollten, sondern auf verschiedene Geräte übertragen werden können (z. B. Wenn die Greifarme ausgetauscht werden, sollten die alten Daten weiterhin nutzbar sein).

Kooperation mit Modellentwicklerteams: Datenunternehmen sollten nicht nur Daten liefern, sondern auch wissen, welche Fähigkeiten das Modell benötigt, und entsprechende Daten bereitstellen (z. B. Wiederholte Daten aus alltäglichen Szenarien sind nutzlos; schwierige Fälle hingegen sehr wertvoll).

Fazit

Der Wettbewerb in der Kategorie körperlicher Intelligenz hat sich von „Wer sammelt die meisten Daten?“ auf „Wer ist am effizientesten?“ verlagert. Eine Million Stunden sind nur der Anfang – das eigentliche Entscheidungskriterium ist, ob es gelingt, schwierige Fehler aus der realen Welt in wertvolle Lernmaterialien für Modelle umzuwandeln. Für die meisten Nutzer werden zukünftige Roboter nicht humanoide Formen haben, aber sie werden intelligenter sein – sie werden beispielsweise Plastikbeutel im Supermarkt ausweichen und auf Gehwegen von Lieferfahrzeugen ausweichen können und sich wirklich in unser Leben integrieren.