第一财经

„Körperliche Intelligenz und Daten rauschen voran – doch die Modellvalidierung ist noch nicht vollständig abgeschlossen“

原文:具身智能数据“狂飙”,但还未完全实现模型验证

---

Zusammenfassung des Kerninhalts der Nachricht

Diese Berichtsarbeit weist direkt auf den entscheidenden Wendepunkt in der aktuellen humanoiden Robotikbranche hin: Bisher war die gesamte Branche an dem Problem der extrem knappen Trainingsdaten festgehalten. Jetzt haben einige inländische Unternehmen jedoch als Erste das Modell der „Datenerfassungsfabriken“ für die industrielle Produktion von Robotentrainingsdaten etabliert und die Kapazität für hochwertige Daten auf jährlich mehrere hunderttausend Stunden erhöht – insgesamt sogar auf Millionen Stunden. Damit wurde das grundlegende Problem der mangelnden Datensammlung gelöst. Allerdings hat die Branche schnell erkannt, dass die in künstlich erstellten Simulationsszenarien deutliche Grenzen aufweisen. Um echte, arbeitsfähige humanoide Roboter zu entwickeln, ist es notwendig, einen positiven Kreislauf einzuschlagen: Zunächst werden die Roboter so weit trainiert, dass sie zu 70 Prozent fähig sind, anschließend in echte Arbeitsumgebungen eingesetzt, um dort zu arbeiten und gleichzeitig echte Daten zu sammeln, die wieder in die Modelle eingespeist werden. Die Branche steht nun an einem entscheidenden Wendepunkt – von der Konkurrenz um die Datenmenge hin zu der Umsetzung praktikabler Lösungen.

---

Verständliche Erklärung der einzelnen Punkte

1. Warum sammelt die ganze Branche derzeit so verzweifelt Daten?

Der Grund ist, dass es bisher keine „fachlichen Lehrmaterialien“ für Roboter gab. Die großen AI-Modelle, die wir nutzen, lernen aus dem auf dem Internet verfügbaren Text- und Videomaterial – das entspricht im Grunde der gesamten schriftlichen Wissensbasis der Menschheit über Tausende von Jahren. Humanoiden Roboter hingegen müssen lernen, wie sie in der realen Welt arbeiten: Wie viel Kraft man bei der Benutzung eines Glases anwenden muss, um es nicht zu zerbrechen, wie man einen Tisch abwischt, ohne die Vasen daneben zu berühren, oder wie man über ein Kabel auf dem Boden steigt. Für diese Details, die Kraft und die Reaktionslogik gibt es jedoch nicht genügend präzise annotierte Daten im Internet.

Bisher fehlten den Robotern sogar grundlegende Fähigkeiten wie das Öffnen von Türen – es gab zu wenige Beispiele für verschiedene Türgriffe, Türgewichte oder Hindernisse hinter den Türen. Die aktuelle Datensammlung zielt darauf ab, eine solche „fachliche Lehrbibliothek“ für Roboter zu schaffen; sonst bleiben humanoide Roboter nur Spielzeuge, die ihre Arme und Beine bewegen.

2. Die Branche hat nun „spezielle Schulen für Roboter“ eingerichtet

Früher war die Sammlung von Robotentrainingsdaten äußerst ineffizient: Entweder ließen die Roboter zufällig Handlungen ausführen, was meist nutzlose Daten ergab, oder man beauftragte Menschen, Videos aufzunehmen – doch die Details der Bewegungen waren oft ungenau. Heute haben führende Unternehmen spezielle Datenerfassungsstätten eingerichtet, die Roboter in Umgebungen wie Küchen, Supermärkte oder Fabriken trainieren. Dabei werden alle Bewegungen, die Kraft und die Wege genau aufgezeichnet. Anschließend werden die Daten automatisch von AI-Systemen überprüft und nutzlose Daten entfernt. Die führenden Unternehmen produzieren jährlich mehrere hunderttausend Stunden hochwertiger Daten; einige haben sogar bereits Millionen Stunden an validen Daten gesammelt – das entspricht der „Lehrerfahrung“ von erfahrenen Fachleuten für Roboter. Das Problem der mangelnden Datensammlung ist inzwischen weitgehend gelöst.

3. Die in Simulationen erzeugten Daten haben Grenzen

Das Modell der Datenerfassungsfabriken ist zwar effizient, doch die so trainierten Roboter sind meist nur „Anfänger“, die in echten Arbeitsumgebungen schnell überfordert sind. Es gibt drei wesentliche Probleme:

1. Die Simulationen sind zu „künstlich“ – alle Gegenstände sind in den Fabriken ordentlich angeordnet, es gibt keine unerwarteten Ereignisse.

2. Die Standards für die Datenerfassung sind nicht einheitlich; falsche Angaben in den Lehrmaterialien können zu Fehlern bei den Robotern führen.

3. Die Geschwindigkeit der Datenerfassung in den Fabriken ist zu langsam, um den realen Arbeitsrhythmus in der Praxis zu entsprechen.

4. Der Schlüssel zur Lösung: Roboter müssen erst arbeiten, bevor sie weiterentwickelt werden

Der beste Ansatz besteht darin, die Roboter zunächst mit hochwertigen Daten auf ein bestimmtes Niveau zu bringen, sie in echte Arbeitsumgebungen einzusetzen und dort Daten zu sammeln. Dadurch verbessern sich ihre Fähigkeiten schnell. Die Berichtsarbeit zeigt, dass Roboter, die erst einmal in der Praxis eingesetzt werden, nach kurzer Zeit deutlich effizienter werden.

5. Die derzeit gesammelten Millionen Stunden an Daten sind nur ein Einstieg

Obwohl viele Unternehmen bereits Millionen Stunden an Daten vorweisen, kann noch niemand mit Sicherheit sagen, wie viele Stunden an Daten wirklich ausreichen, um gute Modelle zu entwickeln. Die Branche befindet sich noch in der Phase des Ausprobierens. Die wahren Gewinner werden die sein, die als Erste umfangreiche Daten aus echten Arbeitsumgebungen sammeln können. In den nächsten Jahren werden immer mehr Roboter in Supermärkten, Restaurants und Fabriken eingesetzt – diese scheinbar unbedeutenden Arbeitsumgebungen sind in Wirklichkeit die eigentlichen Prüfungen für die Entwicklung erfolgreicher humanoider Roboter.