虎嗅

GPT-6 ist da – Wir haben mit mehreren Insidern über die „Befestigungsanlagen“ und „Unterwasserfelsen“ der körperlichen Intelligenz gesprochen.

原文:GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

GPT-6 ist da – Ist der „Schutzwall“ der körperlichen Intelligenz noch vorhanden? Eine tiefgehende Analyse über Angst, Chancen und die Grundlagen der Technologie

Hallo zusammen, ich bin euer Finanzjournalist. In der Tech-Welt ist gerade die Hölle los: OpenAI hat die Astra-Version von GPT-6 veröffentlicht und erklärt deutlich, dass sie humanoide Roboter entwickeln möchte. Das ist, als würde ein Riese mit einem „Drachentöter“ plötzlich sagen: „Ich werde jetzt Landwirtschaft betreiben.“

Für die Unternehmen, die sich mit der Hardware und Algorithmen für Roboter beschäftigen, ist das nicht nur Druck, sondern auch eine existenzielle Krise: Wenn KI intelligent genug ist, braucht sie dann noch spezialisierte „Roboterexperten“? Wird mir mein Job weggenommen?

Heute werden wir anhand der Meinungen von Branchenführern wie Zhu Zheng von Jijia Vision, Zhu Xing von Ant Lingbo und Wang Qian von Zibian diese Frage genauer untersuchen und alles in verständlichen Worten erklären: Was bringt GPT-6 wirklich? Wo liegt der Schutzwall der körperlichen Intelligenz? Sollten wir panisch werden oder ruhig bleiben?

---

Erstes Kapitel: Der Wolf ist wirklich da – Warum fangen alle plötzlich an, Angst zu haben?

Zunächst müssen wir zugeben, dass diese Angst berechtigt ist und nicht aus der Luft gegriffen ist.

1. Das Gefühl einer „Dimensionssenkung“

Früher dachte man, dass die Entwicklung von Sprachmodellen (wie ChatGPT) und die von Robotern (körperliche Intelligenz) zwei verschiedene Dinge seien. Aber GPT-6 Astra kann nicht nur chatten, sondern auch direkte Kontrolle über Roboterarme ausüben. In den Demonstrationsvideos zeigt es, wie es Stäbchen greift und Tassen einsetzt – und das macht es sehr überzeugend.

Zhu Zheng von Jijia Vision sagt es ganz klar: „Der Wolf ist da, geben Sie die Illusionen auf.“ Seine Logik ist: Sprachmodelle haben bereits mehrere Modalitäten (Bildern, Ton) übernommen und fressen nun auch die körperliche Intelligenz auf. Zudem übertrifft ein Gigant wie OpenAI die Start-ups in Bezug auf Personal, Rechenleistung und Finanzmittel. Wenn sie selbst in den Markt einsteigen, werden die Start-ups es schwer haben, sich zu wehren.

2. Die Dringlichkeit der Zeit

Zhu Zheng ist der Meinung, dass die nächsten ein bis zwei Jahre ein entscheidender Zeitraum sind. Die aktuellen Unternehmen der körperlichen Intelligenz haben noch keinen echten, nicht nachahmungsfähigen „Schutzwall“ aufgebaut. Wenn die Giganten jetzt einsteigen, könnten sie mit ihrer starken allgemeinen Kognition schnell die technischen Unterschiede ausgleichen und die Start-ups, die noch an der ersten Generation von Produkten arbeiten, ausschalten.

3. Die Essenz der Angst: Angst davor, die Werte vorzeitig zu verlieren

Der Kern dieser Angst ist, dass die Werte der körperlichen Intelligenz ursprünglich Jahre der Entwicklung erfordern würden. Jetzt könnten die großen Modelle diese Werte durch die Veröffentlichung eines stärkeren Modells einfach vorzeitig realisieren und die Gewinne für sich beanspruchen. Das ist wie wenn man hart an einem neuen Medikament arbeitet und dann ein großes Unternehmen ein allgemeines Rezept veröffentlicht, das das eigene Produkt ersetzt.

---

Zweites Kapitel: Keine Panik – Es ist nicht so einfach, wenn große Modelle in die physische Welt eindringen

Obwohl die Angst real ist, gab es auch ruhige Stimmen auf der Konferenz. Zhu Xing von Ant Lingbo und Wang Qian von Zibian stellten eine scharfe Frage: Wenn OpenAI so stark ist, warum entwickeln sie dann nicht selbst autonome Fahrzeuge und übernehmen Tesla?

1. „Verständnis“ bedeutet nicht „Fähigkeit zum Handeln“

Sprachmodelle sind gut darin, „Semantik“ und „Logik“ zu verstehen – zum Beispiel zu wissen, was eine „Tasse“ ist und was die Anweisung „Die Tasse auf den Tisch stellen“ bedeutet. Aber die physische Welt ist komplex, dynamisch und voller Reibungen.

  • Semantischer Bereich (Gehirn): Zu wissen, wo etwas ist und wohin es gebracht werden soll – GPT-6 ist sehr stark in diesem Punkt.
  • Physischer Bereich (Arme und Beine): Zu wissen, wie man Kraft anwendet, wie man die Winkel justiert und wie man auf das Herunterrutschen von Objekten reagiert – das ist derzeit GPT-6s Schwachpunkt.

2. Der große Unterschied zwischen Daten und Validierung

Wang Qian weist darauf hin, dass der Fortschritt von Sprachmodellen auf umfangreichen Programmierdaten und einem ausgeklügelten Validierungssystem basiert. Die Verbesserungen bei der Videoerstellung haben das Problem der Robotersteuerung noch nicht gelöst.

Große Modelle müssen auch die Infrastruktur ergänzen:

  • Echte Daten: Daten darüber, wie Roboter im echten Leben fallen oder Fehlschläge bei Greifvorgängen haben – diese Daten besitzen sie nicht.
  • Hardwareanpassung: Für verschiedene Roboterarme und Sensoren sind unterschiedliche Steuerungsstrategien erforderlich.
  • Validierungssysteme: Wie kann man beweisen, dass der Roboter wirklich richtig handelt? Dafür braucht man ein komplexes Bewertungssystem.

3. Der Unterschied in den industriellen Fähigkeiten

Zhu Xing vergleicht dies mit dem Autonomen Fahren: Auch wenn die Modellfähigkeiten führend sind, reicht das nicht aus, um die Situationen zu verstehen oder eine ausgereifte Datenpipeline zu haben. Zu wissen, was „gute Daten“ sind und das entsprechende Know-how zu sammeln, ist der eigentliche Schutzwall.

---

Drittes Kapitel: Die Wahrheit herausfinden – Was kann GPT-6 wirklich und was nicht?

Um die tatsächliche Rolle von GPT-6 in der körperlichen Intelligenz zu verstehen, führten Xu Huazhe von Breakout Robotics und das Forschungsteam von RoboDojo einige konkrete Tests durch. Das Ergebnis war interessant: GPT-6 ist weder „göttlich“ noch „nutzlos“, sondern eher ein „starker Berater“.

Stärken: Semantik und räumliches Verständnis

In den Tests zeigte Astra hervorragende Leistungen:

  • Es konnte Objekte auf dem Tisch erkennen.
  • Es konnte feine Stäbchen greifen und sogar aufstellen, um sie in eine Tasse einzusetzen.
  • Es konnte „Schub“ und „Schieben“ als nicht-greifende Aktionen planen.

Das zeigt, dass GPT-6 in Bezug auf das Wissen, was zu tun ist, und das Verständnis räumlicher Beziehungen sehr stark ist.

Schwächen: Komplexe Kontakte und feine Operationen

Sobald die Aufgaben komplizierter werden – zum Beispiel Dinge mit Stäbchen anheben, Kleidung stapeln oder Gegenstände mit beiden Händen übergeben – ist die Leistung von Astra nicht zufriedenstellend. Der Grund: In physischen Interaktionen gibt es viele „unsichtbare“ Variablen wie Reibung, die Elastizität von Objekten und kleine Veränderungen des Schwerpunkts. Diese können nicht allein anhand der Optik (Sehen) erkannt werden, sondern erfordern taktile Rückmeldungen und Echtzeitanpassungen.

Klüngel: Eine gemischte Architektur ist der Schlüssel

Die Forschung von RoboDojo zeigte einen wichtigen Punkt:

  • Alleinige Steuerung durch GPT-6 Astra: Erfolgsrate 26%.
  • Gemischte Steuerung durch GPT-6 Astra + spezieller körperlicher Modell (π₀.₅): Erfolgsrate 48%.
  • Details: Im gemischten System korrigierte GPT-6 nur 14,4% der Bewegungen; der Rest (85,6%) wurde vom unteren körperlichen Modell erledigt.

Interpretation: Die Kombination aus „allgemeiner Logik“ und lokaler Erfahrung in der Ausführung** ist die beste Lösung. GPT-6 ist für die Hochstrategie verantwortlich (z. B. „Zuerst die Tasse nehmen, dann den Löffel“), während das untere Modell die Ausführung übernimmt (z. B. „Wie die Finger Kraft anwenden“).

---

Viertes Kapitel: Wo liegt der Schutzwall? Eine Neubewertung von „Daten“ zu „Schließkreisen“

Da GPT-6 so stark ist, wo liegt dann der Schutzwall der Unternehmen der körperlichen Intelligenz? Früher hieß es oft „Ich habe Daten“ – aber das muss jetzt hinterfragt werden.

1. Der „Datenbarrier“ wird abgebaut

Li Tianyu von Yuance Future teilte einen Trend mit: Sie verwenden bereits GPT-6, um Simulationsumgebungen zu erstellen.

  • Früher: Die Erstellung einer 3D-Simulation erforderte viel manuelle Arbeit und war teuer und zeitaufwendig.
  • Jetzt: GPT-6 kann logisch und vollständige 3D-Szenen schnell generieren.

Das bedeutet, dass der Besitz von Daten nicht mehr so wertvoll ist, da die Produktionskosten sinken. Der Vorteil, den man früher durch das Sammeln von Daten hatte, wird durch die Fähigkeiten der allgemeinen Modelle ausgehöhlt.

2. Der wahre Schutzwall: Die Fähigkeit, Probleme kontinuierlich zu erkennen

Wenn Daten leicht erhältlich sind, was ist dann schwierig zu bekommen?

  • Zu wissen, unter welchen Umständen Roboter scheitern.
  • In die entsprechenden Szenen einzutreten, um „Fehlschlagsdaten“ zu sammeln.
  • Aus Fehlern wertvolle Informationen zu gewinnen.
  • Durch Training und Bewertung Verbesserungen zu erzielen.

Das ist der eigentliche Schutzwall. Große Modelle mögen gut darin sein, Daten „massenweise“ zu produzieren, aber Unternehmen der körperlichen Intelligenz sind gut darin, im echten Leben Fehler zu machen. Der Schutzwall besteht nicht mehr darin, wie viele Daten man hat, sondern darin, ob man einen Schließkreis hat, der aus Fehlern lernen und diese in zuverlässigere Produkte umwandeln kann.

3. Physikalisch „natürlich“ vs. semantische Anpassung

Shen Yujun von Yingshen Intelligence und Min Wei von Yingshen Intelligence betonen den Begriff „physikalisch natürlich“:

  • Alte Methode: An Sprachmodelle (VLM) oder Video-Modelle anzupassen, um körperliche Modelle zu erhalten.
  • Risiko: Wenn die Basismodelle (wie GPT-6) stark verbessert werden, werden die angepassten Modelle sofort veraltet und durch „Dimensionssenkungen“ überholt.
  • Neue Methode: Die Entwicklung von Modellen, die auf physikalischen Gesetzen und räumlichen Veränderungen basieren.
  • Vergleich: Die alte Methode ist wie das Bauen eines Hauses am Strand – das Wasser (die Basismodelle) steigt und zerstört es; die neue Methode ist wie das Bauen eines Hauses auf Felsen – es ist schwierig, aber stabiler.

---

Fünftes Kapitel: Die zukünftige Struktur: Es geht nicht darum, wer wen übernimmt, sondern um Zusammenarbeit und Aufteilung der Arbeit**

Schließlich sollten wir den Gedanken des „Nullsummenspiels“ hinter uns lassen. Die Einführung von GPT-6 bedeutet nicht das Ende der Branche der körperlichen Intelligenz, sondern eine Neuordnung der Arbeitsteilung.

1. Infrastruktur vs. Anwendungserbringung

Min Wei von Yingshen Intelligence glaubt, dass OpenAI in Zukunft eher wie ein Anbieter von Infrastruktur wie Wasser, Strom und Netzwerke fungieren wird.

  • OpenAI/Anthropic: Stellt starke allgemeine Kognitionsfähigkeiten als Grundlage-API oder Basismodelle zur Verfügung.
  • Unternehmen der körperlichen Intelligenz: Verantwortlich für die konkrete Hardwareintegration, Szenenanpassung, Optimierung der physischen Interaktionen und After-Sales-Dienste.

Wirtschaftliche Logik: In einem echten Roboterprodukt machen die semantischen Fähigkeiten der großen Modelle vielleicht weniger als die Hälfte aus; der restliche Wert stammt aus dem Verständnis physikalischer Gesetze, Maschinenbau und komplexer Szeneninteraktionen. Das sind „schmutzige“ und anstrengende Aufgaben, die die Giganten vielleicht nicht übernehmen möchten und auch nicht vollständig auslagern können.

2. Umgekehrte Ermächtigung: Roboter machen KI schlauer

Shen Yujun stellt die These auf, dass körperliche Intelligenz die großen Modelle beeinflussen könnte:

Roboter sammeln kontinuierlich Daten aus der Umgebung – diese echten physischen Rückmeldungen sind wertvolle Lernmaterialien für reine digitale Modelle.

  • Daten von Fehlschlägen von Robotern können KI lehren, wie Gravitation funktioniert.
  • Daten von Fehlschlägen bei Greifvorgängen können KI helfen, Reibung zu verstehen.

Fazit: Die physische Welt bietet KI neue Entwicklungsmöglichkeiten. Unternehmen der körperlichen Intelligenz sind nicht nur Anwender von KI, sondern auch „Nährstofflieferanten“ für deren Weiterentwicklung.

3. Änderung der Wettbewerbskriterien

Der Wettbewerb wird nicht mehr darum gehen, wer die größten Modellparameter hat, sondern darum:

  • Wer mit weniger Interaktionserfahrung höhere Erfolgsraten erreicht?
  • Wer die niedrigsten Bereitstellungskosten hat?
  • Wer bei der Fehlerbehandlung und Kostenkontrolle am besten abschneidet?
  • Wer einen schnellen Kreislauf aus Bereitstellung, Rückmeldung und Optimierung aufbauen kann?

---

Fazit: Ratschläge für die Allgemeinheit und die Branche

1. Für Investoren: Verfolgen Sie nicht blind Konzepte der „reinen Software“ in der körperlichen Intelligenz, und verneinen Sie auch nicht alle Hardwareunternehmen aufgrund von GPT-6. Konzentrieren Sie sich auf Unternehmen, die echte Szenendaten haben, die Fähigkeit zur Entwicklung physisch natürlicher Modelle besitzen und die Bereitstellungskosten kontrollieren können.

2. Für Unternehmer:

  • Träumen Sie nicht davon, mit der „Anpassung“ großer Modelle zu überleben – das ist ein Sackgasse.

Arbeiten Sie intensiv an der physischen Ebene: Konzentrieren Sie sich auf die Integration von Sensoren, die Optimierung von Mechanikstrukturen, die Sammlung von Daten aus der realen Welt und die Analyse von Fehlschlägen.

Nutzen Sie Tools: Nutzen Sie Tools wie GPT-6, um die Kosten für Simulationen und Datenbereinigung zu senken und die Ressourcen in die Forschung zu physischer Interaktionen zu investieren.

Bauen Sie Schließkreise auf: Ihr Schutzwall sind nicht die Daten selbst, sondern Ihre Fähigkeit, „physikalische Intuition“ aus den Daten zu gewinnen.

3. Für die Allgemeinheit: GPT-6 wird Roboter nicht sofort populär machen, aber sie wird sie schlauer und günstiger machen. In den nächsten Jahren werden wir mehr „halbautomatische“ Roboter in Fabriken und Haushalten sehen – sie werden vielleicht immer noch Fehler machen, aber sie werden immer zuverlässiger werden.

Zusammenfassung:

GPT-6 ist ein „Accelerator“ für die körperliche Intelligenz, kein „Endgerät“. Es verkürzt die Zeit, in der die Branche ihren Wert beweisen muss, erhöht aber auch die Hürden. Die Grenzen verschieben sich ständig, aber wer es schafft, die Komplexität der physischen Welt in „produktive Fähigkeiten umzuwandeln, die andere nicht nachahmen können, wird seinen Platz behalten.**