虎嗅

Übersetzung ins Deutsche: Überbewertete visuelle und taktilen Aspekte: Ein leicht zu kopierendes Geschäftsmodell – welchen Investitionswert hat es wirklich?

原文:被高估的视触觉:容易复制的生意,能有多大投资价值?

Zusammenfassung der Kerninhalte

Visuelle-Taktile-Sensoren (VBTS) sind derzeit ein beliebter Trend im Bereich der körperlichen Intelligenz und der Tastsinn-Technologie. Sie sind jedoch im Wesentlichen „Abhängige“ von visuellen Technologien – sie setzen vorhandene visuelle Hardware und Algorithmen voraus und verfügen über keine eigenen, unabhängigen Kerntechnologien. Aufgrund inhärenter Mängel in der Funktionsweise und der Hardwarestruktur stoßen sie bei der industriellen Anwendung auf Probleme wie große Größe, hohe Bruchanfälligkeit, ungenaue Kraftwahrnehmung sowie einen hohen Rechenaufwand. Daher können sie die Stabilität, Zuverlässigkeit und Skalierbarkeit nicht erfüllen, die für eine großflächige Anwendung der körperlichen Intelligenz erforderlich sind, und werden letztendlich nicht zu einer grundlegenden Infrastruktur für die taktile Wahrnehmung auf industrieller Ebene.

Erstes Kapitel: Akademisches Interesse – aber eine „hohle“ Industrie: Keine Kerntechnologien, nur „Copy&Paste“

Der Erfolg der visuellen-taktilen Sensoren basiert eigentlich auf dem „Vorteil“ der visuellen Technologie:

  • Hardware-Kombination: Die Kernkomponenten (wie CMOS-Kameras) werden gekauft; Start-ups setzen einfach Kameras, elastische Materialien und Lichtquellen zusammen, ohne eigene Herstellungsverfahren zu entwickeln. Selbst Universitätsstudenten können schnell Prototypen erstellen – dadurch ist die Hardware-Hürde sehr niedrig, und die Produkte vieler Unternehmen ähneln sich stark, was zu einer erheblichen Homogenisierung führt.
  • Algorithmen-Kopieren: Die für die Forschung verwendeten Algorithmen (wie ResNet, U-Net) stammen direkt aus dem Bereich der visuellen Technologie und wurden nicht speziell an die physikalischen Eigenschaften des Tastsinns angepasst. Obwohl viele wissenschaftliche Arbeiten veröffentlicht werden, werden die grundlegenden Probleme der taktilen Wahrnehmung nicht wirklich gelöst.
  • Kapitalinteresse fehlt: Da es keine Kerntechnologien gibt und die Lieferketten auf andere Unternehmen angewiesen sind, sind die Geschäftsmodelle leicht zu kopieren. Für Investoren ist das Risiko hoch; solche „Kombinationsinnovationen“ bieten keinen Schutz vor Wettbewerb und erzielen nur geringe Gewinne – sie können daher nicht zu Standardlösungen in der Branche werden.

Zweites Kapitel: Die Hardware ist von Natur aus „empfindlich“: Große Größe, hohe Bruchanfälligkeit, hoher Rechenaufwand

Die Hardwarestruktur der visuellen-taktilen Sensoren macht sie für industrielle Anwendungen ungeeignet:

  • Große Größe: Die Kameras benötigen eine minimale Brennweite, was dazu führt, dass die Sensoren in der Regel mehr als 10 mm dick sind. In den Fingern von Robotern ist jedoch nur wenig Platz – es gibt Motoren und Getriebe, sodass nicht viele taktile Module untergebracht werden können.
  • Elastische Materialien: Weiche elastische Materialien bieten eine hohe Empfindlichkeit, sind aber anfällig für Abnutzung und Alterung; harte Materialien hingegen sind langlebig, verfügen jedoch über zu geringe Deformationsmöglichkeiten, wodurch die Kameras keine Details erfassen können und die Empfindlichkeit sinkt. Dies ist ein physikalisches Dilemma, das nicht gelöst werden kann.
  • Rechenaufwand: Wenn beide Hände eines Roboters mit visuellen-taktilen Sensoren ausgestattet sind, sind zahlreiche Kameras erforderlich – jede Videoströmung muss verarbeitet werden, was zu einem enormen Rechenaufwand führt (z. B. 30 Kameras erfordern mehr als 160 TOPS Rechenleistung; zusätzliche Server sind notwendig). Der Stromverbrauch liegt dabei über hundert Watt – Roboter können dies nicht tragen. Zudem sind zu viele Kabel erforderlich, die in den engen Fingern kaum Platz finden.

Drittes Kapitel: Ungenaue Kraftwahrnehmung aufgrund grundlegender Mängel

Der Kern der Tastsinn-Technologie ist die Kraftmessung; visuelle-taktile Sensoren werten die Kraft jedoch indirekt und daher ungenau ab:

  • Informationenverlust: Die dreidimensionale Kraft (z. B. Druck, Gleiten) wird in eine zweidimensionale Bilddarstellung komprimiert und anschließend wieder zurückgerechnet – dies ähnelt dem Versuch, die tatsächliche Form eines Objekts anhand eines Fotos zu erraten; es fehlen wichtige Informationen, was zu Fehlern führt. Bei mehreren Kontaktpunkten können Richtung und Stärke der Kraft nicht genau ermittelt werden.
  • Pixel ≠ Kraftmesspunkte: Viele Hersteller behaupten, ihre Sensoren hätten „40.000 Wahrnehmungseinheiten pro Quadratzentimeter“; tatsächlich handelt es sich jedoch nur um die Anzahl der Kamerasensorpunkte. Die effektiven Kraftmesspunkte sind jedoch nur wenige hundert – zusätzliche Pixel erhöhen lediglich den Rausch und sind nutzlos.
  • Langsame dynamische Reaktion: Die Bildrate der Kameras liegt bei 30–60 FPS (30–60 Bilder pro Sekunde), während die Belastungen beim Greifen von Objekten in Millisekundenabständen auftreten; die Sensoren reagieren nicht schnell genug. Beispiel: Beim Greifen eines Eies ist die Belastung bereits vorbei, bevor der Sensor sie erfasst – das Ei zerbricht möglicherweise.

Viertes Kapitel: Schwierigkeiten bei der industriellen Anwendung: Komplexe Umgebungen führen zu Problemen, Skalierung unmöglich

Reale industrielle Bedingungen (Ölverschmutzung, hohe Temperaturen, Vibrationen) stellen hohe Anforderungen an die Sensoren; visuelle-taktile Sensoren halten diesen nicht stand:

  • Störungen durch die Umgebung: Öl verklebt auf den elastischen Materialien, was die Bildqualität der Kameras beeinträchtigt; Temperaturschwankungen führen zu Deformationen der Materialien und zum Verschleifen der Lichtquellen, wodurch die Signale ungenau werden. In feuchten Umgebungen kondensiert Wasser auf den Linsen, was zu einem völligen Ausfall der Sensoren führt.
  • Niedrige Langzeitzuverlässigkeit: Mit der Zeit altert das elastische Material (Wandlung), wodurch die Zuordnung zwischen Kraft und Bild verändert wird; selbst wenn die Kameras weiterhin funktionieren, liefern sie falsche Signale. Dies kann zu Fehlern in den Roboteraufgaben führen, was zu Schäden an Werkstücken oder Unfällen führen kann.
  • Hohe Skalierungsanforderungen: Die Kosten für die Installation von visuellen-taktilen Sensoren sind nicht hoch – jedoch sind die Kosten für die dazugehörige Rechenleistung und die Verkabelung sehr hoch. Bei einem Roboter mit 30 Sensoren können die Rechen- und Stromverbrauchskosten höher sein als die Kosten der Sensoren selbst; Unternehmen können sich dies daher nicht leisten.

Fazit

Visuelle-taktile Sensoren eignen sich für Laborforschung und Lehrvorführungen, aber nicht als grundlegende Infrastruktur für die industrielle Anwendung der körperlichen Intelligenz. Für eine erfolgreiche Umsetzung der körperlichen Intelligenz sind Technologien erforderlich, die zuverlässig Kraft messen können, langlebig sind und einfach integriert werden können. Visuelle-taktile Sensoren erfüllen diese Anforderungen weder hinsichtlich ihrer Funktionsweise noch ihrer Hardwarestruktur. Ihr aktueller Erfolg ist nur vorübergehend; sie werden letztendlich durch Technologien ersetzt, die besser auf industrielle Bedingungen abgestimmt sind.