虎嗅

„Hey Siri“ auf der Apple-Präsentation – Warum weckt das nicht Ihr Handy?“

原文:苹果发布会中的Hey Siri,为什么不会叫醒你的手机?

---

Zusammenfassung des Kerninhalts

Dieser Artikel beleuchtet ein fast unbemerktes Detail der Apple-Präsentation: Normalerweise würden die iPhones, Uhren und Tablets der Zuschauer – insgesamt Zehntausende – aufgrund der wiederholten Erwähnung von Siri durch den neuen CEO auf der Bühne auf die Aktivierungsanweisung reagieren. Die daraus resultierenden Millionen von Anfragen würden die Siri-Server überlasten und zu einem massiven DDoS-Angriff führen, mit dem Ergebnis, dass alle Siri-Systeme gleichzeitig fehlerhaft reagieren und die Server ausfallen würden. Doch bei Apple ist nichts dergleichen passiert. Die Lösung war äußerst raffiniert: Es wurde kurzfristig ein „unsichtbarer Audio-Filter“ für das gesamte Siri-System eingesetzt, der alle Audiosignale im Frequenzbereich von 3–6 kHz ausschloss – genau die Frequenz, auf der die Lautsprecher im Veranstaltungsort die Aktivierungsanweisungen abspielten. Dadurch wurden weder die Benutzer daran gehindert, Siri direkt mit lauter Stimme zu aktivieren, noch wurden die Server überlastet. Diese Technologie ist jedoch nicht einfach nachzuahmen, da sie auf Apple’s internen, wenig öffentlich bekannten Produktionsprozessen basiert.

---

Detaillierte Analyse

1. Warum wäre es bei gleichzeitiger Aktivierung durch Zehntausende von Personen zu einem Zusammenbruch gekommen?

Viele Menschen erkennen nicht, wie absurd diese Situation wäre: Stellen Sie sich vor, Siri-Server wären wie ein Teehaus, das nur 100.000 Bestellungen pro Stunde bearbeiten kann. Bei normalen Bestellungen ist das kein Problem, aber wenn plötzlich 1 Million Menschen gleichzeitig „Ich möchte bestellen“ rufen, kann das System nicht mehr reagieren. Bei der Apple-Präsentation gab es Zehntausende Zuschauer, die jeweils mindestens drei Apple-Geräte besaßen – dazu kamen noch Millionen von Geräten, die die Präsentation online verfolgten. Jede Aktivierungsanfrage würde die Server überlasten.

2. Der „unsichtbare Audio-Filter“ von Apple: Was bedeutet das genau?

Der Prinzip ist einfach: Audiosignale können als „Nudeln unterschiedlicher Dicke“ betrachtet werden; verschiedene Quellen erzeugen Nudeln unterschiedlicher Dicke. Apple legte fest, dass alle Signale im Frequenzbereich von 3000–6000 Hz ignoriert werden. Selbst wenn man „Hey Siri“ hundertmal ruft, wird die Anfrage nicht an den Server gesendet. Ähnlich wie bei einem intelligenten Lautsprecher, der voreingestellt ist, keine Signale von Fernsehlautsprechern zu beachten, werden solche Signale direkt blockiert, ohne dass die Server belastet werden.

3. Warum funktioniert diese Lösung genau so?

Apple hat alle Details im Voraus berücksichtigt: Seine Akustik-Team hat monatelang im Veranstaltungsort Tests durchgeführt und die Eigenschaften der Lautsprecher, des Raumechos sowie der Audio-Compressionsverfahren analysiert. Die Signale, die von den Lautsprechern ausgestrahlt wurden, lagen genau im gewünschten Frequenzbereich. Wenn man hingegen direkt vom Handy aus „Hey Siri“ ruft, wird der Ton nicht über Lautsprecher verstärkt und fällt daher nicht in diesen Bereich.

4. Kann diese Technologie nachgeahmt werden?

Die meisten Sprachassistenten sind nicht in der Lage, dies nachzumachen. Zwei Haupthindernisse sind:

1. Man benötigt vollständige Kontrolle über den gesamten Prozess – von der Aufnahme über die lokale Verarbeitung bis zur Cloud-Identifizierung.

2. Es fehlen ausreichende akustische Daten, um sicherzustellen, dass nur über Lautsprecher abgespielte Signale blockiert werden.

5. Hinter dieser unscheinbaren Lösung steckt Apples Produktphilosophie

Apple legt großen Wert auf Zuverlässigkeit und verzichtet auf optische Effekte. Ein solcher Fehler würde weltweite negative Reaktionen verursachen und enorme PR-Schäden. Daher investiert Apple viel in die Entwicklung solcher Lösungen – auch wenn sie für die Nutzer kaum sichtbar sind.