Kernzusammenfassung: Die „Pille gegen Reue“ in der AI-Sicherheit ist wirkungslos – die einzige Lösung liegt vor der Veröffentlichung
Die zentrale Aussage dieses Artikels ist äußerst scharf und gegenintuitiv: Im Bereich der Künstlichen Intelligenz sind nach der Freisetzung von Fähigkeiten (insbesondere bei Open-Source-Wichten oder Datenlecks) nachträgliche Maßnahmen (wie Sperren oder Fehlerbehebungen) wie das Ausleeren von Wasser aus einem lecken Boot – sie können den Wasserfluss niemals vollständig aufhalten. Daher müssen die effizientesten und wirtschaftlichsten Kontrollmaßnahmen bereits vor der Veröffentlichung ergriffen werden.
Der Artikel verwendet den „Cross-Session Replay-Angriff“, der von Anthropic offenbart wurde, als Beispiel für ernsthafte strukturelle Mängel im aktuellen AI-Sicherheitssystem:
1. Nachträgliche Verteidigung ist ein aussichtsloser Kampf: Angreifer müssen nur eine Methode finden, um die Sicherheitsmaßnahmen zu umgehen, während Verteidiger gegen alle möglichen Angriffe vorgehen müssen. Die Kosten für Angreifer sinken mit der Skalierung, während die Kosten für Verteidiger linear steigen.
2. Freiwillige Zusagen sind unzuverlässig: Mechanismen wie die derzeitigen „Prüfungen vor der Veröffentlichung“ in den USA basieren auf der freiwilligen Zusammenarbeit der Unternehmen und fehlen an Durchsetzungskraft. Unter dem Druck des Wettbewerbs können Sicherheitszusagen zu bloßer „Show-Compliance“ werden.
3. Unumkehrbarkeit ist das Hauptproblem: API-Aufrufe können zwar zurückgerufen werden, aber Open-Source-Wichte, sobald sie veröffentlicht werden, sind wie ausgeschüttetes Wasser und nicht mehr rückgängig zu machen. Daher sollten die Bewertungskriterien für Open-Source-Wichte strenger sein als für API-Aufrufe – doch die aktuelle Systemarchitektur ist genau das Gegenteil.
4. Vorschläge zur Lösung: Es wird ein geschlossener Kreislauf aus „starker Vorabüberwachung und strenger Nachverfolgung“ empfohlen, einschließlich verpflichtender Prüfungen vor der Veröffentlichung, „Stopptasten“ für unkontrollierte Betriebszustände sowie Versicherungen und Haftungsgesetze, die es Verstößen ernsthafte Konsequenzen auferlegen.
Kurz gesagt: Die Sicherheit von KI kann nicht durch nachträgliche Maßnahmen gewährleistet werden, sondern muss durch vorherige Kontrollen sichergestellt werden.
---
Detaillierte Erklärung in fünf Dimensionen
Warum ist „Nachträgliche Reaktion“ ein aussichtsloser Kampf?
Verständliche Metapher:
Stellen Sie sich vor, Sie betreiben einen Tresor und legen fest, dass Kunden beim Abheben von Geld keine Bargeldsummen erhalten dürfen, sondern nur einen „Abholzettel“ (Thinking Signature). Sie denken: „So kontrolliere ich den Geldfluss.“
Doch Hacker entdecken einen Fehler: Sie nutzen diesen „Abholzettel“, gehen zu einem anderen Schalter (neuer Sitzung) und überreden den Angestellten, die Informationen darauf in einen vollständigen „Abhebungsbeleg“ umzudrucken (vollständige Nachvollziehbarkeitsspur).
Detaillierte Erklärung:
- Essenz des Fehlers: Es liegt nicht an mangelnder Technologie, sondern an falschen logischen Annahmen. Das System geht davon aus, dass es eine klare Grenze zwischen „legalem Abruf“ und „böswilligem Nachspielen“ gibt. Tatsächlich können Angreifer diese Grenze nutzen, solange das System den „Zustand vor dem Abruf“ zulässt.
- Kostenasymmetrie:
- Angreifer: Sie müssen nur eine funktionierende Umgehungsstrategie finden und können diese unbegrenzt nutzen. Die Kosten für die Erstellung von 1000 falschen Konten sind viel geringer als die Kosten für die Überwachung von 1000 echten Konten.
- Verteidiger: Sie müssen jeden betrügerischen Account überwachen und alle möglichen Abhebungswege schützen.
- Folgerung: In einer offenen Umgebung führt die Freisetzung von Fähigkeiten dazu, dass der Verteidiger in einen endlosen Kampf gerät. Wenn Sie eine IP-Adresse sperren, wechselt der Angreifer zehn weitere; wenn Sie eine Schnittstelle ändern, sucht der Angreifer eine andere.
Warum sind „Prüfungen vor der Veröffentlichung“ die einzige Rettung?
Verständliche Metapher:
Stellen Sie sich die Sicherheitsinspektionen in einem Kernkraftwerk vor. Man kann nicht warten, bis das Kraftwerk explodiert, bevor man es repariert – alle Sicherheitsventile müssen vor dem Start des Reaktors überprüft werden.
Die aktuelle US-Politik ähnelt einer „freiwilligen Gesundheitsuntersuchung“: Die Regierung sagt, Sie können sich untersuchen lassen, aber Sie dürfen auch ohne Untersuchung fahren. In einem intensiven Wettbewerb wählen viele Fahrer, trotz möglicher Sicherheitsmängel weiterzufahren.
Detaillierte Erklärung:
- Mängel des aktuellen Systems: Die Vereinbarung zwischen dem CAISI (Center for Artificial Intelligence Standards and Innovation) und den fünf großen AI-Laboren ist freiwillig und hat keine rechtliche Bindungskraft. Wenn ein Unternehmen die Prüfung für zu aufwendig oder zu langsam hält oder wenn die Ergebnisse seine Geschäftspläne behindern könnten, kann es sich weigern, mitzumachen oder nur oberflächliche Maßnahmen ergreifen.
- Wirkliche Zweck der Prüfung: Die Prüfung dient nicht dazu, zu beweisen, dass ein Modell „absolut sicher“ ist (das ist unmöglich), sondern um die Wahlmöglichkeit zu erhalten.
- Vor der Veröffentlichung: Wenn die Prüfung nicht bestanden wird, kann die Regierung Nein sagen und das Modell nicht veröffentlichen.
- Nach der Veröffentlichung: Wenn das Modell Schaden verursacht, kann die Regierung nur versuchen, den Schaden zu begrenzen (z. B. mit Geldstrafen oder Stilllegungen).
- Wichtiger Wandel: Wir müssen von einer Prüfung auf die Frage umsteigen, ob ein Modell „sicher genug ist“, zu einer Prüfung, ob die Folgen eines massiven Missbrauchs für die Gesellschaft akzeptabel sind. In der Kernkraftindustrie wird nicht nach Nullunfällen gestrebt, sondern danach, dass Reaktoren im Falle eines Unfalls stillgelegt werden können; in der AI-Industrie muss nachgewiesen werden, dass die Risiken nach der Veröffentlichung kontrollierbar sind. Wenn die Risiken unkontrollierbar sind, sollte das Modell nicht veröffentlicht werden.
Open-Source-Wichte: Ein Weg ohne Rückkehr
Verständliche Metapher:
Eine geschlossene API ist wie ein Essen im Restaurant – der Koch kocht das Essen, und Sie können es essen, aber Sie dürfen das Rezept nicht stehlen. Ein Open-Source-Weight ist wie ein in Bücher gedrucktes Rezept, das kostenlos an alle verteilt wird. Sobald das Buch in Umlauf kommt, können Menschen das Rezept kopieren, ändern oder sogar zu etwas Schädlichem verwenden – und Sie können das Buch nicht mehr von allen zurückholen.
Detaillierte Erklärung:
- Unumkehrbarkeit: Das größte Risiko bei Open-Source-Modellen liegt in ihrer „unumkehrbaren Verbreitung“. Sobald die Weight-Dateien heruntergeladen werden, können sie beliebig modifiziert und weiterverbreitet werden.
- Zerbrechlichkeit von Sicherheitsschichten: Viele Open-Source-Sicherheitsmechanismen sind nur oberflächliche Schutzschichten. Forscher haben gezeigt, dass mit geringfügigen „böswilligen Anpassungen“ diese Schutzschichten entfernt werden können, wodurch gefährliche Fähigkeiten freigesetzt werden.
- Notwendigkeit der schrittweisen Veröffentlichung:
- Verschlüsselte Verbreitung: Auch wenn dies die Dekodierung nicht verhindern kann (da das Modell auf dem Benutzergerät ausgeführt werden muss), erhöht es die Kosten für Angriffe.
- Schrittweise Veröffentlichung: Zuerst sollten die Weight-Dateien nur an vertrauenswürdige Akteure (z. B. Sicherheitsbehörden) verteilt werden, um die Reaktionen des Ökosystems zu beobachten, bevor die Verbreitung ausgeweitet wird.
- Zentrale Widersprüche: Verschlüsselte Verbreitung macht die „Offenheit“ zu einer „kontrollierten Offenheit“ und kostet zwar einige öffentliche Vorteile, bietet aber mehr Kontrolle.
„Stopptasten“ für unkontrollierte Betriebszustände
Verständliche Metapher:
Stellen Sie sich einen „Notstopp-Button“ für selbstfahrende Autos vor. Wenn das Auto auf der Autobahn plötzlich aus dem Kontrollverlust gerät, benötigen Sie einen Button, um es sofort anzuhalten. Dieser Button löst das Problem nicht, warum das Auto aus dem Kontrollverlust geraten ist, aber er verhindert, dass das Auto die ganze Straße zerstört.
Detaillierte Erklärung:
- Anwendbare Situationen: „Stopptasten“ richten sich gegen unkontrollierte Aktionen während des Betriebs (Agentic Uncontroll), nicht gegen die Ausbreitung von Fähigkeiten.
- Ausbreitung von Fähigkeiten: Wenn die Modell-Weight-Dateien gestohlen werden, kann dies nicht rückgängig gemacht werden. Dafür sind vorherige Kontrollen notwendig.
- Unkontrollierter Betrieb: Das Modell führt gerade eine Aufgabe aus und beginnt plötzlich, das Netzwerk anzugreifen oder gefährliche Aktionen durchzuführen. In diesem Zeitraum besteht noch die Möglichkeit, die Auswirkungen einzudämmen.
Rechtlicher Hintergrund: Der vorgeschlagene „AI-Stopptasten-Gesetz“ in den USA verlangt, dass Hersteller solche Stopptasten in ihre Systeme integrieren und dem Innenministerium die Befugnis gibt, das Modell bei Kontrollverlust abzuschalten. Dies ist eine gezielte Maßnahme gegen unkontrollierte Risiken während des Betriebs.
Die Theorie der Umsetzung: Regeln ohne Durchsetzungskraft sind nutzlos
Verständliche Metapher:
Wenn Verkehrsregeln vorschreiben, dass man bei Rot anhalten muss, aber Strafen für Verstöße fehlen, sind diese Regeln nur Dekorationen. Der GDPR (General Data Protection Regulation) ist wirksam, weil Verstöße zu schwerwiegenden finanziellen Konsequenzen führen.
Detaillierte Erklärung:
- Falle freiwilliger Selbstregulierung: Die derzeitigen Selbstregulierungsmechanismen in der AI-Industrie (z. B. das Frontier Model Forum) haben keine rechtliche Bindungskraft. Im Wettbewerb sind Unternehmen, die die Regeln befolgen, oft im Nachteil (weil sie langsamer entwickeln und mehr Kosten haben), was zu einer „Auswahl von schlechteren gegen bessere Produkte“ führt.
- Notwendigkeit der Nachverfolgung: Vorherige Regeln müssen durch nachträgliche Haftungsregeln untermauert werden.
- Haftungsgesetze: Wenn ein Modell nach der Veröffentlichung Schaden verursacht, müssen die Verantwortlichen haftbar gemacht werden.
Verpflichtende Versicherungen: Hersteller von fortschrittlichen Modellen müssen Versicherungen abschließen, deren Preis von den Prüfungsergebnissen abhängt. Je strenger die Prüfung, desto niedriger der Preis; je nachlässiger die Prüfung, desto höher der Preis.
Marktzugang: Bundesaufträge und der Zugang zu kritischen Infrastrukturen setzen die Durchführung von Prüfungen vor der Veröffentlichung voraus.
- Internationale Koordination: Einseitige Regulierungen führen zu „Justizparadoxien“ – Angreifer können in Länder mit schwächerer Regulierung ausweichen. Daher ist internationale Koordination eine Voraussetzung für die Wirksamkeit solcher Regelungen, aber auch der schwierigste Aspekt.
Fazit: Ein schlüssiger Beweis
Der Artikel zeigt auf beängstigende Fakten:
1. Februar 2026: Anthropic veröffentlichte RSP 3.0 und entfernte die ursprünglich festgelegten Mechanismen zur vorübergehenden Sperre und die Zusagen zur Prävention von großflächigen Angriffen und ersetzte sie durch eine flexiblere Strategie und transparentere Informationen.
2. September 2026: Anthropic enthüllte den größten bislang bekannten Distillation-Angriff, bei dem Angreifer genau die Schwachstellen ausnutzten, gegen die sie zuvor gewarnt hatten.
Das ist kein Zufall, sondern Kausalität. Die Abschwächung der Sicherheitszusagen von „starren Verpflichtungen“ zu „flexiblen Aussagen“ führte direkt zum Versagen der nachträglichen Verteidigung und zum ungesteuerten Verhalten der Angreifer.
Erkenntnisse für die Allgemeinheit:
In dieser Informationsära geben wir täglich Informationen frei (Posten in sozialen Netzwerken, Daten hochladen, AI-Dienste nutzen). Wir müssen uns bewusst sein, dass einige dieser Freisetzungen unumkehrbar sind.
- Für Unternehmen: Rechnen Sie nicht mit nachträglichen Lösungen, sondern führen Sie vor der Produktveröffentlichung gründliche Sicherheitsprüfungen durch.
- Für Privatpersonen: Seien Sie sich bewusst, dass Ihre Daten in AI-Modelle integriert werden können und nicht wirklich „gelöscht“ werden können.
- Für die Gesellschaft: Wir müssen ein System mit strenger Vorabüberwachung und strenger Nachverfolgung schaffen, anstatt uns auf die „Selbsterkenntnis“ und „Erzählungen“ der Unternehmen zu verlassen.
Die einzige Stelle, an der die Kontrolle liegt, ist vor der Freisetzung der Fähigkeiten.