虎嗅

Gestern Nacht erlebte das Silicon Valley den „Kampf der AI-Götter“.

原文:昨晚,硅谷经历了AI诸神之战。

Zusammenfassung der Kerninhalte

Gestern haben im Silicon Valley drei bedeutende AI-Entwicklungen stattgefunden: Google hat Gemini 3.8 Flash veröffentlicht, Meta hat Muse Spark1.3 aktualisiert und das Startup Mostik wurde in der Zeitschrift WIRED vorgestellt. Auf den ersten Blick scheinen diese Ereignisse nur die Leistungsfähigkeit der Modelle zu verbessern, doch sie deuten tatsächlich auf eine „vielschichtige Revolution“ bei den Kosten der AI-Verarbeitung hin: Von der „Vereinheitlichung hochentwickelter Funktionen“ über die Reduzierung von unnötigen Arbeitsprozessen bis hin zur direkten Übertragung von internen Daten ohne Verwendung natürlicher Sprache. Die Wirtschaftlichkeit der AI wandelt sich dabei von einer Gebührenstruktur, die auf der Anzahl der verarbeiteten „Tokens“ basiert, hin zu einer, die sich nach den tatsächlichen Kosten der durchgeführten Aufgaben richtet. Dadurch wird die Nutzung von AI immer günstiger – was möglicherweise zu einer Vielzahl von Anwendungen führen wird, die bisher nicht rentabel waren.

1. Google: Hochentwickelte AI-Funktionen in „günstige Pakete“

Gemini 3.8 Flash gehört ursprünglich zur Kategorie „schnell und günstig, aber mit eingeschränkter Leistung“. Dieses Mal wurden jedoch hochentwickelte Software-Engineering-Fähigkeiten (z. B. die Fähigkeit, mehrere Code-Schritte in Tests wie DeepSWE zu bewältigen) in das günstige Preissegment von Flash integriert:

  • Leistung: 74 % in den DeepSWE-Tests – auf dem Niveau des Top-Modells Claude Opus5.
  • Kosten: Durchschnittlich nur 2,36 US-Dollar pro Aufgabe, während Claude 11,84 US-Dollar und GPT 6,46 US-Dollar kostet (d.h. etwa dreimal so viel).

Warum ist das wichtig? In der Ära der AI-Agenten geht es nicht nur darum, kurz zu kommunizieren, sondern um die durchgehende Ausführung komplexer Aufgaben (z. B. Code-Entwicklung oder Forschung). Die Kostenunterschiede können entscheidend dafür sein, ob Unternehmen AI einsetzen. Google betont außerdem, dass die günstigen Tokens es den Modellen ermöglichen, länger zu überlegen und nicht aus Kostengründen auf einfache Lösungen zurückzugreifen.

2. Meta: Weniger Fehler bei der AI = mehr Geld gespart

Muse Spark1.3 hat seine Leistung von 55 % auf 75,4 % verbessert – doch noch wichtiger sind zwei weitere Faktoren: Die Anzahl der aufruften Tools wurde um 20 % reduziert und der Verbrauch an Tokens um 25 %.

  • Kosteneinsparung: Die größten Kosten entstehen, wenn AI-Systeme falsche Entscheidungen treffen (z. B. durch falsche Interpretationen von Anforderungen). Muse kann nun früher Unklarheiten erkennen, um Hilfe bitten und die anfänglichen Bedingungen berücksichtigen, wodurch unnötige Arbeitsprozesse vermieden werden.
  • Wirkung: In der Ära der Chatbots ist eine bessere Leistung zwar attraktiv, aber in der Ära der AI-Agenten führt weniger Fehlern direkt zu mehr Kostenersparnissen.

3. Mostik: Keine Kommunikation mehr zwischen Modellen – direkte Datenübertragung spart 20-mal mehr Kosten

Mostik hat eine „gegenintuitive“ Lösung entwickelt: Zwei AI-Modelle kommunizieren nicht mehr miteinander über natürliche Sprache, sondern über „mathematische Signale“.

  • Vergleich: Statt dass Modelle Daten über Text kommunizieren, übertragen sie diese direkt.
  • Experimente: Das Modell Mostik verbindet ein großes Modell (GLM-5.2 mit 753 Milliarden Parametern) mit einem kleinen Modell (Qwen3.5 mit 4 Milliarden Parametern); die Leistung liegt zwischen beiden, doch die Kosten betragen nur ein Zwanzigstel der des großen Modells.
  • Herausforderung: Die unterschiedlichen internen Strukturen und Parameter der Modelle erschweren die Kommunikation – doch die Kosteneinsparung von 20-mal ist bereits sehr beeindruckend.

4. Zukunft: Nur noch kleine Modelle im Handy, komplexe Aufgaben im Cloud – weitere Kostensenkungen

Früher versuchte man, große Modelle in Handys unterzubringen (z. B. von 7 Milliarden auf 4 Milliarden oder 1 Milliarde Parameter). Mit Mostiks Ansatz könnten in Zukunft nur noch sehr kleine Modelle im Handy genügen:

  • Aufteilung der Arbeit: Lokale Modelle übernehmen einfache, häufige Aufgaben; bei komplexen Problemen werden die Daten an Cloud-Modelle übertragen, die die Aufgaben verarbeiten und die Ergebnisse zurücksenden.
  • Auswirkungen: Diese Architektur würde die Art und Weise der AI-Berechnung grundlegend verändern. Die Kostensenkungen könnten nicht nur um 30 %, sondern um ein Vielfaches betragen – was bedeutet, dass Aufgaben, die heute noch teuer sind, in Zukunft nur noch wenige Cent kosten könnten.

Fazit: Erst wenn die Kosten der AI so niedrig sind, dass sie „beliebig“ genutzt werden können, wird es zu einem wahren Durchbruch kommen.

Alle drei Entwicklungen zeigen, dass sich die Kosten der AI nicht linear senken, sondern die Kostenstruktur grundlegend verändert. Wenn die Kosten so niedrig sind, dass AI-Agenten problemlos Aufgaben erledigen können und ihre Nutzung nicht teuer ist, werden viele der derzeit noch unvorstellbaren Anwendungen alltäglich werden. Wichtiger als die Frage, welches Modell die beste Leistung erbringt, ist die Frage, wie weit die Kosten der AI tatsächlich gesenkt werden können.