虎嗅

Gemini3.8 Flash – plötzlicher Angriff in der Tiefen Nacht, am Mittwochmorgen: Was hat Google eigentlich so eilig?

原文:Gemini3.8 Flash深夜突袭,六周三更,谷歌到底在急什么?

Zusammenfassung der Kerninhalte

In nur sechs Wochen hat Google drei neue Modelle der Gemini Flash-Serie veröffentlicht. Das neueste Modell, 3.8 Flash, bleibt weiterhin „preisgünstig“ – bei einer Eingabekosten von 0,75 US-Dollar pro Million Token und einer Ausgabekosten von 3,75 US-Dollar. Die Leistungswerte sind beeindruckend: In der Programmierung erreicht es das Niveau von Claude Opus 5 und übertrifft GPT-5.6 Sol in der Inferenzleistung. Zudem wurde eine spezielle Cyber-Version für die Cybersicherheit entwickelt. In der Praxis stellen jedoch normale Nutzer fest, dass das Modell zwar gute Leistungswerte aufweist, in der praktischen Anwendung jedoch Schwächen zeigt. Offizielle Demonstrationen setzen spezielle Konfigurationen voraus, das Modell verfügt über mangelnde Ausdauer bei langen Aufgaben und die Verarbeitung von Details ist ungenau. Der Grund dafür liegt darin, dass Googles Flaggschiff-Modell Gemini Pro mit Schwierigkeiten zu entwickeln ist und es zu einem Braindrain von Kerntechnologieexperten gekommen ist. Daher muss Google auf kleinere Modelle wie 3.8 Flash setzen, um seine Marktpresenz zu wahren.

1. Das preisgünstige „Leistungstalent“: Leistung nahe am Flaggschiff-Niveau

3.8 Flash wird von Google als „das intelligenteste Flash-Modell“ bezeichnet und hat insbesondere die Programmierung über längere Zeiträume, komplexe Inferenzprozesse sowie professionelle Agenten-Szenarien verstärkt. Der Preis bleibt jedoch derselbe wie beim Vorgängermodell 3.7 Flash.

  • Nahe an der Spitze in der Programmierung: Im DeepSWE-Test für die Programmierung über längere Zeiträume erreichte es 73,7 % – das gleiche Niveau wie Claude Opus 5 (74 %) – bei einem Kostenfaktor von nur 1/5 (2,36 US-Dollar pro Aufgabe gegenüber 11,84 US-Dollar). Im Terminal-Bench 2.1-Test erzielte es 89,4 %, was es erstmals in die Nähe der 90%-Marke brachte.
  • In der interdisziplinären Inferenz in die erste Liga: Im „Human Ultimate Exam“ (HLE), das STEM- und Geisteswissenschaften umfasst, erreichte es 54,9 %, etwas mehr als Opus 5 (54,4 %) und GPT-5.6 Sol (54,5 %).
  • In professionellen Szenarien übertrifft es das Flaggschiff: Im Finanzagententest (Vals V2) erzielte es 61,4 %, mehr als GPT-5.6 Sol (53,8 %); im Rechtagententest (Harvey) lag die Erfolgsrate bei 10 %, das ist das 1,5-fache von Opus 5.
  • Die Cyber-Version spezialisiert auf Sicherheit: Die Fehlererkennungsrate beträgt 86,2 % (übertrifft GPT-5.5-Cyber); die Kosten für die Behebung von Fehlern sind niedriger. Das von der Chrome-Entwicklungsmannschaft mit diesem Modell erstellte korrekte Patch ist 2,6-mal effizienter als bei anderen Modellen – allerdings steht dieser Patch nur „vertrauenswürdigen Verteidigern“ zur Verfügung.

Das Geheimnis hinter diesen Leistungen liegt darin, dass 3.8 Flash bei schwierigen Aufgaben mehr Überlegungen anstellt: Beispielsweise erzeugt es bei Programmieraufgaben 36.000 mehr Tokens und führt 41 zusätzliche Schritte aus. Obwohl die tatsächlichen Kosten für komplexe Aufgaben leicht steigen (von 0,4 US-Dollar auf 0,58 US-Dollar), bleiben sie insgesamt deutlich niedriger als bei den Flaggschiff-Modellen.

2. Praktische Tests zeigen Schwächen: Gute Leistungswerte, aber unzureichende Anwendbarkeit

In offiziellen Demonstrationen kann 3.8 Flash beispielsweise 3D-Burgen erstellen oder eine DOS-Version von Google Maps nutzen. Für normale Nutzer besteht jedoch ein großer Unterschied zur tatsächlichen Leistung:

  • Zweierlei Maßstäbe bei der Konfiguration: Offizielle Demonstrationen verwenden die Antigravity-Plattform sowie Nano Banana zur Texturerzeugung; normale Nutzer verfügen nur über das Basismodell. Beim Erstellen eines Airbus-Helikopters mit Three.js dauert die Ausführung 109 Sekunden, doch die Bauteile sind grob und die Bewegungen unbeholfen; bei der Simulation eines 3D-Vulkans gibt es „Lecks“.
  • Schnell, aber von schlechter Qualität: Beim Spielen von Sticky Ball ist die Ausführung schnell, doch die Bewegungsmechanik und die Steuerung sind nicht so gut wie bei Kimi K3. Bei der Simulation des New Yorker Stadtmarktes wurden nur 6 Bäume verwendet (weniger als die 10 in 3.7 Flash); es fehlen Fußgängerüberwege und Unterwasserkonzepte, außerdem wurden willkürlich Kameraeinstellungen und Nachbearbeitungsoptionen hinzugefügt.
  • Mangelnde Ausdauer bei langen Aufgaben: Im Terminal-Bench 4.0 (einem schwierigeren Terminaltest) erzielte es nur 19,1 % (Opus 5 erreichte 51,8 %); beim OSWorld-Computertest lag die Punktzahl bei 59 % (Opus 5: 75,4 %). In der Gesamtleistungsrangliste belegt es den achten Platz – in bestimmten Bereichen ist es stark, doch bei interdisziplinären Aufgaben zeigen sich Schwächen.

3. Die Notwendigkeit hinter den schnellen Updates: Schwierigkeiten bei der Entwicklung des Flaggschiffs und Braindrain

Googles Drang, 3.8 Flash so schnell wie möglich zu veröffentlichen, liegt nicht an technischen Durchbrüchen, sondern an Druckfaktoren:

  • Das Flaggschiff-Modell verzögert sich immer wieder: Im Mai dieses Jahres sagte Pichai, dass die neue Version von Gemini Pro in einem Monat verfügbar sein würde; tatsächlich wurde das 3.5 Pro-Projekt jedoch abgebrochen (die Verbesserungen reichten nicht an 3.8 Flash heran), und Gemini 4 befindet sich noch in der frühen Trainingsphase.
  • Braindrain von Kernmitarbeitern: In den letzten anderthalb Monaten haben Noam Shazeer (Pionier der Großmodelle) und Jeff Dean (eine Schlüsselpersönlichkeit im Bereich KI bei Google) unter anderem das Unternehmen verlassen, was zu organisatorischen Unstabilitäten führte. Die neue Führung fordert eine Beschleunigung der Veröffentlichung.
  • 3.8 Flash als „Notlösung: Da die 3.8 Flash-Modelle kleiner sind, erfordern sie weniger Rechenleistung für Modifikationen und Trainings – mehrere interne Teams können gleichzeitig verschiedene Ansätze testen und alle drei Wochen eine Iteration durchführen. Bei der Entwicklung von Gemini Pro wären jedoch mehr GPUs und mehr Zeit erforderlich, was die Fehlerkorrekturkosten erhöhen würde.

Daher sind die drei Updates innerhalb von sechs Wochen eher ein Versuch, mit kleinen Schritten die Marktpresenz zu wahren, während das Flaggschiff-Modell weiterhin in Entwicklung ist – um nicht von Konkurrenten wie OpenAI oder Anthropic überholt zu werden.

4. Die tatsächliche Rolle von 3.8 Flash: Nicht das Endziel, aber eine notwendige Lösung

3.8 Flash ist zwar nicht Googles endgültiges Ziel, aber derzeit die praktischste Option:

  • Es ist kein allround-fähiges Flaggschiff: Praktische Tests zeigen, dass es noch hinter einem echten Flaggschiff zurückliegt (Schwächen bei langen Aufgaben und in der Detailverarbeitung).
  • Es reicht jedoch aus, um Notfälle zu bewältigen: Es ist günstig, lässt sich schnell aktualisieren und kann in bestimmten Bereichen (Programmierung, Finanzagenten) mit dem Flaggschiff mithalten, wodurch Google seinen Marktanteil und die Aufmerksamkeit der Entwickler bis zur Veröffentlichung von Gemini Pro und Gemini 4 behalten kann.

Kurz gesagt: 3.8 Flash ist Googles „Übergangslösung“ – um den Endgewinn zu erzielen, ist das Flaggschiff erforderlich, aber vorerst dient es dazu, den Anschluss in dem Wettbewerb der Großmodelle nicht zu verlieren.

Fazit

Googles Gemini Flash-Serie ist wie ein „Schüler mit hohem Preis-Leistungs-Verhältnis“: In bestimmten Bereichen (Programmierung, Finanzen) übertrifft es andere Modelle, ist jedoch insgesamt weniger leistungsfähig. Hinter den schnellen Updates steckt die Notwendigkeit, aufgrund von Entwicklungsproblemen und Braindrain die Marktpresenz zu wahren. Für Nutzer, die nur bestimmte Anwendungen benötigen (z. B. Codeerstellung, einfache Finanzanalysen), ist 3.8 Flash eine attraktive Wahl; für anspruchsvollere Aufgaben sollten sie jedoch auf die finale Flaggschiff-Version warten. Für die Branche zeigt dies die Intensität des Wettbewerbs um Großmodelle: Niemand darf innehalten – selbst wenn man nur „kleine Schritte machen muss, um sichtbar zu bleiben“.