Zusammenfassung des Kerninhalts
Dies ist ein Testbericht eines Technologie-Bloggers über die gerade in der Beta-Phase befindliche V4.1-Flash-Modelle von DeepSeek: Das neue Modell zeichnet sich durch eine komplett neue Architektur sowie native, multimodale Fähigkeiten aus. Die Entwickler haben sogar direkt in den Testfragen die Nutzer gefragt, ob es das zuvor hochwertigere V4 Pro ersetzen könnte. Der Blogger verglich das neue Modell mit der alten Version V4 Flash und führte 14 Aufgaben durch, wobei insgesamt die Äquivalent zu 300 Millionen chinesischen Zeichen an Modellaufrufen verbraucht wurden. Er stellte fest, dass die Fähigkeiten des neuen Modells bei der Bildverarbeitung und Visualisierung deutlich verbessert wurden. Allerdings weist es auch Schwächen auf – beispielsweise ist die Eingabegeschwindigkeit beim Tippen hoch, die Ausführungsgeschwindigkeit jedoch niedrig; bei langen Inhalten neigt das Modell dazu, Dinge durcheinanderzubringen, und komplexe Aufgaben sind besonders aufwendig. Es handelt sich also nicht um eine „perfekte“ Weiterentwicklung gegenüber der alten Version.
---
Verständliche Erklärung der einzelnen Aspekte
1. Die größte Verbesserung: Endlich „eigene Augen“ – keine externe Hilfsmittel mehr benötigt
Die alte Version V4 Flash war im Grunde nur auf reine Textverarbeitung ausgelegt. Wenn man ein Bild vorlegte, verstand das Modell es nicht und musste zunächst auf externe Tools zur Texterkennung und Bildanalyse zurückgreifen, was Minuten bis Stunden in Anspruch nahm – und oft führte dies zu Fehlern (z. B. wurden auf einem Plakat angegebene englische Wörter falsch interpretiert). Die neue Version V4.1 verfügt über native multimodale Fähigkeiten; sie kann ein Bild in nur 5–7 Sekunden analysieren und die Inhalte klar darstellen. Dadurch entfällt die Notwendigkeit, externe Hilfsmittel zu verwenden. Zudem kann das Modell sogar selbst beurteilen, ob ein erstelltes Bild „hässlich“ ist. Beispielsweise stellte das Modell früher Pelikane, die Fahrräder fuhren, als Schwäne mit Schüsseln dar; nun kann es selbst Fehler erkennen und die Darstellung korrigieren.
2. Dreimal schnellere Ausführung – warum ist das Endergebnis dann nicht viel schneller?
Die Eingabegeschwindigkeit von V4.1 liegt bei über 200 chinesischen Zeichen pro Sekunde – dreimal so hoch wie bei der alten Version. Zunächst wirkte dies sehr effizient, doch bei der genauen Auswertung stellte der Blogger fest, dass die Gesamtausführungszeit kaum schneller war. Bei der Erstellung kleiner Spiele produzierte das Modell sogar weniger sinnvolle Inhalte und benötigte insgesamt mehr Zeit. Der Grund: Das Modell nutzte die eingesparte Zeit, um die selbst erstellten Code-Teile mehrmals zu überprüfen und zu überarbeiten. Dies führt zu unnötigen Verzögerungen.
3. Starke Fähigkeiten, aber schwacher Gedächtnisvermögen
Die Stärken des neuen Modells liegen in der Umsetzung von Ideen in funktionierende Programme. Beispielsweise erstellte es eine visuelle Darstellung von Zwillingssonnenzahlen – die Zahlen waren zwar korrekt, die Darstellung jedoch uninteraktiv. Bei der Erstellung von 3D-Modellen zeigte das Modell hervorragende Ergebnisse. Die Schwächen liegen jedoch im schlechten Gedächtnisvermögen: Bei der Erstellung langer Texte verwechselte das Modell häufig Informationen. Bei der Erstellung von Aktionärsmarktberichten stimmten die angegebenen Zahlen nicht mit den dazugehörigen Diagrammen überein.
4. Mehr Kosten – warum? Weil das Model bei schwierigen Aufgaben zusätzliche Ressourcen benötigt
Bei komplexen Aufgaben aktivierte das neue Modell zusätzliche „Unter-AI“-Systeme, um die Arbeit aufzuteilen. Dies führte zu höheren Kosten (62 Euro gegenüber 45 Euro für die alte Version). Die zusätzlichen Kosten entstanden durch die Nutzung dieser zusätzlichen Systeme. Die Entwickler haben dies jedoch bereits angekündigt: Ab dem 10. September wird der Preis für häufig genutzte Funktionen um 60 % gesenkt, wodurch die Nutzungskosten sinken werden.