虎嗅

**Ein Skill macht DeepSeek V4 Pro besser als Fable5? Der beliebte Plugin wird kritisiert.** *(„Does a specific feature make DeepSeek V4 Pro superior to Fable5? The popular plugin is being criticized.“)*

原文:一个Skill让DeepSeek V4 Pro超越Fable5?热门插件被锤了

Zusammenfassung der Kerninhalte

Kürzlich spielte sich im AI-Bereich eine Farce ab, die von ausgelassenem Feiern über die Aufdeckung einer Fälschung reichte: Das Team J-Space behauptete, ein Skill-Plugin veröffentlicht zu haben, das ohne Änderung der Modellgewichte die Leistung von DeepSeek V4 Pro erheblich verbessern könnte – sogar über den Top-Modelle Fable 5 hinaus. Nach erneuten Tests durch Community-Entwickler stellte sich jedoch heraus, dass nicht nur keine Verbesserungen eingetreten waren, sondern auch mehr Ressourcen benötigt wurden. Der Autor weigerte sich, die Testdetails offenzulegen und löschte sogar die kritischen Beiträge. Letztendlich wurde diese „wunderbare“ Leistungssteigerung als Datenfälschung entlarvt. Die Täuschungskraft lag darin, dass das Plugin genau den wahren Schwachpunkt von DeepSeek V4 Pro ausnutzte – seine Empfindlichkeit gegenüber der externen Umgebung – was viele Menschen glauben ließ.

1. J-Spaces „wunderbares Skill“: Eine große Versprechung, die nicht eingehalten wurde

Das von J-Space veröffentlichte Cognition Suite V3.6 ist im Grunde ein „System zur Steuerung des Modellbetriebs“ – es ändert das Modell selbst nicht, sondern fügt während der Ausführung eine Schicht „Verwaltungslogik“ hinzu. Laut J-Space begehen AI-Assistenten häufig vier Fehler:

  • Informationsoverlastung: Zu viele Ziele und Werkzeuge werden in eine Aufgabe aufgenommen, wodurch wichtige Informationen verloren gehen;
  • Fehlende Gedächtnisleistung: Nach mehreren Überlegungsrunden ändert sich die Bedeutung derselben Namen/Zahlen;
  • Zufällige Wiederholungen: Bei Fehlschlägen bei der Werkzeuganwendung werden die Versuche ohne Analyse der Ursachen wiederholt;
  • Vorzeitiges Abgeben der Lösung: Die Antwort wird abgegeben, bevor überprüft wurde, ob sie korrekt ist.

Ihr Ansatz besteht darin, den Ablauf in einen Zyklus von „kurzer Entscheidung → Ausführung → gründlicher Überlegung → Überprüfung → erneuter Versuch mit Diagnosedaten“ umzuwandeln und wichtige Informationen in einem „externen Protokoll“ zu speichern, um das Vergessen zu vermeiden. Die angegebenen Leistungsverbesserungen (Terminal Bench von 87,9 auf 90,1; NL2Repo von 61,5 auf 73,4) sowie die Behauptung, dass DeepSeek V4 Pro Fable 5 und Opus 4.8 übertroffen habe, sorgten für große Aufmerksamkeit.

2. Die Enttäuschung in der Community: Erneute Tests zeigen keine Verbesserungen – im Gegenteil, mehr Ressourcen werden verbraucht

Bald meldeten sich Personen, die die Fälschung aufdeckten:

  • Test von Entwickler A: Bei zwei A/B-Tests mit V4 Flash gab es keinen Unterschied in der Vollendungsrate; das J-Space-Team verbrauchte jedoch mehr Ressourcen. In einer dritten Parteiliste erzielte die Kontrollgruppe 8,3 Punkte, während das J-Space-Team nur 7,87 Punkte erreichte.
  • Bestätigung durch Entwickler B: Bei der Bearbeitung von 89 Aufgaben mit 8 NVIDIA H20-Kernen wurden nur 69 richtig gelöst (77,5 %); im Bericht wurde jedoch eine Leistung von 87,1 % angegeben – ein Unterschied von fast 10 %. Auch nach drei Wiederholversuchen ohne Verbesserung.
  • Löschung kritischer Beiträge: Kritische Beiträge wurden vom Autor gelöscht; die Nutzer mussten sie erneut veröffentlichen. Der Autor weigerte sich weiterhin, den Testumgebung, den Ablauf und die Ergebnisse offenzulegen, was die Situation nur noch verschlimmerte.

3. Wo liegt die Täuschung? J-Space traf genau auf DeepSeek V4 Pros Schwachstellen

J-Space konnte die Menschen täuschen, weil es einen echten Problembereich ansprach: DeepSeek V4 Pro ist besonders empfindlich gegenüber der externen Umgebung. Beispiele:

  • Bei der Testung von 3D-Spielen mit ähnlichen Anweisungen waren die Ergebnisse morgens ungenau, aber nach 4 Stunden war das Projekt vollständig erstellt;
  • Derselbe Modell erzielte in verschiedenen Harness-Modi (Standard/PTC/Minimal) unterschiedliche Punktzahlen um 8 Punkte.

Da viele ohnehin annahmen, dass eine Anpassung der Umgebung die Leistung verbessern könnte, wirkte J-Spaces Behauptung, DeepSeek V4 Pro sei „besser als Fable 5“, plausibel.

4. Die Lektion aus der AI-Community: Ohne Nachvollziehbarkeit ist eine Leistungssteigerung nichts wert

Diese Farce lehrte die AI-Community eine wichtige Lektion: Jede „Leistungsverbesserung“ muss von anderen nachgeprüft werden können, um glaubwürdig zu sein. Genau wie die Geschäftsergebnisse von Unternehmen in der Finanzwelt müssen auch die Ergebnisse im AI-Bereich durch Audits überprüft werden – mit offengelegten Details (Testumgebung, Ablauf, Beispiele). Selbst wenn J-Spaces Ergebnisse beeindruckend sind, sind sie ohne Nachvollziehbarkeit nichts weiter als Luftschlösser. Nächstes Mal, wenn Sie übertriebene AI-Ergebnisse sehen, fragen Sie zuerst: „Kann das Ergebnis nachgeprüft werden? Gibt es öffentliche Beweise?“

5. Die technische Herangehensweise an sich: Das Problem ist real – aber der Ansatz möglicherweise wirkungslos

Es sei erwähnt, dass die von J-Space identifizierten Probleme der AI-Assistenten tatsächlich existieren (z. B. Informationsoverlastung, Gedächtnisfehler). Viele Teams arbeiten bereits an Lösungen dafür: Zum Beispiel wählt das Routing Suite den richtigen Überlegungsmodus je nach Aufgabe aus, und Anchored Standard stabilisiert die Modellentwicklung mit kurzen Anweisungen. J-Spaces Ansatz war jedoch entweder wirkungslos oder basierte auf Datenfälschung – letztendlich diente es als negatives Beispiel.

Insgesamt benötigt die Innovation im AI-Bereich echte technische Durchbrüche, anstatt auf Fälschungen und dem Ausnutzen von Schwachstellen zu setzen. Diese Aufdeckung hat auch dazu beigetragen, dass die Menschen vorsichtiger gegenüber übertriebenen Ergebnissen sind und „Nachvollziehbarkeit“ zum Maßstab für den Fortschritt im AI-Bereich machen.