虎嗅

**Titel:** Antropisches „Hacking-Tool“ sorgt für Aufsehen: DeepSeek V4-Pro dominiert Fable5 – doch niemand kann das Ergebnis wiederholen; außerdem verdoppelt sich der Token-Kostenverbrauch.

原文:撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压Fable5”但无人能复现,Token开销反而翻倍

Zusammenfassung der Kerninhalte

Ein kürzlich erschienenes Community-Projekt mit dem Namen J-Space Cognition Suite hat für Aufsehen gesorgt. Es behauptet, dass die Leistung eines DeepSeek V4-Pro-Modells ohne Änderungen am Modell selbst erheblich verbessert werden kann, indem einfach ein Hilfswerkzeug (Harness) darüber angelegt wird – sogar bis über die Leistung von Fable 5 hinaus. Allerdings gibt es drei Hauptkontroversen zu dieser Behauptung:

1. Es gibt keine Ergebnisse, die von Dritten reproduziert wurden (alle Daten wurden vom Projekt selbst ermittelt).

2. Der Name „J-Space“ verursacht Verwechslungen mit Anthropic, obwohl die Technologien völlig unterschiedlich sind.

3. Die Tokenverbrauch ist bei der tatsächlichen Nutzung verdoppelt, was zu höheren Kosten führt.

Dieses Beispiel spiegelt die aktuellen Entwicklungsrichtungen von Hilfswerkzeugen für AI-Modelle wider: Sie zielen darauf ab, Schwachstellen in den Modellen auszugleichen und es gibt eine Trennung in zwei Hauptstrategien:

  • Allgemeine Lösungen (z. B. OpenCode), die für alle Modelle geeignet sein sollen, aber oft zu komplex sind und Probleme mit der Berechtigungsverwaltung aufweisen.
  • Speziell angepasste Lösungen (z. B. DeepSeek’s DSH oder OpenAI’s Agents SDK), die besser auf die Eigenschaften des jeweiligen Modells abgestimmt sind, aber nur für dieses Modell nutzbar sind.

1. Das Projekt wird übertrieben beworben – doch niemand kann die Ergebnisse reproduzieren

Laut dem Projekt stiegen die Testergebnisse von DeepSeek V4-Pro nach der Installation des Harness deutlich (z. B. NL2Repo von 61,5 auf 73,4, Terminal-Bench 2.1 von 87,9 auf 90,1). Allerdings wurden diese Daten ausschließlich vom Projekt selbst ermittelt, und bislang konnte kein anderes Team unter denselben Bedingungen (Modellversion, Testumgebung, Parameter) ähnliche Ergebnisse erzielen.

Warum ist die Replikation so wichtig? Weil es möglich ist, dass bei den eigenen Tests Manipulationen vorgenommen wurden – beispielsweise durch heimliche Anpassungen der Testbedingungen oder zufällige Ergebnisse. Ohne externe Überprüfung können diese Verbesserungen nicht als glaubwürdig angesehen werden. Einige Entwickler versuchten, die Ergebnisse zu reproduzieren, konnten sie jedoch nicht bestätigen; im Gegenteil: Die Leistung verschlechterte sich sogar.

2. Vorsicht mit der Identifizierung! J-Space hat nichts mit Anthropic zu tun

Viele Menschen verbinden „J-Space“ mit Anthropic (dem Unternehmen, das den Claude-Modelle entwickelt), aber es handelt sich um zwei völlig unterschiedliche Projekte:

  • Anthropics J-Space untersucht die inneren Mechanismen des eigenen Claude-Modells (z. B. die Übertragung von Informationen oder die Speicherung von Erinnerungen).
  • Das Community-Projekt J-Space ist ein Hilfswerkzeug, das die Ausführung von Aufgaben im Modell steuert (z. B. wann eine Wiederholung erforderlich ist, wie der Fortschritt erfasst wird oder ob eine Aufgabe abgeschlossen wurde).

Die Ähnlichkeit der Namen ist rein zufällig – oder vielleicht ein Versuch, die Aufmerksamkeit auf sich zu ziehen. Viele Nutzer glaubten, dass J-Space von Anthropic entwickelt wurde, stellten jedoch später fest, dass dies nicht der Fall ist.

3. Mehr Kosten durch den Einsatz des Harness? Der Tokenverbrauch verdoppelt sich

Tokens sind die „Kosten Einheiten“ für AI-Modelle; je mehr Tokens benötigt werden, desto höher sind die Kosten. Einige Entwickler stellten fest, dass der Tokenverbrauch nach der Installation des J-Space um das 2- bis 4-fache anstieg – beispielsweise waren die Kosten für die Testung der V4 Flash-Version um 50 % bis 300 % höher. Zudem verbesserte sich die Leistung nicht, in manchen Fällen sogar verschlechterte sie sich.

Dies zeigt, dass selbst wenn die von dem Projekt angegebenen Verbesserungen tatsächlich vorhanden sind, die erhöhten Kosten das Tool unrentabel machen können – schließlich ist der Kostenfaktor für Unternehmen bei der Nutzung von AI-Technologien entscheidend.

4.Harness versucht, Schwachstellen in AI-Modellen auszugleichen

Das Projekt versucht, Probleme zu beheben, die alle AI-Modelle beim Ausführen langer Aufgaben haben:

  • Repräsentationsverluste (das Modell vergisst seine Zielsetzung während der Ausführung).
  • Früheres Abbrechen von Aufgaben (die Aufgabe wird vorzeitig als abgeschlossen erklärt).

Aktuelle Hilfswerkzeuge versuchen, diese Probleme zu beheben – beispielsweise indem sie den Fortschritt der Aufgaben überwachen oder die Verarbeitung von Daten optimieren. Es gibt jedoch noch keine perfekte Lösung.

5. Zwei Entwicklungspfade für Harness: Allgemeine oder maßgeschneiderte Lösungen?

Es gibt zwei Hauptentwicklungsrichtungen für Hilfswerkzeuge:

  • Allgemeine Lösungen (z. B. OpenCode), die für alle Modelle geeignet sein sollen, aber oft zu komplex sind.
  • Speziell angepasste Lösungen, die auf die Eigenschaften des jeweiligen Modells abgestimmt sind und in der Regel stabiler sind, jedoch nur für dieses Modell nutzbar sind.

Beide Ansätze haben ihre Vor- und Nachteile; es gibt bisher keine „optimale“ Lösung. Allgemeine Lösungen sind flexibel, aber potenziell anfälliger für Fehler, während speziell angepasste Lösungen stabiler sind – allerdings weniger universell einsetzbar.

Fazit

Das J-Space-Projekt scheint eher ein Marketingversuch zu sein, der zwar einige Ansätze zur Verbesserung langer Aufgaben bietet, aber an Überprüfungen mangelt und die Kosten höher sind als versprochen. Es zeigt auch, dass die Leistung von AI-Modellen nicht nur vom Modell selbst abhängt, sondern auch von externen Hilfswerkzeugen wie dem Harness. In Zukunft wird es darauf hinausgehen, ein Gleichgewicht zwischen Leistungssteigerung und Kosteneinsparung zu finden sowie weiterhin zwischen allgemeinen und speziell angepassten Lösungen zu forschen. Für Nutzer und Unternehmen ist es wichtig, Werbematerialien kritisch zu bewerten – sie sollten nicht einfach auf Behauptungen wie „erhebliche Leistungserhöhungen ohne Modelländerungen“ hereinfallen, sondern erst nachweisen suchen und die Kosten überprüfen.