虎嗅

**Anthropicと同名の「チートツール」が話題に!「DeepSeek V4-Pro」が「Fable5」を圧倒するが、再現できる人はいない…しかもトークンの消費量が倍増してしまう**

原文:撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压Fable5”但无人能复现,Token开销反而翻倍

核心内容の要約

最近、「J-Space Cognition Suite」というコミュニティプロジェクトが注目を集めています。このプロジェクトは、DeepSeek V4-Proモデル自体を変更することなく、外部に補助ツール(Harness)を組み込むだけでモデルの性能を大幅に向上させることができ、Fable 5を超える可能性もあると主張しています。しかし、現在この主張には3つの大きな疑問点があります:

1. 第三者による再現結果がない(データはすべてプロジェクト側で測定されたもの)

2. Anthropicの「J-space」との名称の類似による誤解(両者の技術は全く異なる)

3. 実際の使用時にTokenの消費量が倍増する(コストが高くなる)

この事例は、AIモデル用の補助ツール(Harness)の現在の発展傾向を浮き彫りにしています。つまり、モデルの弱点を補うことや、アプローチの分化(汎用的なもの vs ネイティブなもの)が進んでいるのです。

1. プロジェクトの宣伝は華々しいが、誰も再現できない

このプロジェクトによると、Harnessを使用するとDeepSeek V4-Proのスコアがいくつかのテストで明らかに向上したとされています(例:NL2Repoは61.5から73.4へ、Terminal-Bench 2.1は87.9から90.1へ)。しかし、これらのデータはすべてプロジェクト側で測定されたものであり、他のチームが同じ条件(モデルバージョン、テスト環境、パラメータ)で同様の結果を出した例はまだありません。

なぜ再現が重要なのかというと、自分たちで測定したデータには不正行為(テスト条件の隠れた調整やデータの偶然性)が含まれている可能性があるからです。第三者による検証がなければ、これらの結果は信頼できません。実際に再現を試みた開発者もいましたが、性能が向上するどころか悪化したケースもあります。

2. 間違えないでください!このJ-SpaceはAnthropicとは関係ありません

「J-Space」という名前を見て多くの人がAnthropic(Claudeモデルを開発している大企業)と関連付けがちですが、実際には全く異なります:

  • AnthropicのJ-space:自社のClaudeモデルの内部メカニズム(情報の伝達方法や記憶の保存方法など)を研究しており、「モデル内部の仕組み」に関するものです。
  • コミュニティプロジェクトのJ-Space:DeepSeekモデルに外部から適用される補助ツールであり、タスクの実行プロセス(再試行のタイミングや進捗の記録方法、タスク完了の判断など)を管理するものです。

名称が似ているのは単なる偶然(または意図的な話題作りかもしれませんが、多くの人を誤解させています。Anthropicの技術によるサポートだと思って使用したら、実際はそうではないことがわかります。

3. 使用すると逆にコストが増える?Token消費量が倍増

TokenはAIモデルの「コスト単位」であり、タスクを処理するために使用されるTokenの量が多ければ多いほどコストも高くなります。開発者のテストでは、J-Spaceを使用するとToken消費量が元の2〜4倍に増加することがわかりました(例:V4 Flashバージョンのテストでは、コストが50%から3倍に増加)。性能が向上するどころか、一部のタスクでは使用しない場合よりも悪化するケースもあります。

これは、プロジェクト側が主張する性能向上が本当であっても、コストの増加により実用的ではなくなる可能性があることを意味しています。企業がAIを使用する場合、コストは重要な考慮事項です。

4. Harnessはタスクの「欠陥」を補っている

このプロジェクトが解決しようとしている問題は、すべてのAIモデルが長期間のタスクを処理する際に共通して直面する問題です:

  • 表現の不安定性:作業を進めるうちに目的を忘れたり、関係ない内容に逸脱したりすること
  • 早期終了:タスクが完了していないにもかかわらず終了を宣言すること

現在のHarnessはこれらの問題を補うためのものです。例えば、DeepSeekの公式Harnessでは「タスク進捗ボード」が更新され(外部状態を保存してモデルの逸脱を防ぐ)、ある研究では「コンテキストの圧縮」によりメモリ使用量を減らそうとしていますが、情報の損失が生じることもあります。また、「タスク完了の判断」をモデル自身から外部ツールに移行する試みもなされています。これらの方法は性能とコストのバランスを取ろうとしていますが、まだ完璧な解決策は見つかっていません。

5. Harnessの2つの方向性:汎用的なものか、カスタムメイドなものか?

Harnessの発展には2つの方向性があります:

  • 汎用型(OpenCodeなど):すべてのモデルに適応させることを目指し、タスクを複数のサブエージェントに分割して処理します(計画や実行を担当するエージェントなど)。しかし、権限管理が複雑になります(サブエージェントが制限を無視してファイルを変更する可能性がある)。
  • ネイティブ型(DeepSeekのDSHやOpenAIのAgents SDKなど):モデル製造元が自社のモデルに合わせて開発したもので、安定性は高いですが、自社のモデルでのみ使用可能です。

これら2つのアプローチにはそれぞれ長所と短所があり、現在「最適な解」はまだ存在しません。汎用型は柔軟ですが問題が発生しやすく、ネイティブ型は安定していますが汎用性に欠けます。

まとめ

このJ-Spaceプロジェクトはある意味「マーケティングの試み」のようなものであり、長期間のタスクを処理する際の問題解決策を提案していますが、検証が不足しておりコストも高いです。この事例からわかるのは、AIモデルの性能向上はモデル自体だけでなく、外部の補助ツール(Harness)にも依存するということです。将来のHarnessの発展は、「性能向上」と「コスト削減」のバランスを取りながら、汎用性とネイティブ性の両方を追求していくでしょう。一般ユーザーや企業にとっては、「モデルを変更せずに大幅に性能が向上する」という宣伝を簡単に信じるべきではなく、第三者による検証やコストの妥当性を確認することが重要です。