虎嗅

**「あるスキル」によりDeepSeek V4 ProがFable5を超えるか?人気プラグインが批判される**

原文:一个Skill让DeepSeek V4 Pro超越Fable5?热门插件被锤了

核心内容の要約

最近、AI業界では「狂乱から偽造の暴露」へと続く騒動が起こりました。J-SpaceチームはSkillプラグインを発表し、モデルの重みを変更することなくDeepSeek V4 Proの性能を大幅に向上させることができ、トップクラスのモデルFable 5をも上回ると主張しました。しかし、コミュニティの開発者が再検証した結果、性能は向上せず、かえってリソースの消費が増加するだけでした。著者は評価の詳細を公開することを拒否し、疑問を投げかける投稿も削除しました。最終的に、この「驚異的な性能向上」はデータ偽造の詐欺であることが暴露されました。その騙しの巧妙さは、DeepSeek V4 Proが外部環境に非常に敏感であるという実際の問題点を正確に突いており、多くの人々がその効果を信じ込んでしまったことにあります。

1. J-Spaceの「驚異的なSkill」:Fable5を超えると大々的に宣伝

J-Spaceが発表したCognition Suite V3.6は、実際には「モデル実行時の制御システム」であり、モデル自体を変更することなく、AIがタスクを実行する際に「管理ロジック」を追加するものです。彼らはAIアシスタントがよく犯す4つの間違いを指摘しています:

  • 情報過多:タスクに多くの目標やツールが含まれており、重要な内容が見えなくなる。
  • 記憶のずれ:複数回の推論の後で、同じ名前や数値の意味が変わってしまう。
  • 無駄な再試行:ツールの呼び出しが失敗しても原因を分析せずに繰り返し操作する。
  • 早すぎる終了:回答が流暢に見えればすぐに終了し、結果の正誤を確認しない。

彼らのシステムは実行プロセスを「短い判断→実行→深い思考→検証→診断情報を含めた再試行」というサイクルに変え、重要な情報を「外部の記録帳」に保存して忘れないようにしています。そして、驚異的な結果を公表しました:Terminal Benchは87.9から90.1へ、NL2Repoは61.5から73.4へと向上し、Fable5やOpus4.8を超えたとされ、瞬く間に話題になりました。

2. コミュニティでの反発:再検証の結果が事実を覆す

すぐに偽造を暴露する人々が現れました:

  • 開発者Aのテスト:V4 Flashを使用してA/Bテストを2回行ったところ、完成度に差はなかったが、J-Spaceチームの方がより多くのリソースを消費した。第三者による盲検評価では、対照群が8.3点であるのに対し、J-Spaceチームは7.87点だけだった。
  • 開発者Bの実証:NVIDIA H20を使用して89問をテストしたところ、正解は69問(77.5%)だったが、報告書では87.1%とされており、約10%の差があった。失敗したタスクを3回再試行しても改善しなかった。
  • 投稿の削除:疑問を投げかけるユーザーの投稿が著者によって削除され、バックアップから再投稿するしかなかった。著者は評価環境や手順、サンプルデータを公開することを拒否し、事実を隠そうとした。

3. 騙しの巧妙さ:DeepSeek V4 Proの弱点を突いている

J-Spaceが人々を騙すことができたのは、DeepSeek V4 Proが外部環境に非常に敏感であるという実際の問題点を利用したからです。例えば:

  • 似たようなヒントを使用して3Dゲームをテストすると、夜中には結果が粗雑だったが、4時間後には完全なプロジェクトが生成された。
  • 同じモデルでもHarnessモード(Standard/PTC/Minimal)によってスコアに8点の差が出た。

人々はもともと「実行環境を調整することで性能が向上する」と考えていたため、J-Spaceの主張は納得しやすかったのです。

4. AI業界の「偽造防止の教訓」:再現できない性能向上はただの詐欺

この騒動はAI業界に重要な教訓を与えました。「性能向上」があると主張されても、他者によって再現できなければ信じられません。金融業界で企業の業績が監査されるように、AIの成果も評価環境や手順、サンプルデータを公開して検証する必要があります。J-Spaceの結果がいかに驚異的であっても、再現がなければそれは根拠のないものです。次に大げさなAIの成果を見たときは、「再現可能か?公開された証拠はあるか?」と疑うべきです。

5. 技術的な側面:問題自体は真実だが、解決策には疑問が残る

J-Spaceが指摘したAIアシスタントの問題(情報過多や記憶のずれ)は確かに存在します。多くのチームもこれらの問題を解決しようとしています。例えば、Routing Suiteはタスクに応じて推論モードを選択し、Anchored Standardは簡潔なヒントでモデルの動作を安定させるなどです。しかし、J-Spaceの解決策は効果が不十分だったり、データ偽造によるものだったりしており、反面教師となりました。

要するに、AI業界の革新には真実の技術的突破が必要であり、偽造や問題点を利用したトラフィック集めでは不十分です。この偽造事件を通じて、私たちは大げさな成果に対して警戒し、「再現可能性」をAIの進歩を評価する基準とすることの重要性を改めて認識すべきです。