虎嗅

撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压Fable5”但无人能复现,Token开销反而翻倍

核心内容总结

最近一个叫J-Space Cognition Suite的社区项目火了,它声称不用修改DeepSeek V4-Pro模型本身,只需在模型外面套一层辅助工具(Harness),就能让模型性能大幅提升甚至超过Fable 5。但目前这个说法存在三大争议:没有第三方复现结果(数据都是项目自己测的)、和Anthropic的J-space撞名导致误解(两者技术完全不同)、实际使用时Token消耗翻倍(成本更高)。这件事也折射出AI模型辅助工具(Harness)当前的发展趋势:补长任务短板、路线分化(通用vs原生)。

1. 项目吹得神,但没人能重复出结果

这个项目说,套上它的Harness后,DeepSeek V4-Pro在几个测试中分数明显提升:比如NL2Repo从61.5涨到73.4,Terminal-Bench 2.1从87.9到90.1。但这些数据全是项目方自己测的,至今没有独立团队按相同条件(模型版本、测试环境、参数)跑出同样结果。

为什么复现这么重要?因为自己测可能藏着“猫腻”——比如悄悄调整了测试条件,或者数据有偶然性。没有第三方验证,这些提升只能算“自说自话”,不能当真。比如有开发者尝试复现,结果不仅没提升,反而更差了。

2. 别认错人!这个J-Space和Anthropic没关系

很多人看到“J-Space”就以为和Anthropic(做Claude模型的大厂)有关,但其实完全是两码事:

  • Anthropic的J-space:研究自家Claude模型内部的神经机制(比如信息怎么传递、记忆怎么保存),是“模型内部的学问”;
  • 社区项目J-Space:给DeepSeek模型套的外部辅助工具,管的是模型执行任务的流程(比如什么时候重试、怎么记录进度、怎么判断任务是否完成),是“模型外面的脚手架”。

名字相似纯属巧合(或故意蹭热度?),但误导了不少人——以为是Anthropic的技术加持,结果用了才发现不是。

3. 用了反而更费钱?Token消耗翻倍

Token是AI模型的“成本单位”,处理任务时用的Token越多,花的钱就越多。有开发者测试发现:

  • 用J-Space后,Token消耗是原来的2~4倍(比如测V4 Flash版本,成本比不用高50%到3倍);
  • 不仅没提升性能,有的任务甚至比不用时更差。

这意味着即使项目方说的提升是真的,成本增加也可能让它变得不划算——毕竟企业用AI,成本是关键考量。

4. Harness正在补长任务的“漏洞”

这个项目试图解决的问题,其实是所有AI模型做长任务时的通病:

  • 表征漂移:做着做着忘了目标(比如写代码时重复已完成的步骤,或者跑偏到无关内容);
  • 过早停止:任务没做完就宣布结束(比如代码还没调试好就说完成了)。

现在行业里的Harness都在补这些短板:比如DeepSeek官方Harness更新了“任务进度看板”(保存外部状态,防止模型跑偏);有的研究用“压缩上下文”来减少内存占用,但又会导致信息丢失;还有的把“任务是否完成”从模型自己判断改成外部工具验证。这些方法都在尝试平衡性能和成本,但还没找到完美方案。

5. Harness的两条路:通用还是量身定做?

目前Harness发展有两个方向:

  • 通用型(比如OpenCode):想适配所有模型,把任务拆分成多个子Agent分工(比如负责规划、负责执行),但权限管理复杂(比如子Agent可能绕过限制乱改文件);
  • 原生型(比如DeepSeek的DSH、OpenAI的Agents SDK):模型厂商自己做的,贴合自家模型特性(比如知道自家模型容易在哪步跑偏),稳定性更好,但只能用在自家模型上。

这两条路各有优劣,目前还没有“最优解”——通用型灵活但容易出问题,原生型稳定但不通用。

总结

这个J-Space项目更像是一次“营销尝试”,虽然提出了一些解决长任务问题的思路,但缺乏验证且成本更高。它也让我们看到:AI模型的性能提升,不仅靠模型本身,还靠外面的辅助工具(Harness)。未来Harness的发展,会在“提升性能”和“控制成本”之间找平衡,同时在通用和原生路线上继续探索。对普通用户或企业来说,别轻信“不用改模型就能大幅提升”的宣传,先看有没有第三方验证,再算成本是否划算。