虎嗅

**Античейший “хак”, похожий на Anthropic”: позволяет DeepSeek V4-Pro доминировать над Fable5, но никто не может воспроизвести его эффект; при этом затраты на токены удваиваются.** *(The oldest “hack” similar to Anthropic”: enables DeepSeek V4-Pro to dominate over Fable5, but no one can replicate its effect; token costs have doubled instead.)*

原文:撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压Fable5”但无人能复现,Token开销反而翻倍

Краткое содержание анализа

Недавно стал популярен проект сообщества под названием J-Space Cognition Suite, который утверждает, что без изменений самой модели DeepSeek V4-Pro можно значительно повысить ее производительность с помощью вспомогательного инструмента (Harness), делая ее даже лучше, чем Fable 5. Однако существует три основных спора по этому поводу:

1. Отсутствие результатов воспроизведения экспериментов третьими сторонами (все данные были получены внутри проекта);

2. Сходность названия с продуктом Anthropic, что приводит к путанице (технологии двух инструментов совершенно разные);

3. Удвоение потребления токенов при использовании инструмента (что увеличивает затраты). Этот случай показывает текущие тенденции в разработке вспомогательных инструментов для AI-моделей: они направлены на устранение их слабых сторон и разделение на две основные категории – универсальные и специализированные (на конкретные модели).

1. Проект показывает впечатляющие результаты, но их никто не может воспроизвести

Согласно заявлениям разработчиков, после использования Harness производительность DeepSeek V4-Pro значительно улучшилась (например, показатели NL2Repo и Terminal-Bench 2.1 выросли с 61,5 до 73,4 и с 87,9 до 90,1 соответственно). Однако эти данные были получены только внутри проекта, и ни одна независимая группа не смогла повторить результаты при одинаковых условиях (версия модели, среда тестирования, параметры).

Почему воспроизведение экспериментов так важно? Потому что результаты могут быть искажены (например, при скрытом изменении условий тестирования или случайных факторах). Без проверки третьей стороны эти улучшения могут считаться недостоверными. Некоторые разработчики, пытавшиеся воспроизвести результаты, даже получили худшие результаты.

2. Не путайте J-Space с продукцией Anthropic!

Многие ошибочно связывают J-Space с компанией Anthropic (разработчиком модели Claude), но это два разных проекта:

  • J-Space от Anthropic направлен на изучение внутренних механизмов работы модели Claude (передача информации, сохранение данных);
  • J-Space от сообщества – это вспомогательный инструмент для управления процессом выполнения задач модели (определение моментов повторных попыток, отслеживание прогресса и т. д.).

Сходство названий является случайным (или может быть использовано для привлечения внимания), но это вводит пользователей в заблуждение.

3. Использование инструмента увеличивает затраты?

Токены являются основным ресурсом для работы AI-моделей; чем больше их потребляется, тем выше расходы. Разработчики отметили, что использование J-Space увеличивает потребление токенов в 2–4 раза (например, стоимость тестирования версии V4 Flash выросла на 50%–300%). Кроме того, иногда производительность снижается. Это означает, что даже если улучшения реальны, повышенные затраты могут сделать использование инструмента невыгодным с экономической точки зрения.

4. Вспомогательные инструменты направлены на устранение слабых сторон AI-моделей

J-Space пытается решить общие проблемы при выполнении длительных задач:

  • Скатывание представлений модели (забывание цели в процессе выполнения);
  • Преждевременное завершение задачи. Существующие инструменты пытаются устранить эти недостатки: например, официальный Harness для DeepSeek включает функцию отслеживания прогресса выполнения задач; некоторые методы сокращают использование памяти, но могут приводить к потере информации. Однако идеального решения еще не найдено.

5. Два направления развития вспомогательных инструментов

Существуют два основных подхода к созданию таких инструментов:

  • Универсальные (например, OpenCode): предназначены для работы с различными моделями; их преимущество в гибкости, но они могут быть сложны в использовании из-за необходимости управления правами подразделений модели;
  • Специализированные (например, Harness от DeepSeek или SDK от OpenAI): разработаны с учетом особенностей конкретных моделей; их преимущество в стабильности, но они ограничены возможностями самой модели.

Вывод

Проект J-Space скорее представляет собой маркетинговую акцию; хотя он предлагает интересные подходы к решению проблем при выполнении длительных задач, его эффективность не проверена независимыми исследователями, а затраты на использование выше, чем ожидалось. Этот случай показывает, что для повышения производительности AI-моделей важны не только сами модели, но и вспомогательные инструменты. В будущем разработчики будут стремиться найти баланс между повышением производительности и снижением затрат. Пользователям и компаниям следует не верить заявлениям о значительных улучшениях без проверки результатов и анализа затрат.