핵심 내용 요약
최근 J-Space Cognition Suite라는 커뮤니티 프로젝트가 주목을 받고 있습니다. 이 프로젝트는 DeepSeek V4-Pro 모델 자체를 수정하지 않고, 단지 외부에 보조 도구(Harness)를 적용함으로써 모델의 성능을 크게 향상시킬 수 있다고 주장합니다. 심지어 Fable 5보다도 뛰어난 성능을 낼 수 있다고 합니다. 하지만 현재 이 주장에는 세 가지 큰 논란이 있습니다:
1. 제3자에 의한 재현 결과가 없음 (모든 데이터는 프로젝트 측에서 직접 측정한 것입니다).
2. Anthropic의 J-space와 이름이 비슷해 혼동을 야기함 (두 기술은 전혀 다릅니다).
3. 실제 사용 시 토큰(Token) 소모가 배로 증가함 (비용이 더 많이 듭니다).
이 사례는 AI 모델 보조 도구(Harness)의 현재 발전 추세를 반영합니다: 장점을 보완하고, 개발 방향이 분화되고 있습니다(범용형 vs 맞춤형).
1. 프로젝트의 주장은 인상적지만, 아무도 결과를 재현하지 못함
이 프로젝트에 따르면, Harness를 적용한 후 DeepSeek V4-Pro의 성능이 여러 테스트에서 눈에 띄게 향상되었습니다 (예: NL2Repo 점수가 61.5에서 73.4로, Terminal-Bench 2.1 점수가 87.9에서 90.1로 상승). 하지만 이 데이터는 모두 프로젝트 측에서 직접 측정한 것이며, 아직 다른 팀이 동일한 조건(모델 버전, 테스트 환경, 파라미터)으로 동일한 결과를 얻지 못했습니다.
왜 재현이 중요할까요? 자체 측정에서는 은밀한 조작(예: 테스트 조건을 변경하거나 데이터의 우연성)이 있을 수 있기 때문입니다. 제3자의 검증이 없으면 이러한 성능 향상은 신뢰할 수 없습니다. 일부 개발자들이 재현을 시도했지만, 오히려 성능이 더 나빠졌습니다.
2. J-Space와 Anthropic은 다른 기술입니다!
많은 사람들이 “J-Space”라는 이름을 보고 Anthropic(Claude 모델을 개발한 대기업)과 연관지르지만, 실제로는 전혀 다른 프로젝트입니다:
- Anthropic의 J-space: 자사 Claude 모델의 내부 신경 메커니즘(예: 정보 전달 방식, 기억 저장 방법)을 연구하는 것으로, “모델 내부의 문제”를 다룹니다.
- 커뮤니티 프로젝트 J-Space: DeepSeek 모델에 적용되는 외부 보조 도구로, 모델이 작업을 수행하는 과정(예: 언제 재시도할지, 진행 상황을 어떻게 기록할지, 작업이 완료되었는지 판단하는 방법)을 관리합니다.
이름의 유사성은 순전히 우연(또는 인기를 끌기 위한 의도일 수 있음)이며, 많은 사람들이 Anthropic의 기술 지원을 받는 것으로 오해하고 있습니다.
3. 사용 시 오히려 비용이 더 많이 드나요? 토큰 소모가 배로 증가함
토큰은 AI 모델의 “비용 단위”로, 작업을 처리할 때 사용하는 토큰이 많을수록 비용이 증가합니다. 일부 개발자들의 테스트에 따르면:
- J-Space를 사용하면 토큰 소모가 원래의 2~4배로 증가합니다 (예: V4 Flash 버전을 테스트할 때 비용이 50%에서 300%까지 더 많이 듭니다).
- 성능 향상은 없었으며, 일부 작업의 경우 오히려 성능이 더 나빠졌습니다.
이는 프로젝트 측이 주장하는 성능 향상이 사실이더라도 비용 증가로 인해 실제로는 비효율적일 수 있음을 의미합니다. 기업이 AI를 사용할 때 비용은 중요한 고려사항입니다.
4. Harness는 모델의 단점을 보완하고 있습니다
이 프로젝트가 해결하려는 문제는 모든 AI 모델이 장기 작업을 수행할 때 공통적으로 겪는 문제들입니다:
- 表征 드리프트: 작업을 진행하는 도중 목표를 잊어버림(예: 코드를 작성할 때 이미 완료된 단계를 반복하거나 관련 없는 내용으로 방향이 틀림).
- 조기 종료: 작업이 완료되지 않았음에도 불구하고 작업이 끝났다고 선언함(예: 코드가 아직 디버깅되지 않았는데 완료되었다고 함).
현재 업계의 Harness들은 이러한 단점을 보완하려고 노력하고 있습니다. 예를 들어, DeepSeek의 공식Harness는 “작업 진행 상황 보드”를 업데이트하여 모델이 잘못된 방향으로 가지 않도록 합니다. 일부 연구에서는 메모리 사용량을 줄이기 위해 “컨텍스트 압축”을 사용하지만, 정보 손실이 발생할 수 있습니다. 또한, 작업 완료 여부를 모델 자체가 판단하는 것에서 외부 도구가 확인하도록 변경하고 있습니다. 이러한 방법들은 성능과 비용의 균형을 찾으려는 시도입니다만, 아직 완벽한 해결책은 없습니다.
5. Harness의 두 가지 발전 방향: 범용형 vs 맞춤형?
현재Harness의 발전 방향은 두 가지입니다:
- 범용형: 모든 모델에 적용할 수 있도록 설계되어 작업을 여러 하위 에이전트로 분담합니다(예: 계획, 실행을 담당하는 에이전트). 하지만 권한 관리가 복잡합니다(예: 하위 에이전트가 제한을 우회하여 파일을 임의로 변경할 수 있음).
- 맞춤형: 모델 제조업체가 직접 개발하여 자사 모델의 특성에 맞게 설계됩니다(예: 모델이 어느 단계에서 쉽게 잘못되는지 알고 있음). 안정성은 높지만, 해당 모델에서만 사용 가능합니다.
두 방향에는 각각 장단점이 있으며, 아직 “최적의 해결책”은 없습니다. 범용형은 유연하지만 문제가 발생할 수 있고, 맞춤형은 안정적이지만 범용성이 떨어집니다.
결론
J-Space 프로젝트는 일종의 “마케팅 시도”에 가까워 보입니다. 장기 작업 문제를 해결하기 위한 몇 가지 아이디어를 제시했지만, 검증이 부족하고 비용이 더 많이 듭니다. 이 사례는 AI 모델의 성능 향상이 모델 자체뿐만 아니라 외부 보조 도구(Harness)에도 달려 있음을 보여줍니다. 앞으로 Harness의 발전은 “성능 향상”과 “비용 관리” 사이에서 균형을 찾으며, 범용형과 맞춤형 방향을 계속 탐색할 것입니다. 일반 사용자나 기업은 “모델을 수정하지 않고도 크게 향상된다”는 광고를 쉽게 믿지 말고, 제3자의 검증 결과와 비용 효율성을 신중하게 고려해야 합니다.