핵심 내용 요약
최근 AI 커뮤니티에서는 “환희에서 사기 고발까지”的 웃긴 일이 벌어졌습니다. J-Space 팀은 Skill 플러그인을 출시했다고 주장하며, 모델의 가중치를 수정하지 않고도 DeepSeek V4 Pro의 성능을 크게 향상시킬 수 있다고 했으며, 심지어 최고 수준의 모델인 Fable 5를 능가할 수 있다고 했습니다. 하지만 커뮤니티 개발자들이 재테스트한 결과, 성능이 향상되지 않았을 뿐만 아니라 오히려 자원 소비가 더 많아졌습니다. 저자는 평가 세부 사항을 공개하기를 거부했으며, 의심하는 글들도 삭제했습니다. 결국 이 “기적 같은 향상”은 데이터 조작의 사기로 드러났습니다. 이 사기의 매력은 DeepSeek V4 Pro가 외부 환경에 민감하다는 실제 문제점을 정확히 파악하여 많은 사람들이 그 효과를 믿게 만든 데 있었습니다.
1. J-Space의 “기적 같은 Skill”
J-Space가 출시한 Cognition Suite V3.6은 본질적으로 “모델 실행 시 제어 방안”입니다. 즉, 모델 자체를 수정하지 않고 AI가 작업을 수행할 때 “관리 로직”을 추가하는 것입니다. 그들은 AI 어시스턴트(Agent)가 자주 저지르는 4가지 실수를 지적했습니다:
- 정보 과부하: 작업에 너무 많은 목표와 도구가 포함되어 중요한 내용이 가려진다;
- 기억 오류: 여러 번의 추론 후 같은 이름/값이 변질된다;
- 무작위 재시도: 도구 호출에 실패해도 원인을 분석하지 않고 반복한다;
- 조기 종료: 답변이 자연스럽게 보이면 바로 끝내버린다.
그들의 솔루션은 실행 과정을 “간단한 판단 → 실행 → 심사숙고 → 검증 → 진단 정보를 포함한 재시도”의 순환으로 바꾸고, 중요한 정보는 “외부 기록장”에 저장하여 잊어지지 않도록 했습니다. 그리고 과장된 성능 결과를 내세웠습니다: Terminal Bench는 87.9에서 90.1로, NL2Repo는 61.5에서 73.4로 상승했으며, Fable5와 Opus4.8을 능가했다고 주장하여 순식간에 화제가 되었습니다.
2. 커뮤니티의 반발: 재테스트 결과는 실망스럽고 자원 소비만 증가
곧 사기를 의심하는 목소리들이 나타났습니다:
- 개발자 A의 테스트: V4 Flash로 두 번의 A/B 테스트를 진행했지만 완성도에 차이가 없었으며, J-Space 그룹은 더 많은 자원을 소비했습니다. 제3자의 무작위 평가에서는 대조군이 8.3점을 얻은 반면 J-Space 그룹은 7.87점에 그쳤습니다.
- 개발자 B의 확인: NVIDIA H20를 사용하여 89개 문제를 풀었지만 69개만 정답(77.5%)을 맞혔으며, 보고서에는 87.1%라고 기재되어 거의 10% 차이가 났습니다. 실패한 작업은 3번 재시도해도 향상되지 않았습니다.
- 글 삭제: 의심하는 글을 올린 사용자는 저자에게 삭제당했으며, 백업 글만 다시 올릴 수 있었습니다. 저자는 평가 환경, 프로세스, 샘플 결과를 공개하지 않아 사기 의혹을 더욱 부각시켰습니다.
3. 어떻게 속였을까? DeepSeek V4 Pro의 “약점”을 정확히 파악
J-Space가 사람들을 속일 수 있었던 이유는 DeepSeek V4 Pro가 외부 실행 환경에 매우 민감하다는 실제 문제를 잘 파악했기 때문입니다. 예를 들어, 비슷한 지시로 3D 게임을 테스트했을 때 아침에는 결과가 부정확했지만 4시간 후에는 완성된 프로젝트가 생성되었습니다. 같은 모델이 다른 Harness 모드(Standard/PTC/Minimal)에서는 점수가 8점 차이났습니다.
사람들은 이미 “실행 환경을 조정하면 성능이 향상된다”고 생각하고 있었기 때문에, J-Space의 주장은 더욱 신빙성 있게 들렸습니다.
4. AI 커뮤니티의 “사기 고발”: 재현되지 않는 성능 향상은 모두 사기
이 사건은 AI 커뮤니티에 중요한 교훈을 남겼습니다: 성능 향상이라면 반드시 다른 사람들도 재현할 수 있어야 합니다. 마치 금융 분야에서 기업의 실적이 감사를 받아야 하는 것처럼, AI의 결과도 평가 환경, 프로세스, 샘플 등 세부 정보를 공개하여 모두가 검증할 수 있어야 합니다. J-Space의 성능이 아무리 놀라워도 재현되지 않는다면 그것은 허구에 불과합니다. 다음에 과장된 AI 결과를 보면 먼저 이렇게 물어보세요: “재현할 수 있나요? 공개적인 증거가 있나요?”
5. 기술적 접근 자체: 문제는 실제로 존재하지만 솔루션은 효과적이지 않을 수 있다
J-Space가 지적한 AI 어시스턴트의 네 가지 문제(정보 과부하, 기억 오류 등)는 실제로 존재합니다. 많은 팀들이 이러한 문제를 해결하기 위해 노력하고 있습니다(예: Routing Suite는 작업에 따라 추론 모드를 선택하고, Anchored Standard는 간단한 지시로 모델의 안정성을 유지합니다). 하지만 J-Space의 솔루션은 효과가 부족했거나 데이터 조작으로 인해 오히려 반면 사례가 되었습니다.
결론적으로, AI 분야의 혁신은 진정한 기술적 돌파구가 필요하며, 사기나 문제점을 이용하여 관심을 끄는 것이 아닙니다. 이번 사기 고발 사건은 우리에게 과장된 결과에 대해 더욱 경계하도록 하고, “재현 가능성”을 AI 발전의 기준으로 삼아야 한다는 것을 일깨워주었습니다.