一、 핵심 내용 요약
이 글은 한 기술 블로거가 DeepSeek가 최근 내부 테스트를 시작한 V4.1 Flash 대형 모델에 대한 실제 테스트 결과를 보고한 것입니다. 이 새 모델은 완전히 새로운 아키텍처와 원생 다중 모달(multi-modal) 기능을 강점으로 내세우고 있으며, 공식적으로도 테스트 설문지를 통해 사용자들에게 “이 모델이 이전에 더 높은 평가를 받았던 V4 Pro를 대체할 수 있는지”를 직접 물어보았습니다. 블로거는 기존 V4 Flash와 비교하여 총 14개의 작업을 수행했으며, 이 과정에서 약 3억 개의 한자에 해당하는 모델 호출 횟수가 발생했습니다. 그 결과 새 모델의 이미지 인식 및 시각화 능력이 크게 향상된 것을 확인했지만, 타이핑 속도는 빠르지만 작업 완료 속도가 느리고, 긴 내용을 기억하는 데 어려움이 있으며, 복잡한 작업을 할 때 오히려 더 많은 자원이 소모된다는 단점도 발견되었습니다. 즉, 기존 모델을 완전히 뛰어넘는 “완벽한 업그레이드”는 아니었습니다.
---
두、 각 항목별 쉬운 설명
1. 가장 주목할 만한 업그레이드: 드디어 “자체적인 시각 능력”이 생겼다
이전 버전의 Flash는 순수 텍스트 기반의 모델이었습니다. 이미지를 제공해도 스스로는 이해할 수 없어서 제3자의 문자 인식 도구를 사용한 후 이미지 인식 도구를 호출하여 정보를 조합해야 했으며, 이 과정에 수십 초에서 수십 분이 걸렸으며, 종종 오류가 발생하기도 했습니다(예: 포스터에 있는 중개인을 인식하지 못하거나 이미지에 인쇄된 영어 단어를 전혀 다른 단어로 오해하는 경우).
V4.1 Flash는 원생 다중 모달 기능을 갖추고 있어서 이미지를 한 번 보는 것만으로 5~7초 안에 내용을 명확하게 설명할 수 있으며, 외부 도구를 사용할 필요가 없습니다. 심지어 “내가 그린 그림이 못생겼는지”도 스스로 판단할 수 있습니다. 예전에는 AI에게 갈매기가 자전거를 타는 그림을 그리게 했을 때 종종 오류가 발생했지만, 이번에는 스스로 문제를 발견하고 새의 부리나 자세를 수정할 수 있습니다.
더 놀라운 점은 이미지의 정보를 “실제로 실행 가능한 프로그램”으로 변환할 수 있다는 것입니다. 블로거가 3장의 참고 이미지를 제공하고 물범이 상자를 밀는 간단한 게임을 만들게 했을 때, 기존 버전은 지도를 7×7로 변경하고 주인공을 주황색 인물로 바꾸는 등 참고 이미지와 크게 다른 결과를 내놓았지만, 새 버전은 물범의 파란 옷과 주황색 가방을 그대로 재현했으며, 지도의 격자 수와 각 캐릭터의 위치까지 완벽하게 맞췄습니다. 이전에는 게임을 만들기 위해 이미지 인식 전문가와 프로그래머를 따로 찾아야 했지만, 이제는 AI가 한 번만 보고 바로 결과물을 만들어줍니다.
2. 문서 작성 속도는 3배 빨라졌지만, 왜 최종 결과는 그리 빠르지 않을까?
실제 테스트 결과 V4.1 Flash의 타이핑 속도는 초당 200개 이상의 한자로 기존 버전의 3배였습니다. 처음에는 매우 빠르게 느껴졌지만, 전체 작업 완료 시간은 크게 단축되지 않았습니다. 특히 간단한 게임을 할 때는 실제로 출력되는 유효한 문자 수가 적어져 오히려 기존 버전보다 4분 더 많은 시간이 소요되었습니다.
실행 로그를 분석해 보니, 프로그래밍에 소요되는 시간을 “자체적인 검증 및 수정”에 사용했기 때문입니다. 기존 버전은 코드를 작성한 후 바로 결과를 제공했지만, 새 버전은 코드를 작성한 후에도 오류를 확인하고 수정하는 데 많은 시간을 보냈습니다. 예를 들어, 간단한 게임을 할 때도 도구의 검증을 위해 18분을 소비했는데, 이는 기존 버전의 3배에 해당합니다.
이는 마치 일반인의 3배 속도로 타이핑하는 인턴이 PPT를 만드는 상황과 같습니다. 그 인턴은 작성 후에도 자료를 반복해서 확인하고 동료들에게 도움을 요청해야 하므로, 최종적으로 제출되는 PPT의 품질은 타이핑 속도와는 무관합니다. 따라서 문서 작성 속도의 이점이 사라지는 것입니다.
3. 능력의 편중: 실제 작업에는 강하지만, 긴 내용을 기억하는 데는 약함
새 모델의 장점과 단점이 명확하게 나타났습니다.
장점은 “아이디어를 실제로 실행 가능한 프로그램으로 구현하는 능력”입니다. 예를 들어, 1천만 개 이하의 쌍둥이 소수를 시각화하는 은하도를 만들게 했을 때, 기존 버전은 숫자는 정확하게 계산했지만 실제로는 아무것도 보이지 않았지만, 새 버전은 완전한 나선형 은하를 생성하고 원하는 숫자를 클릭하면 해당하는 점을 바로 찾을 수 있었습니다. 3D 무장 항공기를 만들 때도 꼬리 방사기나 착륙장의 세부 사항까지 포함되었으며, 스위치를 클릭하면 착륙장을 접을 수도 있었습니다.
단점은 긴 내용을 기억하는 능력이 매우 약합니다. 10만 자 분량의 웹 글을 작성하게 했을 때 주인공이 몇 번 바닥을 쓸어도 내용을 혼동했으며, 한 문단에서는 다섯 번째로 쓴 내용을 다음 문단에서는 네 번째로 착각했습니다. A주 시장의 리뷰 보고서를 작성할 때도 첫 페이지에 연간 수익률이 15.1%라고 적었지만, 차트에는 17.8%가 표시되어 내용이 일치하지 않았습니다. 이는 AI가 실제 작업에는 강하지만 기억력이 매우 약하다는 것을 의미합니다. 짧고 간단한 시각화 작업이나 도구 개발에는 유용하지만, 긴 문서나 보고서 작성에는 신뢰할 수 없습니다.
4. 새 모델이 오히려 더 비싸다? 복잡한 작업에는 많은 자원이 소모된다
가장 이해하기 어려운 점은 같은 작업을 수행하는 데 새 모델이 기존 버전보다 36% 더 비쌌다는 것입니다(62달러 대 45달러). 블로거가 로그를 분석한 결과, 새 모델은 복잡한 작업을 할 때 “자체적인 AI 팀”을 동원하여 작업을 분담합니다. 예를 들어, 10만 자 분량의 웹 글을 작성할 때는 각 장마다 전용 작성자를 배정하고, 글자 수를 확인하고 내용을 수정하는 작업도 별도로 진행되었습니다. 대규모 생존 게임을 만들 때는 13개의 AI를 동원하여 각각 다른 모듈을 작성한 후 최종적으로 합쳤습니다.
기존 버전은 단일 AI가 모든 작업을 처리했기 때문에 비용이 저렴했습니다. 이는 마치 서비스 업체를 이용할 때와 비슷합니다. 예전에는 한 명의 엔지니어가 모든 작업을 완료하고 50달러를 받았지만, 이제는 10명의 엔지니어가 작업을 분담하여 비용이 증가했습니다. 다행히도 공식적으로 9월 10일에 가격을 인하한다고 발표했으며, 자주 사용하는 기능의 캐싱 호출 비용이 60% 할인될 예정이므로 향후 사용 비용은 현재보다 훨씬 저렴해질 것입니다.