虎嗅

실제 사용해본 DeepSeek: 마스크는 알아보지만, 량원풍은 알아보지 못하다

原文:实测“开了眼”的DeepSeek:认得马斯克,认不出梁文锋

핵심 내용 요약

DeepSeek가 마침내 다중 모달 기능을 추가하여 Vision-Exp라는 실험용 모델을 출시했습니다. 가격은 여전히 저렴하게 유지되고 있지만(1원으로 8장의 이미지를 볼 수 있음), 실제 사용자들의 테스트 결과는 다소 실망스러웠습니다. 사용자들은 자사의 창립자인 량원풍을 왕싱이나 장이밍으로 오인했으며, 실제 사람들의 모습을 AI가 생성한 가짜 이미지로 착각하기도 했습니다. 또한 복잡한 작업(예: 웹페이지 복제)에서도 성능이 떨어졌습니다. 공식적인 성능 테스트 결과는 최고 수준의 모델에 근접하지만, 실제 사용 경험과 실험실 데이터 사이에는 큰 차이가 있었습니다. DeepSeek가 이 “반제품”을 공개한 이유는 사용자 테스트를 통해 피드백을 수집하여 정식 버전을 개선하기 위함입니다.

1. 긍정적인 점: 드디어 이미지를 볼 수 있게 되었으며, 가격도 매우 저렴함

이전의 DeepSeek 모델은 텍스트만 처리할 수 있었지만, Vision-Exp는 사람을 인식하고 스크린샷을 읽으며 차트를 분석하는 등의 시각적 기능을 추가했습니다. 가장 중요한 것은 가격입니다. 1장의 이미지당 최대 384개의 “토큰”(모델이 계산하는 단위)이 소모되지만, 피크 시간에도 1원으로 8장의 이미지를 볼 수 있습니다. 이는 DeepSeek의 일관된 “저렴한 가격 정책”을 이어가며, 개발자와 일반 사용자 모두 쉽게 모델을 시험해볼 수 있게 해줍니다.

2. 실망스러운 사용자 테스트 결과

사용자들의 테스트 결과는 다음과 같은 웃긴 상황들을 보여주었습니다:

  • 인식 실패: DeepSeek의 창립자 량원풍의 사진을 메이트윈의 왕싱이나 字节의 장이밍으로 오인함
  • 실제 사람에 대한 의심: 시대소년단의 합사 사진을 보고 “다섯 명이 너무 닮고 피부가 매끄러워서 AI가 생성한 가짜 이미지 같다”고 함
  • 복잡한 작업의 성능 저하: Three.js 3D 장면을 생성하도록 했을 때, 결과물은 Gemini 3.7 Flash보다는 나았지만 반복적인 오류와 연결 문제로 인해 다른 모델의 15배에 달하는 토큰이 소모되었으며, 처리 시간도 3.5배 더 걸렸습니다.

이러한 문제들로 인해 사용자들은 이 모델을 “눈을 뜨고도 보지 못하는” 모델이라고 농담하며, “좋은 모델이지만 불완전하다”고 평가했습니다.

3. 공식적인 성능은 좋지만, 실제 사용은 느리고 불안정함

공식적인 성능 테스트 결과에 따르면 Vision-Exp의 다중 모달 기능은 Anthropic의 최고 수준 모델인 Opus에 근접하지만, 실제 사용에서는 많은 차이가 있습니다.

  • 실험실 환경과 실제 사용 환경의 차이: 공식 테스트는 표준화된 환경에서 이루어졌지만, 사용자들이 마주하는 이미지의 품질(흐림, 합성 이미지)과 작업의 복잡성(유머러스한 이미지, 복잡한 웹페이지)은 매우 다양하여 모델이 적응하기 어렵습니다.
  • 세부 사항 처리의 부족: 웹페이지 복제와 같은 작업에서 Vision-Exp는 기본적인 구조만 제공할 뿐 색상과 텍스트의 위치가 정확하지 않은 반면, GLM-5.3, Kimi K3는 더 많은 세부 사항을 잘 재현합니다.

4. 왜 반제품을 공개했을까? 이것은 DeepSeek의 “공개 테스트” 전략입니다

모델 이름에 “Exp”(실험용)가 붙어 있어 DeepSeek도 아직 모델이 완성되지 않았다는 것을 인지하고 있습니다. 그렇다면 왜 서둘러 공개했을까요?

  • 비용 절감: V4-Flash(적은 파라미터, 빠른 속도)를 기반으로 하여 비용을 절약하면서도 시각 기능을 추가하여 개발자들이 적극적으로 테스트할 수 있도록 했습니다.
  • 실제 사용자 피드백 수집: 실험실에서는 발견할 수 없는 문제들(예: 량원풍을 인식하지 못하는 것, 유머러스한 이미지를 이해하지 못하는 것)을 사용자들이 직접 경험함으로써 정식 버전을 개선할 수 있습니다.
  • 기존 사용자에게의 영향 최소화: 기존의 V4-Flash도 계속 사용할 수 있으며, 새로운 기능을 시험해보고 싶은 사용자들은 실험용 버전을 사용할 수 있어 서로 방해가 되지 않습니다.

이전에도 2025년 9월에 V3.2-Exp를 사용하여 새로운 기능을 테스트한 후 두 달 뒤에 정식 버전을 출시한 바 있습니다.

5. 미래: 이 “눈”은 얼마나 더 발전해야 할까?

Vision-Exp의 실험용 버전은 많은 문제점을 드러냈습니다. 얼굴 인식의 정확도가 낮고, 복잡한 작업에서 세부 사항 처리가 부족하며, 유머러스한 이미지의 의미를 이해하지 못합니다. DeepSeek는 이러한 사용자 피드백을 바탕으로 문제들을 하나하나 해결해야만 정식 버전을 개선할 수 있습니다. 그때가 되면 량원풍이 “슬라이딩 저항기”에서 “량성”으로 변할 수 있을지, 이 “눈”의 성능에 달려 있습니다.

결론

전반적으로 DeepSeek의 다중 모달 모델은 좋은 기술이지만 아직 완성도가 부족합니다. 방향성(단점 보완, 저렴한 가격)은 올바르지만 세부 사항들이 더 개선되어야 합니다. 실험용 버전의 의미는 오류를 찾아내는 데 있으며, 정식 버전이 이러한 문제들을 얼마나 잘 해결할지가 관건입니다.