虎嗅

実際に使用してみたDeepSeek:マスクの顔は認識できるが、梁文鋒の顔は認識できない

原文:实测“开了眼”的DeepSeek:认得马斯克,认不出梁文锋

核要内容のまとめ

DeepSeekはついに多モーダル機能(画像の認識が可能になった)を実装し、実験版モデル「Vision-Exp」をリリースしました。価格は依然として手頃で(1円で8枚の画像を閲覧できます)、しかしユーザーの実際の評価は芳しくありません。自社の創業者である梁文鋒氏の顔を認識できない(王興や張一鳴と間違える)、実在の人物の集合写真をAI生成の画像と誤認する、複雑なタスク(ウェブページの再現など)では細部の処理が不十分です。公式のスコアはトップクラスのモデルに近いものの、実際の使用感と実験室でのデータには大きな差があります。DeepSeekがこの「未完成品」を公開したのは、ユーザーのテストを通じてフィードバックを集め、正式版の開発に役立てるためです。

1. ポイント:ついに画像を認識できるようになり、しかも非常に安価

DeepSeekの以前のモデルはテキストの処理のみでしたが、Vision-Expでは視覚処理の機能が追加されました。人の顔の認識やスクリーンショットの読み取り、チャートの閲覧が可能になりました。さらに重要なのは価格で、1枚の画像につき最大384の「Token」がかかりますが、混雑している時間帯でも1円で8枚の画像を閲覧できます。これはDeepSeekの一貫した「低価格路線」を継続しており、開発者や一般ユーザーが気軽に試すことができます。

2. 間違いだらけの使用例:創業者の顔を認識できない、実在の人物をAIと誤認する

ユーザーによる実際のテストでは以下のような笑える事例が多数ありました:

  • 人物認識の失敗:DeepSeekの創業者梁文鋒氏の写真を、美団の王興や字節跳动の張一鳴と間違える
  • 実在の人物への疑念:時代少年団の集合写真を見て「5人が似すぎて肌が滑らかすぎる。AI生成の偽画像のようだ」と指摘
  • 複雑なタスクでの不備:Three.jsによる3Dシーンの生成では、完成品はGemini 3.7やFlashよりはましだが、何度もエラーが発生し、使用する「Token」の量が他のモデルの15倍にもなり、処理時間も3.5倍かかる

これらの問題から、ユーザーはDeepSeekを「目が見えていても何も見えない」と揶揄し、「壊れかけた良いモデル」と評しています。

3. 官方のスコアは良いが、実際の使用感は悪い:実験室と現実のギャップ

公式のデータではVision-Expの多モーダル機能はAnthropicのトップモデルOpusに近いとされていますが、なぜ実際の使用感はこれほど悪いのでしょうか?

  • 実験室環境と現実の違い:スコアは標準化されたテストで測定されていますが、ユーザーが遭遇する画像の品質(ぼやけたものや合成されたもの)やタスクの複雑さ(ミームや複雑なウェブページ)は多種多様で、モデルが対応できていません
  • 細部処理の不足:ウェブページの再現では、Vision-Expは基本的な枠組みしか構築できず、色やテキストの配置が正しくありません。GLM-5.3やKimi K3などのモデルはより多くの細部を再現できます。

4. なぜ未完成品を公開するのか?これがDeepSeekの「公開テスト」の手法

モデル名に「Exp」(実験版)が付いていることから、DeepSeek自身もまだ完成度が低いことを認識しています。ではなぜ急いで公開したのでしょうか?

  • コストの削減:V4-Flash(パラメータが少なく処理速度が速い)をベースにしており、視覚機能を追加しても価格を抑えているため、開発者が大量にテストできる
  • フィードバックの収集:実験室では発見できない問題(梁文鋒氏の顔の認識不足やミームの理解不能など)は、ユーザーが使用して初めて分かるもので、これらのフィードバックが正式版の改善に役立つ
  • 既存ユーザーへの影響:旧バージョンのV4-Flashも引き続き使用可能で、新機能を試したいユーザーは実験版を利用できる。互いに干渉しない

これは初めてのことではありません。2025年9月にはV3.2-Expを使って新しい機能をテストし、2ヶ月後に正式版がリリースされました。

5. 未来:この「目」はまだどれくらい鍛えればいいのか?

Vision-Expの実験版では多くの問題が露呈しました。顔認識の精度が低く、複雑なタスクでの細部処理が不十分で、ミームの意味が理解できないなどです。DeepSeekはこれらのユーザーフィードバックを一つ一つ解決し、正式版を完成させなければなりません。その時、梁文鋒氏が「スライド抵抗器」から「梁聖」に変われるかどうかは、この「目」の鍛錬次第です。

総じて、DeepSeekの多モーダルモデルは「良いアイデアではあるがまだ完成していない」と言えます。方向性(弱点の補強や低価格)は正しいのですが、細部にはまだ改善が必要です。実験版の意義は試行錯誤にあり、正式版がこれらの問題を解決できるかどうかが鍵となります。