一、核心内容の要約
これはテクノロジーブロガーによるDeepSeekがちょうど内測を開始したV4.1 Flashモデルの実測レポートです。この新モデルは全く新しいアーキテクチャとネイティブなマルチモーダル機能を特徴としており、公式側は内測アンケートの中でユーザーに対して「これで以前のV4 Proを置き換えることができるか」と直接尋ねています。ブロガーは旧バージョンのV4 Flashを比較対象として14組のタスクを実行し、合計で3億文字に相当するモデルの呼び出し回数を消費しました。その結果、新モデルの画像認識や可視化の能力が大幅に向上していることがわかりましたが、「タイピングは速いが処理速度が遅い」、長いテキストを記憶するのが苦手で内容が混ざりやすい、複雑なタスクではかえってコストがかかるという欠点もあり、旧バージョンを完全に上回る「完璧なアップグレード版」とは言えないことが判明しました。
---
二、各側面からの分かりやすい解説
1. 最も評価できるアップグレード:ついに「自分で見る目」がついた
以前の旧バージョンのFlashは純粋なテキスト処理専用のモデルで、画像を与えても自分では理解できず、まず外部のテキスト認識ツールを呼び出し、その後画像認識ツールを使って画像情報を組み立てる必要があり、数十秒から数分かかり、さらには誤認識することもよくありました(例えば、ポスターにある黄牛を認識できなかったり、画像に印刷された英単語を全く関係のない単語と誤解したりする)。しかし、V4.1 Flashはネイティブなマルチモーダル機能を備えており、画像を一目見るだけで5〜7秒で内容を正確に説明できるようになりました。外部ツールを使う必要がなくなり、さらに「自分の描いた画像が醜いかどうか」を判断することもできるようになりました。以前はAIにペリカンが自転車に乗る絵を描かせると、よくボウルを持った白鳥になってしまいましたが、今回は自分で問題を発見し、鳥のくちばしや姿勢を修正することができます。さらに素晴らしいのは、画像の中の規則を直接「実行可能なプログラム」に変換できることです。ブロガーは3枚の参考画像を与えて、アライグマが箱を押す小さなゲームを作らせました。旧バージョンでは半日かけて地図を7×7に変更し、主人公をオレンジ色の小人に変えてしまいましたが、新バージョンはアライグマの青い服やオレンジ色のバッグを参考画像と完全に再現し、地図のマスの数や各キャラクターの位置も一致しました。これは以前は画像認識ツールとコードを書く人を別々に探す必要がありましたが、今ではAIが一目でゲームを作ってくれるので、中間のやり取りが大幅に省けます。
2. テキスト処理速度は3倍になったが、なぜ最終的な結果はあまり速くないのか?
実測の結果、V4.1 Flashのタイピング速度は毎秒200文字以上で、旧バージョンの3倍です。最初は非常にスムーズに感じましたが、後でブロガーは最終的な処理時間があまり速くなっていないことに気づきました。小さなゲームを作る際には、実際に出力される有効な文字数が少なく、結果として旧バージョンよりも4分多くの時間がかかりました。実行記録を詳しく見ると、コードを書く時間を節約した分をすべて「自己チェックと修正」に使っていることがわかりました。旧バージョンではコードを書き終えるとすぐに結果を出しましたが、V4.1 Flashはコードを書いた後にツールを使ってテストを行い、バグがないかを確認し、修正が必要な場合は修正します。小さなゲームを作る際には、ツールがコードを検証するのを待つ時間だけで18分かかり、これは旧バージョンの3倍です。これは、タイピング速度が普通の人の3倍のインターンにPPTを作らせるようなもので、彼は書き終わった後に何度も資料を確認し、3人の同僚に間違いをチェックしてもらう必要があり、最終的に提出されるPPTの完成度にのみ関心があるので、テキスト処理の速度の利点が失われてしまっています。
3. 機能に偏りがある:物を作るのは優れているが、長いテキストの記憶力は弱い
今回の実測では新モデルの長所と短所がはっきりとしました。強みは「アイデアを実行可能なものに変換する能力」です。例えば、1000万以下の双子素数の可視化された銀河図を作らせると、旧バージョンでは計算結果は正しかったものの、最終的にはブラックスクリーンになり、操作ができませんでした。しかし新バージョンでは完全な螺旋銀河が表示され、数字をクリックすると対応する光点に直接移動できます。3Dの武装飛行機を作る場合も、尾の噴射や脚の詳細まで再現され、スイッチを押すと脚が収まります。これにより、以前のV4 Proの性能が大幅に向上しました。しかし、短所も目立ちます。長いテキストを記憶する能力が非常に弱いです。10万字のネット記事を書かせると、途中で主人公が何度も地面を掃除するというような内容を書いているうちに記憶が混ざってしまい、前の段落で5回目と言っていたのに次の段落では4回目に戻ってしまいます。A株のリターンレポートを作る場合、ホームページには年間収益が15.1%と書かれているのに、挿入されたチャートでは17.8%となっており、数字が一致しません。これは、このAIが物を作る能力は非常に優れているが、記憶力が非常に弱いということです。短くて簡単な可視化や小さなツールの作成には適していますが、長い文書や大規模なレポートを書かせると、内容が矛盾する可能性が高く、最終的には自分で確認する必要があります。
4. 新モデルの方がコストがかかるのか?難しいタスクになると「外部チームを呼んで作業をさせる」
最も常識に反する点は、同じ14組のタスクで新モデルが62円かかり、旧バージョンが45円しかかからなかったことです。36%も高かったのですが、ブロガーがログを詳しく調べた結果、コストの使い道がわかりました。新モデルは複雑なタスクに遭遇すると「サブAI」を呼び出すことが多く、まるで自分で監督を務めてタスクをいくつかに分け、複数のAIに別々に処理させます。例えば、10万字のネット記事を書かせると、各章に専門のライターを割り当て、記事の字数をチェックしたり内容を修正したりします。小説を書くだけで、旧バージョンの4.5倍の文字数が消費されます。大型のサバイバルゲームを作る場合は13個のサブAIを呼び出し、それぞれが異なるモジュールを書き、最後に統合します。旧バージョンは1つのAIが最初から最後まですべてを書き終えますが、これらの追加コストはありません。これは、サービスプロバイダーにプロジェクトを依頼する場合に似ています。以前は1人のエンジニアが最初から最後まで作業をして50円を請求されましたが、今では10人のエンジニアに分けて作業をさせ、結果としては細部がより良くなるかもしれませんが、10人分の人件費がすべて請求されるため、自然とコストが高くなります。しかし幸いなことに、公式は9月10日に価格を下げると発表し、よく使うコンテンツのキャッシュ呼び出し料金を60%削減する予定です。その後は現在よりもコストが大幅に削減されるでしょう。