核心内容总结
DeepSeek终于补上了多模态能力(能看图了),推出实验版模型Vision-Exp,价格依旧“亲民”(一分钱能看8张图),但用户实测效果却一言难尽:认不出自家创始人梁文锋(把他当成王兴、张一鸣)、把真人组合认成AI假图、复杂任务(如复刻网页)细节拉胯。虽然官方跑分接近顶级模型,但实际体验和实验室数据差距大。DeepSeek放这个“半成品”出来,是想通过用户测试收集反馈,为正式版铺路。
一、亮点:终于能看图了,还贼便宜
DeepSeek之前的模型只能处理文字,这次Vision-Exp补上了视觉短板——能直接认人、读截图、看图表。更关键的是价格:一张图最多算384个Token(可以理解成模型算钱的“小单位”),就算高峰期,一分钱也能看8张图。这延续了DeepSeek一贯的“低价风格”,让开发者和普通用户都能轻松尝试。
二、翻车名场面:认不出亲爹,把真人当AI
网友实测的“笑话”一堆:
- 认人失败:把DeepSeek创始人梁文锋的照片,先后认成美团王兴、字节张一鸣(王兴张一鸣:人在家中坐,锅从天上来);
- 怀疑真人:看时代少年团合照,说“五个人长得太像、皮肤太光滑,像AI生成的假图”;
- 复杂任务拉胯:让它生成Three.js三维场景,虽然成品比Gemini 3.7 Flash略好,但反复纠错、断联,消耗的“Token钱”是别人的15倍,耗时多3.5倍。
这些问题让网友调侃它是“睁眼瞎”,甚至用“破碎的好模型”形容。
三、跑分美如画,实际用着卡:实验室和现实的差距
官方数据说Vision-Exp的多模态能力接近Anthropic的顶级模型Opus,但为啥实际用起来差这么多?
- 实验室环境vs真实场景:跑分是在标准化测试里做的,而用户遇到的图片质量(模糊、合成)、任务复杂度(梗图、复杂网页)千奇百怪,模型应付不过来;
- 细节处理不足:比如复刻网页时,Vision-Exp只能搭个框架,色块、文字位置都不对,而GLM-5.3、Kimi K3能还原更多细节。
四、为啥放半成品?这是DeepSeek的“公开测试”套路
模型名字带“Exp”(实验版),说明DeepSeek自己也知道没打磨好,那为啥急着放出来?
- 控制成本:用V4-Flash(参数少、速度快)做底座,加视觉功能后价格依然低,开发者愿意大量测试;
- 收集真实反馈:实验室测不出来的问题(比如认不出梁文锋、看不懂梗图),用户用了才知道,这些反馈能帮正式版改进;
- 不影响老用户:旧版V4-Flash还能用,想尝鲜的用实验版,互不干扰。
这不是第一次:2025年9月DeepSeek就用V3.2-Exp测试新机制,两个月后才出正式版。
五、未来:这双“眼睛”还得练多久?
Vision-Exp的实验版暴露了不少问题:人脸识别不准、复杂任务细节差、不懂梗图背后的含义。DeepSeek需要把这些用户反馈一一解决,才能让正式版“不破碎”。到时候,梁文锋能不能从“滑动变阻器”变成“梁圣”,就看这双眼睛练得怎么样了。
总的来说,DeepSeek的多模态模型是“好牌但没打好”——方向对(补短板、低价),但细节还需打磨。实验版的意义在于试错,就看正式版能不能把这些坑填上。