一、核心内容总结
这是科技博主对DeepSeek刚开启内测的V4.1 Flash大模型的实测报告:这款新模型主打全新架构、原生多模态能力,官方甚至直接在内测问卷里试探用户“它能不能替换掉之前定位更高的V4 Pro”。博主用旧版V4 Flash做对照,跑了14组任务、累计消耗相当于3亿汉字的模型调用量,最终发现新模型的看图、可视化落地能力提升非常突出,但也存在“打字快交活慢”、长内容容易前后记混、复杂任务反而更费钱的特点,并不是全方面碾压旧版的“完美升级款”。
---
二、分维度通俗解读
1. 最值得吹的升级:终于长了“自带的眼睛”,不用靠外挂工具猜图了
以前的旧版Flash本质是个纯文本选手,你丢一张图给它,它自己根本看不懂,得先调用第三方扫文字工具、再调用图像识别工具拼画面信息,折腾几十秒甚至十几分钟,最后还经常认错:比如海报上的黄牛认不出来,图里印的英文单词都能猜成完全不相关的词。
这次的V4.1 Flash是原生多模态,相当于眼睛直接长在自己身上了,扫一眼图5-7秒就能把内容说清楚,省掉了所有找外挂工具的时间,甚至还能自己判断“我画的图丑不丑”:之前让AI画鹈鹕骑自行车,经常画成带碗的天鹅,这次它自己能发现不对,主动去改鸟喙、调整姿势。
更厉害的是它能直接把图里的规则“搬成可运行的程序”:博主给了3张参考图,让它做一个水獭推箱子的小游戏,旧版折腾半天把地图改成7*7、主角换成橙衣小人,完全偏离参考图,新版直接1:1还原了水獭的蓝衣服、橙邮包,连地图格子数、每个角色的位置都和参考图一模一样,相当于以前你要做个游戏得先找个识图的、再找个写代码的,现在一个AI自己看一眼图就给你做出来了,省了好多中间对接的麻烦。
2. 纸面速度快3倍,为啥你等最终结果反而没快多少?它太爱“自我折腾”了
实测下来V4.1 Flash打字输出的速度是每秒200多汉字,是旧版的3倍,刚用的时候感觉特别利索,但测到后面博主发现,最后交活的总时间根本没快多少,甚至做小游戏的时候,它输出的有效字数更少,最后花的时间反而比旧版多4分钟。
拆开运行记录才发现,它把写代码省下来的时间,全拿去“自查返工”了:旧版写完代码直接就给你交差,错了就错了,它写完一行代码就调用工具跑一遍测试,看看有没有Bug,不对就改,光做小游戏的时候,它花在等工具验证代码的时间就有18分钟,是旧版的3倍。
相当于你找个打字速度是普通人3倍的实习生写PPT,他写完之后非要自己反复翻资料核对10遍,还找3个同事帮他查错,最后交稿的时间和打字慢的人差不多,你作为老板等的是最终能用的PPT,根本不关心他打字有多快,纸面的速度优势就这么被折腾没了。
3. 能力严重偏科:动手做东西是王者,记长内容是“鱼的记忆”
这次实测下来新模型的优缺点特别分明,偏科非常严重:
它的强项是“把想法落地成可运行的东西”:比如让它做千万以内孪生素数的可视化星系图,旧版算出来的数字全对,最后点进去画布是黑的,根本没法交互,新版直接能跑出完整的螺旋星系,点哪个数字就能定位到对应的光点;做3D武装飞机,连尾喷、起落架的细节都有,点开关还能把起落架收起来,效果直接把之前V4 Pro的烂表现给比下去了。
但它的短板也特别扎眼:长内容的记性差到离谱。让它写10万字的网文,写着写着主角扫了几遍地都能记混,前一段刚说扫第五趟,下一段就回到第四趟;做A股回测报告,首页写年化收益15.1%,下面插的图表里标出来的是17.8%,前后数字完全对不上。相当于这个AI是个动手能力超强的技术工人,但是记性特别差,你让它做短平快的可视化、小工具活特别好用,让它写长文档、大报告,大概率前后矛盾,得你自己最后核对一遍。
4. 新模型反而更费钱?它遇到难活就开“整个外包团队”给你干活
最反常识的一点是,同样14组任务,新模型花了62块,旧版只花了45块,贵了36%,博主翻完日志才搞懂钱花去哪了:
新模型遇到复杂任务的时候,特别爱开“子AI”,相当于自己当工头,把活拆成好几份,找一堆小AI分头干:比如写10万字网文,它一章派一个专属写手,写完还有人专门查字数、改内容,光写小说这一项,它消耗的输出字数就是旧版的4.5倍;做大型生存游戏,它直接开了13个子AI,分别写不同的模块,最后自己拼起来。
旧版就老实多了,从头到尾就1个AI自己写完,没有这些额外的开销。相当于你找服务商做项目,以前是1个工程师从头到尾给你做完收50块,现在这个服务商直接派了10个工程师分头赶进度,虽然可能活的细节更好点,但10个人的工时费最后全算你头上,自然就更贵了。不过好在官方9月10号就宣布降价,常用内容的缓存调用价格直接砍60%,之后用的成本会比现在低不少。