虎嗅

中美开源模型大会师:Kimi、Qwen、DeepSeek、Meta和英伟达五模大横评

核心内容总结

最近半个月,国内外开源大模型扎堆发布(国内Kimi K3、Qwen3.8-Max、DeepSeek V4 Pro;国外Meta Muse Glimmer、英伟达Nemotron3.5 Lightning)。作者将这5个模型放在同一环境测试,覆盖逻辑推理、代码画图、Agent自动解决问题、Blender 3D建模、写作五大任务,结果如下:

  • 综合能力第一:K3(十项任务六项满分);
  • 性价比之王:DeepSeek(能力不弱,价格极低);
  • 稳定型选手:Qwen(给够时间能完成,但思考慢);
  • 小模型局限:Muse、Nemotron适合简单任务,复杂任务拉胯。

整体开源生态越来越热闹,给用户更多选择。

1. 测试结果:谁是综合王者,谁靠性价比出圈?

这次测试里,K3是综合天花板——逻辑推理全对、地铁图网页带换乘动画满分、Blender中式庭院一次跑通,几乎啥都能干好。但它缺点明显:用一次要35美分(比DeepSeek贵8倍),速度也慢。

DeepSeek最让人惊喜:能力不算弱(密码锁放开上限全对、修bug满分),但价格低到离谱——加时赛五题全对仅花4美分,修bug一次才0.3美分。这意味着它能用白菜价解决复杂问题,性价比直接拉满。

Qwen则是“慢工出细活”:很多难题给够时间(比如放开输出限制)就能做对,但经常因为思考太长被截断,适合不着急的场景。

小模型(Muse、Nemotron)就尴尬了:简单任务(比如24点)又快又便宜,但复杂的密码锁推理到一半就超字数,直接交白卷;地铁图路线算错,账单清洗卡在编码问题上。

2. 各模型的特长与短板:没有完美模型,但各有千秋

  • Kimi K3:全能选手,适合高质量需求。画SVG图(熊猫坐单车撑伞一眼能认)、写地铁网页(换乘动画齐全)、建3D庭院(一次渲染成功)都出色,但贵且慢。
  • DeepSeek V4 Pro:性价比战神,适合成本敏感场景。修bug、洗账单这些工具任务做得又快又省,加时赛五题全对比Muse重试还便宜4倍。唯一小缺点:Blender脚本偶尔用废弃参数,导致跑不通。
  • Qwen3.8-Max:稳定型选手,适合耐心场景。地铁图放开上限后完成度很高,但经常因思考长被截断,需要多给点时间。
  • Muse Glimmer(Meta):小模型代表,适合简单任务。24点能做,但密码锁交白卷,SVG图画得让人看不懂,账单清洗卡在编码问题上。
  • Nemotron3.5 Lightning(英伟达):小模型,适合基础任务。24点做得快,但密码锁十次都没对,地铁图功能缺一半,写作摆脱不了AI味。

3. 大模型vs小模型:不是替代,而是互补

这次测试明确:大模型和小模型各有用处,不是谁取代谁。

  • 大模型(K3、DeepSeek、Qwen):适合复杂任务——多步推理(密码锁)、复杂代码(地铁网页)、连续工具调用(修bug)、3D建模(Blender)。这些任务小模型要么做不了,要么做得差。
  • 小模型(Muse、Nemotron):适合简单任务——基础计算(24点)、简单改写(物业通知变业主群消息),又快又便宜,没必要用大模型浪费钱。

比如加时赛里,Nemotron做24点十轮花不到10美分,但密码锁十次都没成;而DeepSeek作为大模型,一轮全对五题,虽比小模型贵点,但能解决复杂问题。

4. 开源模型扎堆发布:对用户和行业都是好事

最近半个月这么多开源模型出来,好处多多:

  • 更多选择:不用只依赖ChatGPT等闭源模型,现在有K3、DeepSeek等开源模型可选,适配不同场景(比如要高质量选K3,要便宜选DeepSeek)。
  • 性价比更高:DeepSeek拉低了模型使用价格,未来其他模型可能跟进,用户能用更少的钱用到更好的模型。
  • 推动技术进步:开源竞争让模型越来越强——阿里已上传Qwen3.8权重,Meta预告Muse Spark1.2即将发布,技术迭代会更快。

简单说:开源模型越多,用户越受益——不仅有更多工具,还能花更少的钱解决问题。

总结

这次测试让我们看到:开源大模型已经能和闭源模型掰手腕,且各有特色。对普通用户和企业来说,现在有了更多性价比高的选择,未来随着竞争加剧,模型会越来越好用、越来越便宜。这波开源热潮,绝对是用户的福音。