虎嗅

我们让Kimi K3、Qwen3.8-Max 和GLM5.2共同接管了一座屎山

该文章尚未提供 العربية 解读,以下为中文版内容。

核心内容总结

这篇文章通过一个真实测试,让三款中国开源大模型(GLM5.2、Kimi K3、Qwen3.8-Max)合作改造一个“屎山代码”(问题成堆的旧网站),测试它们在理解项目现状、解决实际bug、修改功能、设计审美、处理复杂后台流程等6个任务中的表现。结果显示:没有一款模型能全程领先,但中国开源模型的能力已经远超国外此前“需6-12个月追上”的判断,各自展现出不同的优势和短板,整体能应对复杂的实际开发需求。

详细拆解解读

1. 第一关:谁能先摸清“烂摊子”的真实现状?

测试任务:让模型分析这个半成品网站的当前状态(区分“已完成功能”和“旧文档里的计划”),避免重复劳动。

结果:Qwen最快最准(10秒内搞定,精准抓住最近在做的事);Kimi像中介,说的简洁但粗心数错数据;GLM懂底层结构(比如找到14个CMS集合),但把4月份的旧方案当成现在的需求,白忙活。

通俗解释:就像接手一个装修到一半的房子,Qwen是“天天盯现场的监工”,知道现在正在刷哪面墙;GLM是“翻旧图纸的老师傅”,但把去年的设计图当成现在的施工要求;Kimi是“快速带看的中介”,说的好听但细节错漏。摸清现状是干活的第一步,错了后面全白搭。

2. 解决实际问题:谁能真动手修bug和改功能?

测试任务:分两个小任务——①解决网站报错(启动前端没开CMS导致的问题);②修改轮播图和“最新观点”板块的颜色/动效。

结果

  • 报错处理:Qwen直接启动CMS解决问题(最快);GLM慢一步但复用了Qwen的服务(聪明);Kimi只给方案不动手(不及格)。
  • 轮播图:GLM功能最全(自动播+可拖动+真循环)但衔接有小跳帧;Kimi做了真循环但删了自动播;Qwen耍小聪明(复制多份内容伪装循环)还删了拖动功能(信任问题)。
  • 颜色修改:Qwen最完整(漏了悬停色);GLM只改了问过的部分(没问的全漏);Kimi几乎没动(没吃透任务)。

通俗解释:这就像修家电——Qwen是“直接动手修好的师傅”;GLM是“慢但会变通的师傅”;Kimi是“只说怎么修但不动手的顾问”。有的师傅会敷衍(Qwen伪装循环),有的会漏修(GLM),但都比只说不做的强。

3. 审美大PK:谁设计的首页更对“科技媒体”的味?

测试任务:重新设计网站首页Hero区域(保留内容,改排版/风格/动效),要求有专业感、前沿感。

结果

  • Kimi:科技极简风(用蓝色和几何动效,突出科技感)→ 赢了(切中硅星人“本质是AI”的定位)。
  • Qwen:现代媒体风(大标题+极简背景)→ 第二(像普通媒体但不够科技)。
  • GLM:杂志编辑风(衬线斜体+期刊元素)→ 第三(像杂志封面,偏离科技感)。

通俗解释:就像给服装店设计门头——Kimi知道你是卖科技潮牌的,用了未来感的设计;Qwen以为你是普通书店,做了简约风;GLM把你当成了时尚杂志,设计得像期刊封面。审美虽主观,但模型能不能理解你的核心定位很关键。

4. 复杂流程考验:谁能把后台审核系统改得更顺手?

测试任务:优化CMS审核工作台(集中显示待审核文章、右侧展开详情、不跳转页面操作)。

结果:Qwen做得最完整(所有信息都有,操作直接);Kimi最快但正文预览简化(需要跳转);GLM有大问题(正文区域显示图片加载失败)。

通俗解释:这就像给办公室改流程——Qwen把审核流程改得顺畅(不用来回跑);Kimi改了但没完全解决问题(还是要多走一步);GLM改完反而更麻烦(关键信息看不到)。处理多环节联动的能力,Qwen更胜一筹。

5. 最终总结:中国开源模型“能打”但各有长短

各模型优劣势

  • Qwen:快、准(对当前状态敏感),但有时敷衍(伪装循环)。适合想快速看到结果的用户。
  • GLM:稳(懂底层结构)、有创意(杂志风),但慢、易被旧资料干扰。适合需要深度分析的任务。
  • Kimi:创意好(科技风)、有时速度超预期,但粗心、细节漏改。适合需要审美和灵感的任务。

关键结论:国外曾说中国模型要12个月才能追上前沿,但这次测试证明,中国开源模型已经能处理“屎山代码”这种复杂实际项目,虽然不完美,但进步明显,能讲好自己的故事了。

这篇测试让我们看到:中国大模型不是“纸上谈兵”,而是能真正下场干活的——它们像不同风格的工程师,各有擅长,合起来能解决不少实际问题。对于普通用户来说,不用再迷信国外模型,中国开源模型已经足够用在很多场景里了。