虎嗅

Kimi K3之后,中国AI开始进入”高考时代”?

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

国产大模型Kimi K3在全球编程排行榜上拿了第一,但在真实开发场景(写能运行的BAT游戏脚本)中表现拉胯:免费版键盘控制不了角色,付费版连画面都出不来;而GPT-5.6 Codex一次就搞定。这暴露了AI行业的一个问题——过度迷恋“跑分”(考试能力),却忽视真实工作能力;背后是资本驱动的内卷,像过去互联网的补贴战。文章呼吁AI公司要跳出刷榜循环,关注用户真实需求和解决实际问题的能力。

1. 全球第一的Kimi,为啥写不出能玩的小游戏?

Kimi K3在WebDev Arena排行榜上拿了1679分,全球第一,听起来很牛。但朋友童佟的测试打了脸:让AI用BAT脚本写个能玩的ASCII版《小蜜蜂》(要求键盘控制、敌机移动),免费版K3虽然画出了游戏画面,但键盘控制不了;升级到699元订阅版,试了5次连画面都没正常输出。而GPT-5.6 Codex一次就写出能直接运行的程序。

这不是说K3整体不行,而是它在“偏门”(训练数据少、没标准答案)的真实任务上露了怯——因为这些任务考的不是“见过多少题”,而是“真的理解怎么做”。

2. AI行业得了“高考病”:刷榜厉害,干活不行?

文章把现在的AI发展比作中国教育:模型公司拼命刷各种排行榜(WebDev Arena、SWE-Bench等),就像学生刷高考题,分数越来越高,媒体和资本都兴奋。但一到真实工作场景就拉胯:代码写了跑不了,方案好看落地难,PPT漂亮执行漏洞多。

这不就像高考700分的学生,数学英语满分,却不会做PPT、谈客户、带团队?因为考试(刷榜)和工作(解决实际问题)根本不是一回事——排行榜有标准答案,真实世界却没有。

3. 为啥都爱刷榜?资本驱动的“循环游戏”

为啥所有公司都迷恋跑分?因为排行榜早已不是技术榜,而是融资成绩单。过去半年中国AI进入“月更时代”,Kimi、腾讯混元、阿里千问等每月都出新模型,不敢停。不是技术竞争激烈,而是资本竞争激烈:

  • 排行榜越高→估值越高(比如DeepSeek估值710亿美元)→融资越容易→买更多GPU、招更多人→训练下一个模型→再刷更高分。

这和十年前滴滴快的补贴大战、美团摩拜烧钱扩张一样,只是把“补贴”换成了“跑分”——大家都在为资本讲故事,而不是为用户解决问题。

4. 破局者:有人开始不玩“跑分游戏”了

不是所有公司都在刷榜。比如腾讯发布混元Hy3时,没重点提排行榜,而是强调真实业务场景;OpenAI过去一年也很少谈跑分,转而做Codex(能完成整个编程项目)、Agent(像人一样处理任务)等。

这些做法看似不震撼,却更接近真实工作:真正的程序员每天只有20%时间写代码,80%在调试、修Bug、改方案。AI的核心不是“第一次写出代码”,而是“能不能把事情做完”——就像Codex在测试中,不是代码写得漂亮,而是直接完成了能玩的游戏。

5. 中国AI的真正战场:不是排行榜,是用户的日常需求

文章肯定Kimi K3是国产模型的进步(第一次进全球第一梯队),但警告不要重复互联网内卷:过去拼流量、补贴、融资,现在拼参数、跑分、估值,本质没变。

真正的成功不是排行榜第一,而是用户愿意每天用。微信不是因为排行榜成功,抖音也不是因为参数第一——伟大产品赢在解决用户真实需求。AI的价值不是“替人考试”,而是“替人工作”:比如帮你写完代码还能调试好,帮你做方案还能落地执行。

最后一句话总结

Kimi K3是国模之光,但赢了排行榜不代表赢了未来。AI公司要跳出资本驱动的刷榜循环,把精力放在解决用户的实际问题上——这才是真正的竞争力。