核心内容总结
昨天硅谷一夜发生的三件AI大事(Google发布Gemini 3.8 Flash、Meta更新Muse Spark1.3、初创公司Mostik登WIRED),表面是模型能力刷新榜单,实则指向AI推理成本的“多维降价革命”:从“高端能力平价化”到“减少任务无用功”,再到“跳过自然语言直接传内部数据”,AI经济学正在从“按token收费”转向“按真实任务成本计价”,智能正变得越来越便宜,未来可能催生大量之前不划算的AI应用。
一、Google:高端AI能力塞进“平价套餐”,同水平任务成本差5倍
Google的Gemini 3.8 Flash,本来是“快且便宜但能力弱”的系列,这次却把顶级AI的软件工程能力(比如在DeepSWE测试里完成几十步代码任务)压进了Flash的低价区间。
- 成绩:在DeepSWE上拿到74%(和最顶级的Claude Opus5持平);
- 成本:完成一个任务平均只要2.36美元,而Claude要11.84美元(贵5倍),GPT要6.46美元(贵近3倍)。
为什么这很重要?Agent时代,AI不是聊几句就完,而是要连续跑几十上百步(比如写代码、做研究),累计成本差几倍就会影响企业敢不敢用。Google甚至说,因为token够便宜,允许模型“多思考”(主动跑更长的推理流程),不用为了省钱“少想事”。
二、Meta:AI少犯错=直接省钱,减少无用功比跑分更重要
Meta的Muse Spark1.3,跑分从55%跳到75.4%(超过Google),但更关键的是两个数字:工具调用少20%,token消耗少25%。
- 省钱逻辑:Agent最浪费钱的是“跑偏”——比如代码AI理解错需求,白改5个文件、跑3轮测试,几十次工具调用和几万token就白费了。现在Muse能更早发现歧义(主动问用户)、知道自己不会(请求帮助)、记住初始约束(不跑偏),这些都直接省了无用功的成本。
- 本质:Chatbot时代跑分涨20分很性感,但Agent时代,“少犯错”比“多会做”更能直接换算成钱。
三、Mostik:模型之间不用“说话”了,直接传“脑电波”省20倍成本
Mostik干了一件“反常识”的事:让两个AI模型不用自然语言交流(比如中文/英文),直接传内部的“数学信号”(专业叫latent representation)。
- 比喻:现在模型交流像“电脑A把文件打印成纸→电脑B用摄像头扫描回来”,Mostik直接让它们传数据文件,扔掉打印机和扫描器。
- 实验结果:把大模型GLM-5.2(753B参数)和小模型Qwen3.5(4B)桥接,能力介于两者之间,但成本只有GLM的1/20。
- 难点:不同模型的内部“语言”不一样(架构、参数不同),要让它们互相理解很难,但1/20的成本降幅已经足够让人兴奋。
四、未来:手机里只要tiny模型,复杂活叫云端,成本再降N级
过去大家想把大模型塞进手机(比如7B→4B→1B),但Mostik的路线如果跑通,未来手机可能只需要0.xB的小模型:
- 分工:本地小模型负责简单高频任务(比如理解你在哪个App、当前状态),碰到复杂问题,直接传“压缩的内部信号”给云端大模型;云端处理完,再传信号回来,不用像现在传几万token的文字。
- 影响:这种架构会彻底改变AI计算方式,成本下降幅度不是“降30%”,而是“降一个数量级”——比如现在一个任务几十美元,未来可能只要几毛钱。
结语:智能便宜到“随便用”时,才是真正的爆发
这三件事的共同点是:AI成本不是在“线性降价”,而是在“从根上重构成本结构”。当智能便宜到“几毛钱就能让Agent帮你做件事”“几十个Agent 24小时围着你转也不贵”时,很多现在看起来疯狂的应用(比如个人专属AI团队、全场景智能助手)就会从“不可能”变成“日常”。比起谁又拿了榜单第一,更值得关注的是:这么聪明的AI,最后能便宜到什么程度?
(全文用大白话拆解,避免专业术语,让非财经/AI背景的人也能看懂AI成本革命的逻辑和影响。)