核心内容速览
这篇报道相当于给当下热到发烫的大模型行业泼了盆清醒的冷水:现在所有主流AI产品(从GPT到国内的通义千问)的底层核心全是2017年谷歌提出的Transformer技术,它过去7年直接把AI行业推到了前所未有的高度,但现在已经摸到了天生的性能天花板。大家最近看到的“长上下文”“推理提速”等新功能,本质上都是在老技术的天生缺陷上打补丁,根本解决不了算力成本疯涨、能耗爆炸、复杂任务干不动的核心问题。
目前一批没有历史包袱的AI初创公司已经跑出了四条完全不同的技术突围路线,全都能实现大模型速度翻数倍、成本砍到几分之一,甚至能做到现在Transformer根本做不到的复杂推理任务,很可能就是下一轮AI行业的爆发风口,甚至会彻底改写现在AI行业的竞争格局。
---
详细通俗解读
1. 曾经的AI“神地基”,现在为啥成了拖后腿的累赘?
Transformer的核心优势,恰恰也是它现在最大的命门:它处理文本的逻辑特别“死心眼”——你输入1万个字,它就要让每一个字,都跟剩下的9999个字挨个做比对、算关联,相当于你读一篇1万字的文章,要把任意两个字的组合都琢磨一遍才敢确定全文意思。
这种模式精度确实高,但成本高到离谱:1万字就要做5000万次乘法运算,现在OpenAI一年光花在买算力上的钱就有500亿美元,国际能源署预测到2030年,全球数据中心的耗电量直接翻一倍,相当于凭空多出来大半个欧盟的用电量。
更麻烦的是现在AI要干的活越来越复杂:比如让它读一整个代码库、连续几周自主跑任务做科研、对着几十万道数学题做推理,Transformer的“死心眼”模式根本扛不住,现在大家靠堆服务器、堆补丁撑出来的长上下文功能,本质上就是给20年前的老电脑插10个外接硬盘想跑最新3A游戏,完全是权宜之计。
2. 给注意力机制“减肥”:砍掉90%没用的计算,性能还不打折
第一条路线最务实:不推翻Transformer的大框架,就盯着它最费电的“逐字比对”环节改,把没用的无效计算全砍掉。
以前也有过类似的“稀疏注意力”方案,但是砍完计算量之后AI理解语义的能力就崩了,现在两家初创公司已经把这个问题解决得差不多:
一家叫Subquadratic的公司做了个动态筛选机制,AI读文章的时候会实时判断哪些词是核心信息、哪些是没用的助词废话,只让重要的词之间做比对,没用的直接跳过,现在性能已经追平市面上的主流大模型,几万人排队等着试用。
另一家Manifest AI更绝,直接把传统的全量注意力换成了“滚动摘要”模式:就像你开3小时会做会议纪要,不用把所有人说的每句话都记下来,只需要不断更新当前讨论相关的重点内容,前面无关的旧内容自动删掉,不仅计算量直接降了一个量级,老的开源大模型甚至不用重新训练,改改底层代码就能用上这个功能,以后AI连续跑几周做任务、分析几小时的长视频都不会卡。
3. 反常识路线:不堆大模型,小模型反而更聪明还省电
现在行业里默认“大模型参数越大越聪明”,但Liquid AI这家由麻省理工孵化的公司直接反着来:他们把灵感来自蠕虫大脑的“液态神经网络”和Transformer拼在一起,做出来的模型体积只有普通大模型的几分之一,性能反而强4倍。
普通的Transformer大模型训练完就是个“刻好的光盘”,所有行为模式全固定死了,要加新能力只能重新训练、堆更多参数;但这个液态模型自带自适应能力,能边运行边根据新信息调整自己的思考逻辑,相当于人一边看新资料一边记新知识点,不用提前把所有内容都刻进脑子里。
现在他们的模型小到50块钱的树莓派开发板都能跑,车载的低端小芯片也能带动,年收入1000万美元以下的小企业可以免费用,相当于直接把大模型的使用门槛打下来了:以后不用啥任务都连云服务器,你手机本地就能跑一个性能很强的AI,根本不用怕隐私泄露、响应慢的问题。
4. 改掉逐字蹦的老毛病:让AI一口气输出整段内容,速度翻10倍
用过AI聊天工具的人都知道,AI是一个字一个字往外蹦内容的,要等半天才能出完整答案,这不是产品故意做的效果,是Transformer天生的限制:它必须算完第一个字,才能接着算第二个字,效率极低。
现在有公司把图像生成领域已经玩成熟的“扩散技术”搬来做文本大模型:以前扩散技术是把满屏雪花点直接一次性生成一整张高清图,现在改一改逻辑,能让AI把一堆乱序的词语,直接一次性转换成一整段通顺的话,不用一个字一个字憋。
现在创业公司Inception做出来的最新模型,性能已经对标2023年版本的GPT-4,生成速度直接快10倍,成本只有原来的十分之一,连谷歌都在跟进这条路线做原型产品,以后你问AI问题,刚敲完回车答案直接全出来,根本不用等它逐字加载。
5. 掀桌子的终极思路:不让AI用文字思考,直接用抽象逻辑解题
现在所有Transformer大模型都有个天生的“智商天花板”:它所有的思考过程都必须转换成文字序列才能完成,就像你做数独、下象棋的时候,非得在脑子里把每一步都念成“我下一步走第3行第5列的5”,不仅效率极低,很多没法用语言描述的抽象逻辑问题它根本解不出来。之前就有测试显示,主流大模型连一道超高难度数独题都解不对。
创业公司Pathway直接把Transformer的核心注意力机制全换掉,用“状态空间”的数学逻辑让AI把信息压缩成抽象的数学结构,不用非得转成文字才能思考,现在他们的模型已经能解出97%的超高难度数独题。这家公司的判断很直接:现在的大模型只能学现成的文字知识,要是想让AI真的搞原创科研、攻克癌症这种根本没有现成“解法手册”的难题,必须跳出“用文字思考”的死胡同,这才是下一代AI真正的终极形态。