虎嗅

AI的一大重要瓶颈,被一家初创公司解决了

该文章尚未提供 العربية 解读,以下为中文版内容。

核心内容总结

主流大语言模型(比如ChatGPT)因为Transformer架构的“平方级计算量”瓶颈,处理长文本(如百万字文档、代码仓库)时会卡顿甚至算不动;初创公司Subquadratic推出的SubQ模型,用“动态稀疏注意力”把计算量从原来的“文本长度平方增长”降到“线性或对数增长”,第三方测试显示它能高效处理千万级Token的长文本,成本仅为传统模型的几百分之一,但也存在复用开源模型参数、未大规模开放等争议,可能会改变未来大模型的构建方式。

一、大模型的长文本“卡脖子”问题到底是什么?

你有没有试过让AI读一本1000页的合同?它要么答非所问,要么直接说“处理不了”。这不是AI懒,是它的“记忆力”有数学瓶颈:

主流模型用的Transformer架构,理解文本时需要把每个词(Token)和其他所有词算一遍关系(比如“它”指的是“动物”还是“马路”)。假设文本有n个词,计算量就是n×n(平方级)——文本长度翻倍,算力需求翻4倍;长度翻10倍,算力翻100倍。

比如处理100万字(约50万Token),要算2.5万亿次关系,GPU得跑好几分钟,成本几十美元;要是处理1200万字(600万Token),计算量会飙到360万亿次,成本直接上天。所以商用模型的“上下文窗口”(能处理的最大文本长度)一般卡在12-20万字,遇到整年度客服工单、几百个文件的代码库就歇菜了。

二、SubQ模型是怎么“砍”掉多余计算的?

原来的Transformer用“密集注意力”:每个词都要和所有词算关系,哪怕是完全无关的(比如“很”和“马路”)。SubQ用的是“动态稀疏注意力”,核心是:只算有用的关系,跳过没用的

和以前的“固定稀疏”(比如只看前后500个词)不同,SubQ加了个“智能筛选器”——模型自己学哪些词和当前词有关系。比如在“动物没过马路,因为它很害怕”里,模型会自动判断“它”只需要和“动物”算关系,不用管“马路”或“很”。这样计算量从n²降到了n×logn(比如100万词,计算量从1万亿次降到160亿次,砍了60多倍),千万级文本也能轻松处理。

三、SubQ的实际表现有多“能打”?

第三方测试给出了几个关键数据:

1. 长文本检索准:面对600万(约1200万字)和1200万Token的文本,找关键信息的准确率98%(几乎不会漏);

2. 速度快:比早期稀疏模型快56倍;

3. 成本低:处理同样任务,Anthropic的Opus模型要2600美元,SubQ只要8美元(差300多倍);

4. 能力不打折:编程测试得分89.7%,和OpenAI、Google的顶级模型在同一梯队。

简单说:以前算不动的长文本,现在SubQ不仅能算,还又快又便宜,能力还没下降。

四、SubQ的争议点在哪里?

虽然测试结果亮眼,但业内还有疑问:

1. 复用开源参数:SubQ不是从头训练的,而是用了中国开源模型Qwen的参数。有人质疑:它的好表现到底是因为“稀疏注意力”技术牛,还是因为Qwen的基础好?

2. 未大规模开放:目前SubQ只给少数用户试用,大部分人没法亲自验证效果,会不会是“实验室数据好看,实际用起来拉胯”?

这些争议让SubQ的“突破性”打了点折扣,还需要更多公开测试来证明。

五、这个突破可能带来什么改变?

如果SubQ的技术真的成熟,会颠覆现在处理长文本的方式:

1. 替代RAG方案:现在处理长文档用RAG(把文档切碎再检索),容易漏关键信息或破坏逻辑;SubQ能直接“吞”下整份文档(比如300页并购协议、1000个代码文件),不用切碎,逻辑更完整;

2. 降低长文本成本:以前分析千万字文本要花几千美元,现在只要几美元,中小企业也用得起;

3. 改变模型架构:就像2017年Transformer取代循环神经网络一样,SubQ的“动态稀疏注意力”可能成为未来大模型的标配。

当然,这一切还要看SubQ能不能解决争议,以及巨头(OpenAI、Google)有没有藏着类似技术。但至少,它给大模型的长文本能力打开了一扇新门。

总的来说,SubQ的突破是大模型发展的一个重要节点——如果它能站稳脚跟,未来我们用AI处理长文档、跨文档分析会像现在聊天一样轻松。但现在还需要更多验证,让我们拭目以待。