虎嗅

半年20余倍增长,一个中国Token工厂的生意飞轮

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

这篇新闻聚焦AI产业从“训练大模型”向“推理用模型”的重心转移,以无问芯穹这家“token工厂”为案例,解析其如何通过软硬件协同优化,在芯片与模型之间充当“超级调度员”,提升token生产效率和稳定性,形成“优化→降本→获客→再优化”的增长飞轮。同时,国产芯片在推理细分场景(如Prefill)迎来机会,未来小而强的AI型组织(人与AI深度协作的团队)将成为产业变革的核心力量。

一、AI产业变天:从“建工厂”到“生产产品”

过去三年,AI行业的焦点是“训练大模型”——就像建工厂,谁有更多GPU、更大模型谁就厉害,英伟达H100芯片一度被炒到天价。但从2025年底开始,风向变了:推理需求(用模型干活)超过了训练需求

  • 数据说话:2026年全球企业在推理基础设施上花680亿美元,比训练的450亿多30%。
  • 为什么推理需求爆发?因为AI不再只是聊天,而是要干复杂活:写代码、审合同、跟进项目,这些场景消耗的token是聊天的几十到上百倍。无问芯穹的数据显示,95%的token需求来自智能体场景(AI完成完整任务)。
  • 结果:产业链价值重心下移,原来的“管道”(基础设施)变成“工厂”(token生产),谁能高效把算力转化为有用的token,谁就更有话语权。

二、无问芯穹的“token工厂”:芯片与模型之间的“超级调度员”

无问芯穹的模式很独特:它不做芯片、不做通用大模型、不做C端应用,而是坐在芯片和模型中间,帮大家“用好算力”。

  • 核心作用:把各种芯片(国产、进口)和模型(不同规模)的资源调度起来,优化匹配,让每一份算力都能更高效地生成token。比如万亿参数模型跑起来需要多卡协作,它能把任务拆分给合适的芯片,避免资源浪费。
  • 壁垒在哪里?①中立第三方:不绑定单一芯片或模型,能覆盖全生态;②系统化优化:不是单点改代码,而是从算法到硬件的整体协同;③持续创新:提前研究Prefill/Decode分离等前沿技术,总能跟上产业变化。
  • 效果:万亿参数模型场景下,token生产性价比提升了5-10倍,稳定性也大幅提高(少宕机)。

三、赚钱飞轮:按token计费,越用越划算

无问芯穹的商业模式围绕“token”展开,形成了一个正向循环:

1. 优化降本:通过技术优化,让token生产更便宜、更稳定。

2. 获客增长:优质token吸引更多客户(模型厂商、应用公司),token调用量增速超过20倍。

3. 再优化:更多客户带来更多真实场景,能找到更多优化空间(比如不同模型和芯片的组合),进一步降本。

  • 计费方式:按token收费,像广告行业的CPM(每千次展示),用户不用关心底层用什么芯片,只看token对应的价值(比如写了多少行代码)。这种方式让公司毛利率提升,再投入研发,形成良性循环。

四、国产芯片的机会:在推理细分场景“发光发热”

国产芯片不再是“能不能用”的问题,而是“在哪里用最合适”。

  • 推理分两个阶段:Prefill(理解输入,计算密集)和Decode(生成输出,通信密集)。国产芯片在Prefill场景已经能落地,因为它更擅长计算密集型任务,而Decode对通信带宽要求更高(目前进口芯片更占优)。
  • 优势:国产芯片成本敏感、工程化能力强,能快速适配不同场景。比如无问芯穹把Prefill任务分给国产芯片,既解决了算力缺口,又让国产芯片有了真实用武之地。
  • 未来:随着推理需求分化,国产芯片会在更多细分场景找到机会,不再依赖“替代进口”的叙事,而是靠实力竞争。

五、未来趋势:小而强的AI型组织将成主流

夏立雪把token爆发比作移动互联网从3G到4G的阶段,但核心变化不是某款APP(比如微信),而是组织形态

  • 什么是AI型组织?十人、二十人的小团队,充分用AI协作(比如AI写代码、AI审质量),效率远超传统同规模团队。这类组织已经出现,比如用AI做代码生成的小公司,不同AI分工协作,产出比传统团队高很多。
  • 为什么?AI已经突破“能用”的临界点,能完成子任务、记住长上下文,像“大脑”一样指挥工作。未来,完成数字化转型的行业(比如代码、线上营销)会先出现这类组织,它们是token时代真正的“杀手级应用”。

结语

AI行业终于开始“认真算账”了:不再只看模型有多牛,而是看能不能用AI产生真实价值。无问芯穹的“token工厂”模式,正是抓住了推理需求爆发的机会,通过优化算力转化效率,让AI从“实验室”走向“生意场”。而国产芯片和AI型组织的崛起,将推动整个产业进入更务实、更高效的阶段。