虎嗅

芯片换了战场,中国公司开打Token仗

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

这篇文章聚焦曦望Sunrise这家从商汤孵化的AI芯片公司,它抓住了AI推理需求爆发的风口,反共识砍掉训练模块,专注做推理专用GPU。通过大显存、高兼容、软硬协同等设计,帮客户降低Token成本(Token是AI干活的计量单位,烧Token=花钱让AI做事),针对不同客户提供差异化解决方案。同时,国产模型与芯片的高契合度让中国方案在全球市场从“追赶”转向“并跑”,文章还探讨了推理赛道的竞争、商业模式和未来机会。

一、推理需求为啥突然“火出圈”?

简单说:AI“大脑”造好了,现在要让它天天干活

  • 训练vs推理:训练是“造聪明大脑”(比如GPT-4训练一次花大价钱),推理是“让大脑干活”(比如ChatGPT每天推理烧70万美元,一年2.5亿)。过去大家都在砸钱训练,现在大脑够聪明了,干活的需求爆发——德勤预测2026年推理会吃掉全球AI算力的2/3。
  • Agent是关键推手:AI智能体(Agent)要自己规划、调用工具、反复修正(比如帮你写方案要查资料、改草稿),一个任务消耗的Token是普通对话的几十倍;24小时监控的Agent更是不停烧Token。
  • 上下文变长“卡脖子”:AI生成文字要回头看前文(比如写文章不能忘开头),百万Token的上下文要占上百GB显存,传统芯片存不下、传得慢,推理需求自然炸了。

二、曦望的GPU:怎么让Token“更便宜”?

核心思路:解决“存不下、传得慢、效率低”的问题

  • 大显存“装得多”:不用训练芯片常用的HBM内存,选消费电子的LPDDR(低功耗),最高600GB(国内最大),能存更多前文记忆,还能灵活适配边缘设备到云端。
  • 高通信“跑得快”:用最新的PCIe Gen6通道(双车道变四车道),数据进出速度翻倍;分层管理“前文记忆”(常用的放手边,不常用的存仓库),多个用户同时用不抢资源。
  • 高利用率“不摸鱼”:砍掉训练模块,把资源全给推理,算力利用率稳定在95%(传统GPU可能只有30%,像100人工厂只有30人干活)。
  • 集群+兼容“稳又灵”:256颗芯片连成“超级芯片”,扛住大模型高并发;对主流生态兼容99%,客户不用改代码就能用(像换电脑不用重装软件)。

三、推理GPU的生意:谁在买?怎么赚钱?

客户分四类,各有痛点,曦望精准匹配:

  • 智算中心:怕GPU“闲”——要每块钱、每瓦电出更多Token,让卡24小时不停跑。
  • 互联网/AI公司:怕“卡”——高并发时用户多不卡顿,愿意为低延迟付费。
  • 央国企/民企:怕数据泄露——要本地部署,上下文长(比如处理长合同)。
  • 垂直行业:缺AI专家——要开箱即用的解决方案(比如制造、医疗的AI应用)。

赚钱逻辑:帮客户降Token成本,客户付费覆盖成本+利润,再投入研发。Token服务分“高价值”(编程、医疗,毛利60%+)和“低价值”(聊天、摘要,毛利20%以下),差异化定价。

四、国产芯片的机会:从“追赶”到“换道并跑”?

中国方案的优势很实在:

  • 契合度高+价格低:国产模型Token价格是国外的1/6-1/10,比如智谱上市后市值涨20倍,靠的就是“国产模型配国芯”。
  • 海外认可:欧洲、中东、硅谷公司用中国开源模型(比如DeepSeek),买中国服务器和芯片——不是被迫替代,而是“更划算、更安全”的选择。
  • 叙事转变:从“倒逼国产替代”变成“换道并跑”,中国芯片和模型一起成长,进入全球竞争。

五、推理赛道的未来:竞争、趋势和被低估的机会?

  • 竞争格局:分四类玩家——海外巨头(贵、供应不稳定)、训推一体(兼顾训练,但推理不是专长)、ASIC(专用但模型一变就废)、曦望(推理专用+通用兼容)。
  • 未来趋势:Token会像流量一样越来越便宜,但高价值Token(Agent、医疗)价格会涨(需求爆发快于供给);成本下降会让更多应用跑起来,总需求反而变大。
  • 被低估的机会

1. 存储:推理中存储成本占比最高,大容量、低成本内存被严重低估;

2. 能效:数据中心是“电变Token”工厂,省电(液冷、供电)很关键;

3. 高质量数据:AI要和实体世界互动(比如自动驾驶),需要新的实景数据,未来会出现头部数据公司。

这篇文章本质上是在说:AI行业从“烧钱造模型”进入“算账跑业务”的阶段,推理芯片是这个阶段的核心——谁能让Token更便宜、更稳,谁就能抓住机会。而国产芯片,正在这个赛道上跑出自己的优势。