虎嗅

怎么一窝蜂就来了这么多“超节点”?

该文章尚未提供 日本語 解读,以下为中文版内容。

核心内容总结

国产AI芯片因为先进制程受限、高端HBM断供、CUDA生态壁垒等硬伤,正从“拼单卡性能”转向“拼系统级交付”——通过超节点、万卡集群等方式,把大量“不完美”的单卡连起来,凑成能满足大模型训练和智能体推理的巨型算力。但这条路并不容易:既要突破通信、散热的物理极限,还要解决软件生态迁移的成本问题,同时客户更务实,先看“能不能用”再谈性价比。此外,端侧算力(本地设备)也在崛起,端云协同成新趋势。

一、为啥突然流行“超节点”?模型变大+智能体烧算力,单卡扛不住了

以前厂商比的是单芯片的参数,现在为啥都在搞“把几百张卡绑一起”的超节点?核心是需求变了:

  • 模型越来越大:现在大模型参数到了万亿级,上下文窗口能装1兆以上的内容(相当于几十万字),单个芯片的内存和算力根本不够用。比如摩尔线程说“让256张GPU像一张卡工作”,华为昇腾950的统一内存编址,本质都是解决“单卡天花板”问题——人多力量大,用数量凑出大算力。
  • 智能体让推理算力暴增:以前是我们用AI(比如问ChatGPT),现在是AI自己用AI(比如智能助手帮你查资料,会自动调用多个模型),Token消耗呈指数级增长。百度云的人说,现在推理需求占了国产算力的大头,而且是高并发、长上下文的,必须靠超节点才能扛住。

不过也有人泼冷水:有些厂商搞万卡集群是为了“秀肌肉”,证明自己能出货,但实际商用场景里,8卡或16卡就够了,很多万卡方案还没真正落地。

二、系统级突围的第一道坎:物理定律卡脖子

把几百张卡连起来不是简单堆一起,首先要过物理关:

  • 通信速度的“三米魔咒”:要让几百张卡协同,数据传输得快且稳定。铜缆超过3米信号就衰减,所以得加粗线缆,但又会带来发热、重量问题。华为的灵衢协议、摩尔线程的MTLink都是想解决这个,但还是绕不开物理极限。现在大家开始用“光互连”(比如曦智科技的方案),光纤能把稳定连接距离拉到几十米,但成本高、技术还不成熟,铜缆短期内还是主流。
  • 散热和功耗的“烧钱坑”:超节点的功耗能到400千瓦(相当于一个小工厂),单柜功率轻松突破15千瓦,风冷根本压不住,液冷成了必须。但传统机房改液冷要换基础设施,还得停机,很多企业不敢动。华为的风冷超节点就是折中方案——不用改机房,直接上架,能扩到96卡,给传统客户留了条路。

这些物理问题不是技术能完全解决的,而是把单卡的问题转移到了系统层面,成本和复杂度都翻了倍。

三、软件生态:国产算力最难啃的骨头

客户买芯片不是看你参数多牛,而是看能不能跑自己的模型——这就绕不开CUDA生态的壁垒:

  • 模型迁移像“搬砖”:很多客户的模型和代码都是基于英伟达CUDA写的,换成国产芯片就得重写算子(相当于把积木拆了再重新搭)。开源模型还好,闭源模型可能要额外开发,成本高、耗时间。比如奕行智能说,迁移本质是“搬运工”的活,得投入大量人力。
  • 客户只认“能用”:百度云的人说,客户采购时根本不关心你是GPU还是TPU,只问三个问题:卡型、价格、能不能快速适配我的软件。昆仑芯走兼容CUDA的路线,就是因为客户不想换代码。但大部分国产芯片做不到完全兼容,迁移成本成了最大障碍。

四、客户到底要啥?先“能用”,再算经济账

国产算力的客户不是追求极致性能的创业公司,而是务实的大企业:

  • 第一关是“可用”:奕行智能说,很多芯片还停留在Demo阶段,扔到客户机房就出问题——“不可用,其他都是吹牛”。客户先拿自己的模型测试,性能过关了才谈价格。
  • 看总拥有成本(TCO):不是单卡便宜就好,还要算运维、散热、迁移的钱。比如万卡集群的功耗高,电费就是一笔大开销;迁移模型要雇工程师,也是成本。
  • 核心客户是“国家队”:运营商、金融巨头、电力系统这些客户,更看重合规、本地部署、供应链稳定,而不是单卡峰值性能。华为展示的案例里,客户关心的是“缩短30秒流程”“降低80%响应时延”,这些业务指标比跑分更重要。

推理场景是突破口:训练可以容忍慢点(比如多跑3天),但推理成本高10%就没竞争力,所以国产芯片都在抢推理市场。

五、端侧算力崛起:不只是云端的“缩小版”

今年WAIC上,端侧算力(比如AI PC、家庭AI中枢)占了三成,端云协同成了新趋势:

  • 端侧解决隐私和延迟:比如情感陪伴机器人,用户的私密对话不想上传云端,低延迟交互也需要本地计算。安谋科技说,端侧不是云端的缩小版,要在有限功耗和面积里死磕效率(比如存内计算)。
  • 端侧也搞“系统集成”:此芯科技的AGX平台,把CPU、GPU、NPU绑一起,还预装智能体OS;摩尔线程的AIBOOK是开发者个人智算平台,AICUBE是家庭AI中枢。这些都是把端侧做成“小超节点”,和云端分工:云端负责大模型训练,端侧负责本地推理。

端侧的崛起说明,算力不是只往云端集中,而是向“云+端”分散,给国产芯片多了一条路。

最后:突围还是绕远?

系统级路线是国产算力的必选项——单卡追不上英伟达,只能靠“团结力量大”。但这条路更重:物理限制、软件迁移、成本问题都是坎。展台上的参数再炫,最终要看客户机房里能不能稳定跑起来。国产算力要突围,得先把“可用”夯实,再慢慢优化成本,而不是急着和英伟达比峰值性能。毕竟,客户要的是能解决问题的工具,不是好看的参数。