虎嗅

中国算力过剩是个伪命题,但比它更危险的事正在发生

该文章尚未提供 日本語 解读,以下为中文版内容。

核心内容总结

这篇文章围绕摩根大通“中国80%数据中心闲置”的说法展开,澄清了一个关键误解:数据中心≠智算中心,不能用统一闲置率概括所有算力基础设施。文章指出中国AI算力的真实矛盾是“高质量有效算力不足,低效率算力过剩”——头部企业的高端算力仍紧张,但大量地方新建的智算中心因技术、生态、需求错位等问题利用率低。同时,文章还分析了国产算力的生态短板、需求从“训练”转向“推理”的趋势,以及地方建设中“算力地产化”的风险,最终强调中国AI算力已进入“拼效率而非规模”的新阶段。

拆解解读

1. “80%闲置”是个误区:别把数据中心和智算中心混为一谈

摩根大通的80%闲置率把传统IDC(服务器托管)、云计算中心、超算中心和智算中心(AI专用)全算在一起,这本身就不严谨。就像把“仓库、办公室、实验室”的空置率加起来说“所有建筑都空着”一样,没有意义。

真正值得关注的是智算中心的利用率:比如西部某千卡智算中心,上架率不足50%,已装服务器实际用起来的不到30%,一年运营成本还要3000万。业内有五种“利用率”的算法——装没装机器(上架率)、机器开没开(开机率)、芯片跑没跑满(GPU利用率)、模型训练实际效率(有效训练率)、有没有赚钱(商业利用率),不管哪种算法,都指向一个问题:账面算力(买了多少卡)≠实际能用的算力(真正产生价值的部分)

2. 纸面算力再高也白搭:就像1000辆自行车绑一起跑不过200辆汽车

地方宣传智算中心时喜欢说“投资多少亿、有多少机柜、多少张GPU卡”,但这些都是“纸面算力”。大模型训练不是堆硬件,而是系统工程:比如1000张卡的集群,如果互联带宽不够(就像路太窄,数据跑不动)、调度系统粗糙(就像没人指挥交通,卡之间互相等),实际效率可能还不如200张卡的精调集群。

举个例子:你买了10台高端电脑,但没装协同软件,也没人会用,它们只能各自闲置,没法一起完成复杂任务——这就是纸面算力和有效算力的差距。

3. 国产算力卡在哪?不是芯片不行,是“生态”跟不上

芯片出口管制后,很多智算中心用国产GPU/NPU,但问题不是“能不能跑模型”,而是“好不好用”。国际上AI计算的标准是英伟达的CUDA生态:围绕它有成熟的开发工具、优化库,工程师都会用,迁移成本低。而国产芯片的生态还没起来:企业要把模型迁到国产芯片上,得重新优化算子、适配框架,花的钱和时间可能比买进口芯片还多。

就像你换了新手机,但常用APP都不兼容,还得重新学操作——不是手机不能用,而是用起来太麻烦,企业自然不愿意大规模用。

4. 需求变天了:从“训练大模型”到“日常推理”,算力得跟着用户走

2023年大家争建智算中心,是觉得“谁有万卡集群谁就能卡AI产业脖子”,但现在市场变了:不是所有企业都要从零训练超级大模型,更多需求是“推理”——比如AI客服回答问题、图像识别、行业Agent(智能助手)。

训练算力可以放在西部(电价低),但推理算力必须靠近用户(比如城市里,这样响应快)。工信部要求“城域算力1毫秒时延圈”,就是让推理算力离用户更近。那些按“训练逻辑”建在偏远地区的智算中心,自然就没客户了——就像你在郊区建了个大工厂,但用户需要的是家门口的便利店,工厂只能闲置。

5. 别把算力搞成“新地产”:先建再找客户,AI基建等不起

很多地方把智算中心当“数字基建项目”:可以立项拿补贴、当招商名片、进国资资产负债表。但AI基建和传统基建不一样:传统基建(比如公路)建了慢慢等车来,AI硬件折旧快(芯片一两年就过时)、需求变化快,等你建完,客户需求可能已经变了。

全国已投运和在建的智算中心超过500个,2025年亿元以上项目就有222个。如果都是“先建再找客户”,最后只会变成一堆没人用的“算力孤岛”——就像盖了商场没人租,还得交物业费,越拖越亏。

最后一句话总结

中国AI算力的问题不是“有没有”,而是“能不能用好”。未来拼的不是谁有更多GPU,而是谁能把硬件、生态、电力、调度整合起来,让算力真正变成生产力。这才是中国AI产业下一阶段的分水岭。