虎嗅

算力还要继续建,但下一轮竞争已经转向交付

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

中国算力不是总量过剩,而是结构错配:一边是大模型训练、AI科研等需要的高质量算力(如高带宽集群、成熟软件生态)仍在短缺,另一边是很多已建成的算力资源因适配不足、调度困难、缺少客户等原因闲置。当前全国算力网已实现超过六成资源“可见”(纳入统一监测),但还没形成“可用”的端到端交付体系——即把物理算力转化为企业能调用、敢付费、可完成任务的服务。未来竞争的关键不是谁接入更多算力,而是谁能解决从资源到任务的转化问题。

拆解解读

1. 算力短缺变了:从“有没有”到“能不能用”

以前我们说算力短缺,是指“没足够的硬件设备”;现在的短缺是“有设备但用不上,或者找不到合适的设备”。比如企业想训练大模型,需要几百张同型号GPU组成的高速互联集群,但市场上要么找不到这样的集群,要么找到的集群软件环境不兼容;而有些地方的智算中心虽然装了很多GPU,却因为没接到匹配的任务,利用率只有30%左右。这种“边缺边闲”的状态,本质是供给和需求的结构不匹配——缺的是“高质量、能干活的算力”,闲的是“没适配好、没人用的算力”。

2. 监测≠可用:算力从“看见”到“用上”要过五关

全国超过六成算力纳入监测,只是让我们知道“哪里有算力、是什么芯片、当前忙不忙”,但这离企业能实际用起来还差得远。从“名义算力”到“付费使用”,要经过五层筛选:

  • 设备部署:硬件有没有装好上架?(工信部说整体上架率71.4%,意味着近3成设备还没装)
  • 平台监测:能不能在统一平台看到?(现在六成能看到,但分母还在增长,所以比例意义有限)
  • 接口调用:企业能不能通过API连接到这些算力?(很多资源接口不开放或不统一)
  • 任务运行:算力能不能跑通企业的模型?(不同芯片软件栈不同,比如A芯片能跑的模型,B芯片可能跑不了)
  • 客户付费:企业愿意为这个服务掏钱吗?(如果成本太高、稳定性差,客户不会买单)

每过一关,都会有一部分算力被淘汰,所以名义上的100P算力,真正能产生收入的可能只有30P。

3. 调度难在哪?任务要求和资源“不兼容”是关键

就算监测到闲置算力,也不一定能调度给需要的企业,因为任务和资源之间有很多“硬约束”:

  • 任务约束:比如大模型训练需要“高带宽、低时延”的集群,分散在不同地区的闲置GPU,就算加起来算力够,也没法临时拼成一个能训练的集群(就像零散的零件拼不成一辆车)。
  • 资源异构:不同芯片(GPU、NPU)的“操作系统”不一样,企业的模型要重新适配才能跑,成本很高(比如你用苹果手机的APP,没法直接装到安卓手机上)。
  • 数据合规:医疗、金融数据不能随便传到外地,只能在本地算,所以就算外地有闲置算力也用不了。
  • 成本问题:西部算力电价便宜,但如果把数据传过去的网络费、适配软件的钱比电价省的还多,企业也不会用。

这些约束导致:全国有多少闲置算力,和企业能调用多少,是两个完全不同的问题。

4. 全国算力网的边界:能缓解错配,但消除不了差异

很多人以为全国算力网建成后,所有闲置算力都能被利用,但其实它有自己的能力边界:

  • 能解决的问题:比如影视渲染、科学仿真这类“不着急”的任务(可以排队等),只要软件适配、数据能传,就能调度到闲置算力上。
  • 解决不了的问题:比如大模型预训练这类“紧耦合”任务(需要所有芯片同时协同工作),只能用本地的高质量集群,分散的闲置算力补不上。

所以,就算算力网完善了,“边缺边闲”也不会完全消失——高质量集群还是会缺,不适合承接复杂任务的资源还是会闲。算力网能做的是减少“信息不对称”和“交付能力不足”导致的闲置,而不是让所有算力都变成“通用货币”。

5. 下一轮竞争:从“拼硬件”到“拼交付”

以前大家比谁建的算力中心大、谁接入的算力多;现在要比谁能把物理算力变成“可交付的服务”——也就是企业付了钱,就能按时、按质完成任务。

未来的核心竞争力在于:

  • 硬件厂商:能不能提供稳定的集群和成熟的软件生态(让企业的模型能直接跑)?
  • 调度平台:能不能快速匹配任务和资源,解决适配、网络、结算等问题?
  • 运营商:能不能提供“有保障”的网络(比如承诺时延不超过多少,故障能快速恢复)?

谁能把这些环节打包成“可定价、可追责”的服务(比如“100P算力,3天完成训练,失败退款”),谁就能在未来的算力市场中拿到定价权。而现在最缺的,就是能把这些环节整合起来的“交付运营商”——没人对最终结果负责,客户只能自己对接各个环节,成本高、风险大。

最后一句话总结

中国算力建设还没结束,但重点已经从“建更多算力”转向“让算力能用起来”——谁能把“死”的硬件变成“活”的服务,谁就是赢家。