虎嗅

AI算力的路、油与交规

该文章尚未提供 Deutsch 解读,以下为中文版内容。

核心内容总结

中国AI基建正面临「政策长期规划」与「产业短期需求」的时间错配,以及「网络底座(路)、算力硬件(油)、制度标准(交规)」三者的协同困境:政策层以五年为单位升级网络(IPv6)、制定规则(算力标准),但产业层按月消耗算力、急需解决芯片瓶颈和调度难题;西部算力闲置与东部算力紧缺并存,高端训练算力被巨头垄断,中小企业难突围;最终需通过生态突围(自建芯片生态、优化调度效率)才能打破海外依赖,实现AI底座的自洽闭环。

一、政策慢 vs 产业快:时间错配是矛盾根源

政策和产业像两个不同节奏的时钟:政策按「年」走(比如IPv6五年规划、智算集群12-18个月投产),但AI产业按「月」跑(企业季度财报要算力、大模型按月迭代)。

  • 举个例子:某AI公司急需扩充推理算力应对业务增长,但新建智算中心要1年半才能用;IPv6升级按年度推进,跨省调度机制要多部门协商更久。中间没有缓冲,导致「急需的没有,有的用不上」。
  • 这种错配直接导致:西部智算中心利用率不足五成(晒太阳),东部企业却租不到算力(高价抢);企业宁愿囤积硬件赚短期租赁溢价,也不愿投入长期的调度优化(因为短期回报更确定)。

二、路、油、交规都缺:AI基建的三大短板

把AI基建比作「开车」:网络是路,算力硬件是油,制度标准是交规——现在三者都有问题:

1. 路(网络底座):升级中,但还没到智能高速

IPv6不是从零修路,而是把现有路改成「智能高速」,让各地算力能统一调度(比如东部用西部的算力)。但目前大量网络还是IPv4,跨地域调度像「不同省的公路不互通」,只能靠SRv6技术慢慢串联。

2. 油(算力硬件):缺的不是芯片数量,是质量和配套

  • 显存带宽卡脖子:GPU像工厂,显存带宽是「运原材料的传送带」。国产昇腾910B的传送带(1.6TB/s)比英伟达H200(4.8TB/s)慢2倍,导致GPU一半时间在等数据,训练效率低。
  • 配套跟不上:多机互联的「高速线」(HCCL vs NVLink)、光模块、液冷(AI集群功率太高,风冷扛不住)都紧缺。

3. 交规(制度标准):跨省调度的「隐形门槛」

  • 数据不能出省:东部实时推理业务的数据有属地要求,不能传到西部,即使西部有算力也用不了。
  • 利益分配问题:跨省调度涉及税收、GDP核算、能耗指标分摊(比如西部的绿电不能高效给东部用),没人愿意主动让算力流出去。
  • 标准不统一:不同芯片的算力怎么换算?比如昇腾和英伟达的卡,没有通用计量标准,导致交易混乱。

三、算力分层:巨头垄断高端,中小企业难突围

算力市场已经分成三层,中小企业很难往上走:

1. 高端训练(万亿参数级):巨头游戏

中国最强模型约1.6万亿参数,海外已到十万亿级。这层需要万卡级集群,边际成本远低于千卡级(比如1万台卡的成本比1000台卡的10倍还低),只有巨头玩得起。

2. 行业微调(中等规模):门槛下降但成本仍高

模型蒸馏、轻量化技术让成本降低,但企业还是要花不少钱;而且在国产芯片上适配模型要3-6个月,工程师成本可能比省的租金还高。

3. 推理业务:优质算力仍紧缺

普通离线推理门槛低,但高并发、低时延的实时推理算力还是抢不到。中小企业用便宜的异构算力,往往要承担额外的适配成本,「普惠算力」可能是伪命题。

结论:高端训练垄断格局短期难破,中小企业只能在推理侧分一杯羹。

四、交规落地难:标准博弈和利益牵绊

《算力标准体系建设指南》想解决「怎么算、怎么定价」的问题,但落地不容易:

  • 技术博弈:芯片厂商不愿统一标准

不同芯片架构(比如昇腾和英伟达)的底层逻辑不一样,统一换算标准会触及厂商的生态壁垒(比如英伟达的CUDA生态)。标准只能先从「服务评估」(比如算力租赁的质量)入手,底层硬件互换还得靠中间件生态——这正是国产芯片最缺的(没有像CUDA那样的通用工具)。

  • 利益博弈:地方和企业不愿让算力流动

地方政府建智算中心是为了GDP和考核,不愿把算力调给其他省;民营云厂商的算力是商业资产,也不想纳入公共调度平台(没好处)。

  • 考核机制问题:只看「建了多少机柜」,不看「用了多少」

地方政府考核数字经济时,重点是机柜数量,不是算力利用率或产业落地效果,导致很多智算中心建了却闲置。

五、生态突围战:谁能先从拼硬件到拼效率?

中国AI基建的终局,不是比谁建的集群多,而是比谁能在「路、油、交规」协同中,先实现「从拼卡数量到拼Token产出成本」的转型(Token是AI模型处理的最小单位,成本越低越有竞争力)。

  • 两种算力体系的博弈

1. 国资算力平台:执行力强,能承担跨省调度的制度成本,但运营效率低、市场化定价弱。

2. 民营云厂商:技术好、商业化敏捷,但不愿把算力纳入公共调度(没动力)。

谁能主导?要看政策能不能平衡「公共性」和「市场化」(比如给民营厂商补贴,让他们愿意参与调度)。

  • 破局关键:政策引导+生态建设

市场自发不会主动优化调度(因为囤积硬件更赚钱),需要政策工具:比如算力券补贴(鼓励企业用闲置算力)、能耗指标倾斜(给高效利用的中心更多电)、考核机制调整(看利用率而非机柜数)。

最终要回答:能不能脱离海外生态(比如英伟达CUDA),建立自己的芯片工具链和工程师生态?这才是AI底座的核心竞争力。

一句话总结

中国AI基建的矛盾,本质是「长期生态建设」和「短期商业利益」的拉扯,要破局需政策、企业、技术三方协同,从「拼硬件」转向「拼效率」,才能在全球AI竞赛中站稳脚跟。