核心内容总结
随着AI大模型向万亿参数演进,超大规模算力集群成为刚需,传统电互连因带宽、功耗瓶颈逐渐跟不上,光互连(用光线传输数据)成了AI基础设施竞争的新焦点。腾讯、华为等大厂纷纷布局,NPO(近封装光学)作为过渡到更先进CPO技术的“务实选择”,被行业广泛认可。同时,光互连赛道资本热度飙升,产业链从芯片到设备厂商集体卡位,但规模化落地仍面临标准不统一、封装工艺复杂等挑战,国产算力与光互连的结合也成了大厂重点布局方向。
一、光互连为啥成了AI算力的“新基建”?
AI大模型像个“吃算力的怪兽”,比如训练GPT-4需要几万颗GPU一起干活。这些GPU之间要快速传数据,传统用电线(铜缆)传的方式,一是速度慢(像乡村小路),二是发热大、耗电多(跑久了会“中暑”)。光互连用光纤传数据,就像把乡村小路换成了高速公路:速度快10倍以上,功耗却能降一半,还能支持更多GPU连在一起(比如从几千卡到几万卡的集群)。所以现在AI基础设施竞争,不再比单颗GPU多强,而是比“怎么把几万颗GPU高效连起来”——光互连就是解决这个问题的核心技术。
二、NPO:当前最接地气的光互连方案
光互连有几个技术路线,最先进的是CPO(把光模块和芯片装在同一个封装里,距离最近效率最高),但CPO技术难度大,需要先进封装工艺,国内暂时做起来费劲。NPO是CPO的“过渡版”:把光模块放在芯片封装附近(不是同一封装),既缩短了数据传输距离,又不用动现有芯片的封装工艺,对产业链改动最小。
举个例子:NPO去掉了传统光模块里的DSP(信号处理芯片),虽然对光引擎要求更高,但缩短的铜导线能减少信号干扰,刚好弥补损失,还能省成本和功耗。腾讯预计2026年四季度部署NPO超级节点,字节、阿里的超节点也用了NPO方案,说明行业已经达成共识:先搞NPO,再慢慢过渡到CPO。
三、产业链和资本都在抢光互连赛道
今年WAIC大会专门设了“AI光算力专区”,中际旭创(光模块)、源杰科技(光芯片)、曦智科技(光互连方案)等企业展示了从材料到设备的完整产业链。资本方面更热闹:
- 中际旭创通过港交所上市聆讯,准备融资扩产;
- 美国芯片巨头Marvell花32.5亿美元收购光子互连公司Celestial AI;
- 曦智科技登陆港交所,光本位科技等初创企业也拿到了新一轮融资。
TrendForce预测,2025年CPO/NPO市场规模约1亿美元,到2030年能涨到390亿美元以上——这赛道未来十年要翻390倍,难怪大家都在抢。
四、规模化落地还卡在哪?
光互连虽然前景好,但要大规模用起来还有不少“拦路虎”:
1. 标准不统一:各家大厂的NPO方案不一样,比如腾讯和字节的机柜设计不同,上游厂商要单独定制,成本高、周期长;
2. 技术难题:封装工艺复杂(光模块和芯片靠近装,散热、信号稳定都是问题)、光器件性能要求高(比如NPO需要更精准的光引擎);
3. 生态协同:光互连不是换个线就行,要GPU芯片、软件、设备一起改。比如GPU的接口要重新设计,端到端的系统方案才能落地;
4. 成本问题:目前NPO方案的定制化机柜成本偏高,普通企业用不起,需要推动标准化降低成本。
五、国产算力+光互连:大厂的“双保险”
腾讯除了部署NPO,还计划明年和后年大规模上国产算力,目的是降低AI推理的成本(国产算力比进口GPU便宜)。为什么要把国产算力和光互连结合?因为进口GPU的高端互连技术不对外卖,国内GPU厂商又没成熟方案,光互连刚好能填补这个空白——用国产算力+光互连,既能摆脱对进口的依赖,又能满足超大规模集群的需求。
不过沈亦晨(曦智科技创始人)也说,国产算力最缺的是“开放生态”:计算、存储、软件各环节要合作,不能各自为战,这样才能一起把光互连和国产算力的优势发挥出来。
总结
光互连是AI大模型时代的“必选项”,NPO是当前最现实的过渡方案,产业链和资本都在加速布局,但标准、技术、生态等问题还需要时间解决。未来几年,谁能先把NPO规模化落地,谁就能在AI基础设施竞争中占得先机。而国产算力和光互连的结合,可能会成为中国AI产业突破的关键。