虎嗅

英伟达、SK海力士:必须拿下CPO

该文章尚未提供 한국어 解读,以下为中文版内容。

核心内容总结

CPO(共封装光学)突然成了半导体行业的“香饽饽”——英伟达和SK海力士这两个分别握有算力和存储话语权的巨头,最近都在大力推进CPO技术。原因很简单:AI算力爆炸让传统数据中心的互连方式撑不住了。CPO把光模块和芯片封装在一起,解决了传统铜缆、可插拔光模块的功耗高、信号损耗大、带宽不足等问题,但目前还处于商业化早期,和可插拔光模块会长期并存。国内传统光模块公司面临挑战,但也能通过转型上游或布局过渡技术找到机会。

一、为什么英伟达和SK海力士都押注CPO?

两大巨头同时盯上CPO,背后是AI数据中心的“生死困境”:

  • SK海力士:发论文、画路线图,想超越内存(HBM)优势,在系统层面定义下一代AI基础设施。论文里明确了目标:每个节点带宽超100Tb/s、能耗低于1pJ/bit、延迟小于10纳秒,还规划了从2D到3D堆叠的技术路径。
  • 英伟达:直接推出量产的200G/lane CPO交换机,针对AI工厂。对比传统方案,它能让网络功耗效率提升5倍、AI应用不间断运行时间长5倍、故障间隔时间(MTBF)拉10倍——解决了超大规模AI集群最头疼的功耗和可靠性问题。

本质上,AI训练需要几十万张GPU同时工作,数据传输量爆炸,传统互连方式的瓶颈已经碰到底了,CPO是唯一能突破的方向。

二、CPO到底解决了传统互连的什么痛点?

数据中心的互连方式经历了三代,每一代都有致命问题:

1. 铜缆时代:便宜好用,但高速下信号衰减严重,传不远(最多几米),带宽一高功耗就飙升,完全扛不住AI集群的高密度需求。

2. 可插拔光模块时代:现在的主流,灵活(坏了直接换),但交换芯片到光模块之间还有一段厘米级的铜线,信号损耗大,光模块里的“信号放大器”(Retimer)要一直耗电,整机功耗居高不下。几十万端口叠加起来,功耗和损耗成了沉重负担。

3. CPO时代:把光模块(含激光器、探测器)和芯片封装在一起,电信号传输距离从厘米缩到毫米,直接避免了长铜线的损耗,还省了部分信号处理的功耗——功耗、延迟、可靠性全优化。

三、200G/lane的CPO是不是“落后”?

很多人疑惑:现在都谈800G、1.6T光模块了,英伟达才出200G,是不是慢了?其实这是两个维度的概念:

  • 200G/lane:指单条光通道的速率(一条线路能传多少);
  • 800G/1.6T:指单个端口的总速率(一个接口总共能传多少)。

总速率=单通道速率×通道数,比如8×100G=800G,8×200G=1.6T。所以200G/lane不是落后,反而是下一代高速互连的基础。

为什么要推200G?因为GPU带宽越来越大(比如从Hopper到Blackwell架构),交换机需要的总容量也爆炸。如果还是用100G通道,要达到102.4T的交换机容量,就得翻倍加通道,芯片面积会大到装不下,功耗也会失控——只能提升单通道速率。

四、国内光模块公司的“尴尬”与出路

英伟达的CPO供应链里,没有中际旭创、新易盛这些传统光模块大厂——因为CPO不需要独立的可插拔光模块了,光引擎直接集成在芯片里。但这不是“末日”,而是转型机会:

1. 守住基本盘:未来2-3年,云厂商还是以可插拔光模块为主(CPO渗透率现在才0.5%),继续做800G/1.6T/3.2T的可插拔模块,抓住AI算力建设的主流量需求。

2. 向上游延伸:跳出组装环节,布局光引擎、硅光子芯片、高速光芯片、光电封装这些CPO的高价值环节——比如天孚通信就进入了英伟达供应链,负责激光器组件组装。

3. 过渡技术NPO:NPO(近封装光学)比CPO技术难度低,更适合国内云厂商,是国内公司切入的好赛道。

CPO不会立刻取代可插拔模块,但产业链价值会向上游转移——国内公司只要选对方向,就能从“组装厂”升级为“技术玩家”。

总结

CPO是AI时代数据中心互连的必然趋势,但它和传统光模块会长期共存。对普通用户来说,这意味着AI训练会更快、更省电;对行业来说,这是一次产业链重构,抓住上游技术的公司才能笑到最后。

(全文完)