虎嗅

液冷为什么能成为模拟芯片新增长点

AI服务器“退烧”记:当风冷失效,液冷如何重塑芯片产业链?

大家好,我是你们的财经记者。今天我们要聊一个听起来有点“硬核”,但和每个人未来使用AI体验都息息相关的话题:AI服务器的散热革命。

如果你关注科技新闻,可能听说过NVIDIA的新芯片有多强,但很少有人注意到,为了不让这些强大的芯片“热死”,数据中心正在经历一场从“吹风扇”到“通水管”的彻底变革。这场变革不仅改变了数据中心的长相,更给半导体行业中的“模拟芯片”厂商带来了一波巨大的新机会。

下面,我将用大白话把这篇新闻拆解开来,带你看看这背后的逻辑和商机。

---

一、 为什么风扇不够用了?AI芯片的“热量危机”

首先,我们要搞清楚一个背景:为什么现在必须上液冷?

想象一下,25年前,一个标准的数据中心机架(就是放服务器的那个大柜子)功率只有5千瓦,大概相当于家里几台空调同时开。那时候,只要装几个大风扇,呼呼地吹,热量就散掉了。

但现在呢?随着AI大模型的爆发,GPU(图形处理器,也就是AI计算的核心)数量激增,单颗芯片的功耗也飙升。现在的机架功率已经超过100千瓦,未来甚至可能突破1000千瓦(1MW)。这是什么概念?这相当于一个小型工厂的用电负荷集中在一个柜子里。

这时候,单纯靠增加风扇风量已经没用了。风扇不仅噪音大、耗电高,而且空气的导热效率太低,根本带不走这么密集的热量。如果芯片温度过高,不仅性能会下降(降频),甚至直接烧毁。

于是,液冷登场了。NVIDIA作为行业领头羊,在最新的Vera Rubin架构中,直接取消了所有风扇,实现了100%液冷。简单来说,就是给芯片穿上“水冷背心”,让冷却液直接流经芯片表面,把热量带走。这就像你夏天太热,吹风扇不如直接喝冰水或者泡在泳池里来得快。

二、 液冷系统里,谁在“看门”?传感器的大爆发

液冷系统不像风冷那样简单粗暴。它是一套复杂的循环系统:冷却液从芯片(冷板)吸热,流到分配单元(CDU),经过换热、过滤,再流回去。在这个过程中,任何一个小环节出问题,比如管子漏了、水泵坏了、过滤器堵了,都可能导致服务器宕机。

因此,液冷系统需要大量的“眼睛”和“耳朵”,也就是传感器。

1. 温度传感器(最基础但最关键):

  • 以前我们只测CPU/GPU芯片本身的温度。
  • 现在,我们要测冷却液进出口的温度。为什么要测液体?因为通过计算进水和出水的温差,我们可以知道热量交换效率怎么样。如果温差变小了,说明散热效率低了,可能需要加快水泵转速。
  • 这里用到三类器件:RTD(铂电阻,稳定但贵)、热敏电阻(便宜灵活,适合夹在管子上)、集成式温度芯片(精度高,直接读数字)。液冷让测温点从“几个”变成了“几十个”,用量大增。

2. 压力和流量传感器(系统的“脉搏”):

  • 压力:就像人的血压。管路里压力异常,可能意味着阀门没开到位,或者过滤器堵了。一个CDU单元可能需要监测泵前、泵后、过滤器两侧等多个点的压力。
  • 流量:就像人的血流速度。数据中心里的冷却液流量很大(几十到几百升/分钟)。
  • 压差法:在管子里放个“节流阀”,测前后压力差算流量。简单便宜,但会阻碍水流。
  • 超声法:像B超一样,用超声波测水流速度。不阻碍水流,适合大流量,但技术复杂。
  • 电磁法:利用导电液体在磁场中产生电压。适合大口径管道,但要求冷却液导电。
  • 无论哪种方法,背后都需要模拟前端(AFE)、ADC(模数转换器)等芯片来处理信号。

3. 漏液检测(新增的“保险丝”):

  • 风冷服务器不怕漏水,液冷服务器怕。一旦冷却液漏出来,碰到电路板就是灾难。
  • 现在需要在服务器内部铺设漏液检测绳或电极。一旦液体漏出,电阻变化,传感器立刻报警。这是液冷系统特有的新增量。

三、 谁来“动手”?电机驱动成为新战场

如果说传感器是“眼睛”,那么电机就是“手脚”。

传统服务器主要靠风扇散热,风扇电机相对简单。但液冷系统里,有水泵(推动液体流动)、阀门(控制流量方向)、甚至压缩机(在某些冷却循环中)。

1. 水泵驱动:水泵需要精确控制转速,以匹配服务器的负载。负载高,水流快;负载低,水流慢,节能。这需要高精度的电机控制器、栅极驱动和MOSFET(功率开关管)。

2. 阀门控制:冷却液的分配靠阀门。智能阀门不仅要能开关,还要知道开到了多少度(位置反馈),这需要霍尔传感器等位置检测器件。

3. 能效关键:意法半导体(ST)指出,冷却系统可能占AI数据中心能源成本的40%。所以,电机驱动的效率和控制策略至关重要。谁能让水泵更省电、更精准,谁就有竞争力。

这意味着,芯片厂商不仅要卖传感器,还要卖完整的电机驱动芯片和控制MCU。

四、 巨头与新秀:芯片厂商如何抢滩液冷市场?

面对这个新市场,各大芯片厂商纷纷调整策略,有的做“全科医生”,有的做“专科医生”。

1. TI(德州仪器)和 NXP(恩智浦):全能型选手

  • 这两家巨头手里有大量现成的模拟芯片(ADC、放大器、传感器接口等),原本用于汽车、家电、楼宇自动化。
  • 他们的策略是“重新组合”。TI的Patrick Zeng说,我们不是从零开始,而是把在HVAC(暖通空调)领域验证过的技术,搬到数据中心液冷上。
  • 优势:产品成熟、可靠性高、上市速度快。他们提供的是“参考设计”,告诉客户怎么把这些芯片拼成一个完整的液冷监控系统。

2. ADI(亚德诺):高集成度专家

  • ADI推出了专门的芯片,如ADT7604。这是一颗“多合一”芯片,能同时监测20个通道的温度和漏液信号。
  • 优势:集成度高,减少了外围电路,适合空间紧凑的服务器内部。它把温度、漏液检测集成在一起,专门针对液冷场景优化。

3. ST(意法半导体)和 英飞凌:执行端强者

  • 这两家强项在于功率半导体和电机驱动。
  • 他们的重点不是传感器,而是泵、压缩机等大功率电机的驱动和控制。在液冷系统中,电机是耗能大户,也是控制核心,他们的技术优势在这里体现得淋漓尽致。

4. Allegro(艾利):传感器与驱动专精

  • Allegro不走MCU或通用ADC路线,而是专注于传感器接口和驱动。
  • 他们提供水泵驱动、电流检测、压力传感器接口、阀门位置检测等细分领域的芯片。这是一种“小而美”的垂直整合策略。

5. 国内厂商:快速跟进,寻找突破口

  • 圣邦微:推出了SGM451L,专门用于服务器温度监测,支持本地和远程(如CPU/GPU内部二极管)测温,精度很高。
  • 纳芯微:将液冷列为新方向,现有产品已覆盖压力、温度、电流检测和信号链。
  • 现状:目前国产厂商在液冷领域的“专用”产品还不多,多是既有产品进入新场景。但随着国内AI服务器放量,这是一个巨大的蓝海。

五、 未来展望:从“单点报警”到“智能融合”

最后,让我们看看未来的趋势。

现在的液冷系统,很多还是“单点思维”:压力超过阈值报警,温度超过阈值报警。

但未来的方向是“传感器融合”和“边缘AI”。

  • 多信号关联:泵电流、转速、压力、流量、温度、湿度,这些数据其实是相互关联的。比如,泵电流突然升高,可能不是泵坏了,而是过滤器堵了导致阻力变大。
  • 智能判断:未来的CDU(冷却分配单元)将内置具有AI能力的处理器。它不再只是看单个数值,而是综合分析所有信号,判断系统健康状态,甚至预测故障。
  • 芯片需求升级:这意味着,除了传感器数量增加,对高通道数ADC、高性能AFE(模拟前端)以及具备边缘计算能力的MCU的需求会进一步爆发。

总结

AI服务器的液冷化,不仅仅是一个散热技术的升级,更是一场模拟芯片产业的结构性机会。

  • 对于投资者:关注那些在温度、压力、流量传感器,以及电机驱动、高精度ADC领域有深厚积累的芯片公司。无论是国际巨头(TI, ADI, ST, NXP)还是国内新秀(圣邦微, 纳芯微等),都在这个赛道上加速奔跑。
  • 对于行业:液冷将成为AI基础设施的标准配置,相关产业链(传感器、泵阀、冷却液、控制系统)将迎来长期增长。

简单来说,AI越聪明,服务器越热,液冷越重要,模拟芯片越值钱。 这就是这条新闻背后的核心逻辑。