虎嗅

存力接棒算力,HBM为什么“脱颖而出”?

从“算力”到“存力”:AI硬件下半场,谁在卡脖子?

大家好,我是你们的财经记者兼经济学者。

最近,如果你关注科技圈或股市,可能会发现一个有趣的现象:以前大家炒AI,眼睛都盯着英伟达的GPU(显卡),觉得那是“大脑”,是核心。但到了2025年下半年,风向变了。内存(DRAM)、闪存(NAND)和硬盘这些原本被视为“配角”的存储设备,突然成了主角。

为什么?因为“存力”成了新的瓶颈。

简单来说,以前是“算得不够快”,现在是“存得不够多、读得不够快”。这就好比一个超级厨师(GPU),刀工再快,如果食材(数据)从冰箱(内存)里拿出来的速度跟不上,厨师也只能干等着。

今天,我们就用大白话,把这篇关于HBM(高带宽内存)的深度研报拆解开来,看看这轮“存力”革命到底是怎么回事,以及它背后藏着怎样的商业逻辑和投资机会。

---

一、 为什么AI突然“吃”内存吃得这么凶?

很多人有个误区,觉得AI就是算数,跟存东西没关系。其实大错特错。AI对内存的需求,不是线性增长,而是指数级爆炸。这主要源于三个“胃口”变大了:

1. 模型本身变“胖”了(参数存储)

你可以把AI大模型想象成一个超级复杂的字典。以前这个字典只有几百万字,现在变成了几万亿字。

  • 数据说话:以通义千问(Qwen)为例,从第一代到最新的Qwen3.8 Max,参数量翻了约30多倍。
  • 后果:光是把这个“字典”本身装进内存里,需要的空间就从135GB涨到了2300GB(约2.3TB)。这还没开始干活呢,光“站着”就占了一大块地方。

2. 聊天记忆变“长”了(KV缓存)

这是最容易被忽视,但最耗内存的部分。当你和AI聊得越多,它需要记住的“上下文”就越多。

  • 比喻:就像你和一个朋友聊天,如果你们聊了100页,他得把这100页的内容都记在脑子里,才能接上下一句。
  • 现状:虽然软件技术在进步,能压缩记忆,但现在的AI上下文长度(Context Window)已经能处理几十万甚至上百万字的内容。
  • 叠加效应:如果同时有32个人在和AI进行超长对话,光是这些“聊天记忆”加在一起,就需要1.3TB的内存。加上模型本身的2.3TB,一个模型实例就要吃掉3.6TB的内存!

3. AI Agent(智能体)的“杂活”

现在的AI不只是回答问题,它还要帮你写代码、操作Excel、发邮件。这些操作产生的临时文件、日志、中间数据,虽然不需要最高端的HBM,但也会极大地消耗普通的内存和闪存空间。

总结:以前是“算得快”最重要,现在是“装得下”和“读得快”同样重要,甚至更关键。

---

二、 为什么HBM成了“宠儿”?普通内存不行吗?

既然内存这么重要,为什么不用我们电脑里常见的DDR5内存,非要搞个昂贵的HBM(High Bandwidth Memory,高带宽内存)?

这就得看两个核心指标:容量和速度。

1. 普通内存的“物理极限”

  • 制程难突破:内存芯片的制造工艺很难像CPU那样做到2nm、3nm。因为物理规律限制,内存颗粒做得太小,电子会“乱窜”,导致数据出错。目前内存制程卡在11-12nm,未来几年也就到10nm。
  • 空间有限:既然单个颗粒做不大,那就多放几个。但是,GPU芯片周围的空间非常宝贵,像寸土寸金的市中心,没法像普通主板那样把内存条平铺在四周。

2. HBM的“黑科技”:立体停车库

HBM的聪明之处在于,它不跟CPU/GPU抢平面空间,而是向上堆叠。

  • 垂直堆叠:想象一下,普通内存是平铺在地上的平房,HBM是盖在GPU旁边的“立体停车库”。它把12层甚至16层内存芯片像千层饼一样叠在一起。
  • 硅通孔(TSV):为了打通这些层,工程师在芯片上打了无数个垂直的小孔(TSV),里面灌满铜,让信号能上下直通。
  • 结果:在同样大小的面积上,HBM能塞下比普通内存多好几倍的容量。

3. 速度为什么快?

  • 位宽极大:普通内存一次只能传32位数据,HBM一次能传1024位甚至2048位数据。这就好比普通公路是单车道,HBM是1000车道的高速公路。
  • 距离极短:HBM是直接“贴”在GPU芯片上的(通过硅中介层封装)。数据不用跑远路,就在隔壁房间传递,所以延迟极低,速度极快。

一句话总结:HBM就是为了解决“空间不够”和“速度不够”这两个死结而诞生的“特供版”内存。

---

3. HBM的技术难点:为什么这么难造?这么贵?

HBM虽然好,但制造起来简直是“地狱难度”,这也是为什么它比DDR5贵好几倍的原因。主要有三个大坑:

1. 堆叠工艺:像搭积木一样精细

  • 打孔难:要在薄薄的硅片上打几千个垂直孔,还要保证不偏不倚,还要散热,还要通电,难度极大。
  • 焊接难:这12层芯片怎么粘在一起?
  • 海力士(SK Hynix)用的是MR-MUF工艺(回流焊+液态树脂)。就像一次性把所有积木叠好,然后浇上胶水固化。优点是效率高、良率高、散热好。
  • 三星/美光用的是TC-NCF工艺(热压+非导电膜)。就像一层一层地压,压一层粘一层。缺点是步骤多、容易出错、良率低。
  • 竞争格局:海力士因为掌握了更高效的MR-MUF工艺,所以在HBM领域目前占据优势,毛利率更高。三星和美光则想通过研发下一代“混合键合”技术来弯道超车。

2. 封装工艺:必须和GPU“结婚”

  • 硅中介层(Interposer):HBM不能单独卖,它必须和GPU芯片一起封装在一块特殊的硅板(中介层)上。
  • 精度要求极高:这块硅板上的线路宽度只有1微米(头发丝的1/70),PCB板(普通电路板)根本做不出来,必须用半导体晶圆工艺。
  • 产能瓶颈:这块硅板和封装过程,主要依赖台积电(TSMC)的CoWoS产能。也就是说,你有多少HBM,不光看内存厂,还要看台积电给你多少封装名额。

3. 基底层(Base Die):从“通用”变“定制”

  • 以前:HBM底部的基底层很简单,内存厂自己就能做。
  • 现在(HBM4):基底层变得很复杂,需要12nm甚至更先进的工艺,内存厂自己做不了,得找台积电代工。
  • 更关键的变化:基底层不再是通用的了。英伟达、AMD等大客户会根据自己的需求,定制基底层的设计。
  • 比如英伟达的NVHBM,用了私有协议,带宽提升30%,功耗降低15%。
  • 这意味着,HBM不再是标准化的“商品”,而是半定制的“零件”。

---

4. 产业链格局巨变:内存厂不再“独大”

这一轮HBM革命,彻底改变了内存行业的权力结构。

1. 内存厂的“独立性”下降

以前,内存厂(如三星、海力士、美光)是绝对的主角,从设计到生产一条龙。

现在,HBM的生产链条变成了:

  • 内存厂:负责制造内存颗粒和堆叠。
  • 台积电:负责制造基底层(Base Die)和最终的封装(CoWoS)。
  • 终端客户(如英伟达):参与基底层的设计,决定规格。

后果:内存厂的话语权被稀释了。如果英伟达明天换供应商,或者台积电产能不够,内存厂再厉害也发不出货。

2. “共同富裕”还是“价值转移”?

  • 短期看:因为AI需求爆发,整个蛋糕变大了,内存厂、台积电、英伟达都赚得盆满钵满。海力士、美光的股价半年涨了10倍,就是证明。
  • 长期看:随着定制化加深,内存厂可能逐渐沦为“代工厂”角色,核心价值向设计和封装端(台积电)以及拥有定义权的终端客户(英伟达)转移。内存厂的利润率可能会受到挤压。

3. 投资逻辑的变化

  • 以前:买内存股,看的是周期(涨价/跌价)。
  • 现在:买内存股,要看的是技术壁垒(谁的堆叠良率高?谁和英伟达绑定深?)和产能协同(谁能拿到台积电的封装名额?)。
  • 海力士:凭借MR-MUF工艺优势和与英伟达的深度绑定,目前是最大受益者。
  • 三星/美光:正在追赶,但面临工艺转换和专利壁垒的挑战。
  • 台积电:作为封装和基底层的“守门人”,地位更加稳固,是HBM产业链中不可或缺的“卡脖子”环节。

---

5. 未来展望:HBM的下一步是什么?

文章最后提到了几个值得关注的趋势:

1. 堆叠层数继续增加:从12层到16层,甚至更多。这会进一步提升容量,但技术难度和成本也会飙升。

2. 定制化成为主流:HBM将越来越像“芯片”而不是“内存条”。不同客户(英伟达、AMD、华为等)会有不同版本的HBM。

3. 成本与性能的博弈:HBM太贵了,限制了AI的普及。未来可能会在HBM和更便宜的DDR5之间寻找平衡,或者通过技术改进(如混合键合)来降低成本。

4. NAND闪存(硬盘)的机会:虽然本篇重点讲HBM,但文章开头提到NAND闪存价格也在暴涨。随着AI数据量的爆炸,用于存储海量非结构化数据的NAND闪存(如企业级SSD)也将迎来巨大的需求增长。

结语

站在2025年下半年的节点,我们看到的不仅仅是一次内存价格的上涨,而是AI硬件架构的一次根本性重构。

“算力”是发动机,“存力”是油箱和输油管。 当发动机越来越强大,输油管如果不够粗、不够快,整个系统就会瘫痪。HBM就是那根最关键的、最昂贵的输油管。

对于投资者和从业者来说,理解HBM的技术难点和产业链分工,比单纯看价格波动更重要。因为在这场游戏中,谁掌握了最难的工艺(堆叠/封装),谁绑定了最强的客户(英伟达),谁就掌握了未来的话语权。

这轮“存力”周期,才刚刚开始。