从“算力”到“存力”:AI硬件下半场,谁在卡脖子?
大家好,我是你们的财经记者兼经济学者。
最近,如果你关注科技圈或股市,可能会发现一个有趣的现象:以前大家炒AI,眼睛都盯着英伟达的GPU(显卡),觉得那是“大脑”,是核心。但到了2025年下半年,风向变了。内存(DRAM)、闪存(NAND)和硬盘这些原本被视为“配角”的存储设备,突然成了主角。
为什么?因为“存力”成了新的瓶颈。
简单来说,以前是“算得不够快”,现在是“存得不够多、读得不够快”。这就好比一个超级厨师(GPU),刀工再快,如果食材(数据)从冰箱(内存)里拿出来的速度跟不上,厨师也只能干等着。
今天,我们就用大白话,把这篇关于HBM(高带宽内存)的深度研报拆解开来,看看这轮“存力”革命到底是怎么回事,以及它背后藏着怎样的商业逻辑和投资机会。
---
一、 为什么AI突然“吃”内存吃得这么凶?
很多人有个误区,觉得AI就是算数,跟存东西没关系。其实大错特错。AI对内存的需求,不是线性增长,而是指数级爆炸。这主要源于三个“胃口”变大了:
1. 模型本身变“胖”了(参数存储)
你可以把AI大模型想象成一个超级复杂的字典。以前这个字典只有几百万字,现在变成了几万亿字。
- 数据说话:以通义千问(Qwen)为例,从第一代到最新的Qwen3.8 Max,参数量翻了约30多倍。
- 后果:光是把这个“字典”本身装进内存里,需要的空间就从135GB涨到了2300GB(约2.3TB)。这还没开始干活呢,光“站着”就占了一大块地方。
2. 聊天记忆变“长”了(KV缓存)
这是最容易被忽视,但最耗内存的部分。当你和AI聊得越多,它需要记住的“上下文”就越多。
- 比喻:就像你和一个朋友聊天,如果你们聊了100页,他得把这100页的内容都记在脑子里,才能接上下一句。
- 现状:虽然软件技术在进步,能压缩记忆,但现在的AI上下文长度(Context Window)已经能处理几十万甚至上百万字的内容。
- 叠加效应:如果同时有32个人在和AI进行超长对话,光是这些“聊天记忆”加在一起,就需要1.3TB的内存。加上模型本身的2.3TB,一个模型实例就要吃掉3.6TB的内存!
3. AI Agent(智能体)的“杂活”
现在的AI不只是回答问题,它还要帮你写代码、操作Excel、发邮件。这些操作产生的临时文件、日志、中间数据,虽然不需要最高端的HBM,但也会极大地消耗普通的内存和闪存空间。
总结:以前是“算得快”最重要,现在是“装得下”和“读得快”同样重要,甚至更关键。
---
二、 为什么HBM成了“宠儿”?普通内存不行吗?
既然内存这么重要,为什么不用我们电脑里常见的DDR5内存,非要搞个昂贵的HBM(High Bandwidth Memory,高带宽内存)?
这就得看两个核心指标:容量和速度。
1. 普通内存的“物理极限”
- 制程难突破:内存芯片的制造工艺很难像CPU那样做到2nm、3nm。因为物理规律限制,内存颗粒做得太小,电子会“乱窜”,导致数据出错。目前内存制程卡在11-12nm,未来几年也就到10nm。
- 空间有限:既然单个颗粒做不大,那就多放几个。但是,GPU芯片周围的空间非常宝贵,像寸土寸金的市中心,没法像普通主板那样把内存条平铺在四周。
2. HBM的“黑科技”:立体停车库
HBM的聪明之处在于,它不跟CPU/GPU抢平面空间,而是向上堆叠。
- 垂直堆叠:想象一下,普通内存是平铺在地上的平房,HBM是盖在GPU旁边的“立体停车库”。它把12层甚至16层内存芯片像千层饼一样叠在一起。
- 硅通孔(TSV):为了打通这些层,工程师在芯片上打了无数个垂直的小孔(TSV),里面灌满铜,让信号能上下直通。
- 结果:在同样大小的面积上,HBM能塞下比普通内存多好几倍的容量。
3. 速度为什么快?
- 位宽极大:普通内存一次只能传32位数据,HBM一次能传1024位甚至2048位数据。这就好比普通公路是单车道,HBM是1000车道的高速公路。
- 距离极短:HBM是直接“贴”在GPU芯片上的(通过硅中介层封装)。数据不用跑远路,就在隔壁房间传递,所以延迟极低,速度极快。
一句话总结:HBM就是为了解决“空间不够”和“速度不够”这两个死结而诞生的“特供版”内存。
---
3. HBM的技术难点:为什么这么难造?这么贵?
HBM虽然好,但制造起来简直是“地狱难度”,这也是为什么它比DDR5贵好几倍的原因。主要有三个大坑:
1. 堆叠工艺:像搭积木一样精细
- 打孔难:要在薄薄的硅片上打几千个垂直孔,还要保证不偏不倚,还要散热,还要通电,难度极大。
- 焊接难:这12层芯片怎么粘在一起?
- 海力士(SK Hynix)用的是MR-MUF工艺(回流焊+液态树脂)。就像一次性把所有积木叠好,然后浇上胶水固化。优点是效率高、良率高、散热好。
- 三星/美光用的是TC-NCF工艺(热压+非导电膜)。就像一层一层地压,压一层粘一层。缺点是步骤多、容易出错、良率低。
- 竞争格局:海力士因为掌握了更高效的MR-MUF工艺,所以在HBM领域目前占据优势,毛利率更高。三星和美光则想通过研发下一代“混合键合”技术来弯道超车。
2. 封装工艺:必须和GPU“结婚”
- 硅中介层(Interposer):HBM不能单独卖,它必须和GPU芯片一起封装在一块特殊的硅板(中介层)上。
- 精度要求极高:这块硅板上的线路宽度只有1微米(头发丝的1/70),PCB板(普通电路板)根本做不出来,必须用半导体晶圆工艺。
- 产能瓶颈:这块硅板和封装过程,主要依赖台积电(TSMC)的CoWoS产能。也就是说,你有多少HBM,不光看内存厂,还要看台积电给你多少封装名额。
3. 基底层(Base Die):从“通用”变“定制”
- 以前:HBM底部的基底层很简单,内存厂自己就能做。
- 现在(HBM4):基底层变得很复杂,需要12nm甚至更先进的工艺,内存厂自己做不了,得找台积电代工。
- 更关键的变化:基底层不再是通用的了。英伟达、AMD等大客户会根据自己的需求,定制基底层的设计。
- 比如英伟达的NVHBM,用了私有协议,带宽提升30%,功耗降低15%。
- 这意味着,HBM不再是标准化的“商品”,而是半定制的“零件”。
---
4. 产业链格局巨变:内存厂不再“独大”
这一轮HBM革命,彻底改变了内存行业的权力结构。
1. 内存厂的“独立性”下降
以前,内存厂(如三星、海力士、美光)是绝对的主角,从设计到生产一条龙。
现在,HBM的生产链条变成了:
- 内存厂:负责制造内存颗粒和堆叠。
- 台积电:负责制造基底层(Base Die)和最终的封装(CoWoS)。
- 终端客户(如英伟达):参与基底层的设计,决定规格。
后果:内存厂的话语权被稀释了。如果英伟达明天换供应商,或者台积电产能不够,内存厂再厉害也发不出货。
2. “共同富裕”还是“价值转移”?
- 短期看:因为AI需求爆发,整个蛋糕变大了,内存厂、台积电、英伟达都赚得盆满钵满。海力士、美光的股价半年涨了10倍,就是证明。
- 长期看:随着定制化加深,内存厂可能逐渐沦为“代工厂”角色,核心价值向设计和封装端(台积电)以及拥有定义权的终端客户(英伟达)转移。内存厂的利润率可能会受到挤压。
3. 投资逻辑的变化
- 以前:买内存股,看的是周期(涨价/跌价)。
- 现在:买内存股,要看的是技术壁垒(谁的堆叠良率高?谁和英伟达绑定深?)和产能协同(谁能拿到台积电的封装名额?)。
- 海力士:凭借MR-MUF工艺优势和与英伟达的深度绑定,目前是最大受益者。
- 三星/美光:正在追赶,但面临工艺转换和专利壁垒的挑战。
- 台积电:作为封装和基底层的“守门人”,地位更加稳固,是HBM产业链中不可或缺的“卡脖子”环节。
---
5. 未来展望:HBM的下一步是什么?
文章最后提到了几个值得关注的趋势:
1. 堆叠层数继续增加:从12层到16层,甚至更多。这会进一步提升容量,但技术难度和成本也会飙升。
2. 定制化成为主流:HBM将越来越像“芯片”而不是“内存条”。不同客户(英伟达、AMD、华为等)会有不同版本的HBM。
3. 成本与性能的博弈:HBM太贵了,限制了AI的普及。未来可能会在HBM和更便宜的DDR5之间寻找平衡,或者通过技术改进(如混合键合)来降低成本。
4. NAND闪存(硬盘)的机会:虽然本篇重点讲HBM,但文章开头提到NAND闪存价格也在暴涨。随着AI数据量的爆炸,用于存储海量非结构化数据的NAND闪存(如企业级SSD)也将迎来巨大的需求增长。
结语
站在2025年下半年的节点,我们看到的不仅仅是一次内存价格的上涨,而是AI硬件架构的一次根本性重构。
“算力”是发动机,“存力”是油箱和输油管。 当发动机越来越强大,输油管如果不够粗、不够快,整个系统就会瘫痪。HBM就是那根最关键的、最昂贵的输油管。
对于投资者和从业者来说,理解HBM的技术难点和产业链分工,比单纯看价格波动更重要。因为在这场游戏中,谁掌握了最难的工艺(堆叠/封装),谁绑定了最强的客户(英伟达),谁就掌握了未来的话语权。
这轮“存力”周期,才刚刚开始。