这两年 AI 算力卷到 HBM 身上,堆叠层数从 8 层涨到 12 层,HBM3E 直接冲到 16 层,单颗显存带宽突破 TB/s,行业都在聊制程、堆叠密度、接口速率。但跟进过几个 AI 服务器 GPU 卡的热设计项目就会发现:现在很多卡的性能瓶颈,早已不是 GPU 核心本身,而是围着核心的那几颗 HBM 显存。
满载跑大模型的时候,GPU 核心温度还在安全线内,HBM 已经率先撞温度墙降频,显存带宽直接掉 15%~20%,训练速度跟着打折扣。拆开散热模块看,冷板、热管都没问题,问题就出在 HBM 与散热结构之间那层薄薄的导热界面材料上 —— 要么厚度不对压不实,要么太硬贴不平,要么长期高温出油粉化,热阻一高,热量闷在显存里散不出去。
很多人觉得,不就是一片导热垫片吗?能有多大影响。但 HBM 这东西,堆叠密度高、热流集中、公差极小,对界面热阻的敏感度远高于普通 GDDR 显存。界面热阻每上升 0.1℃・in²/W,HBM 结温就能差 5~8℃,直接触发降频。看似不起眼的一片材料,最终决定了显存能不能跑满带宽,GPU 能不能释放全部算力。
很多人选导热材料,直接拿传统显存的参数套,这是最大的误区。HBM 的散热难度,是普通 GDDR 的数倍。
HBM 是多层 DRAM 裸片垂直堆叠而成,从 HBM2 的 4 层,到 HBM3 的 12 层,再到 HBM3E 的 16 层,热量不仅来自表层,更多来自中间层和底层。堆叠内部的热阻本身就很高,如果外层的界面散热再拉胯,热量就会在内部累积,层间温差能超过 10℃。 这也是为什么 SK 海力士、三星都在封装里做文章,MR-MUF、TC-NCF 这类技术,本质就是优化堆叠内部的热传导SK hynix N...。但封装内部做得再好,最终热量还是要通过顶面的界面材料导出去,外层这道坎过不去,内部优化再多都打折扣。
单颗 HBM 芯片面积很小,但功耗密度不低,12 层 HBM3 全速运行时,单位面积热流接近主 GPU 芯片的一半。而且 HBM 是围绕 GPU 核心一圈排布,本身就处在核心的高温辐射区,环境温度本就偏高。 这种小面积高发热的场景,对界面接触的均匀度要求极高。只要有一点点贴合不良,局部热阻就会飙升,热点温度直接冲破阈值。不像普通显存面积大,有点瑕疵影响也不大。
HBM 是精密封装件,多颗并排安装在基板上,颗与颗之间的高度差只有几十微米。加上基板翘曲、冷板平面度公差,整个散热面的高度波动非常小。 如果导热硅胶片硬度太高、压缩量不够,就会出现有的颗压到了、有的颗悬空的情况,悬空的那颗散热直接失效。这也是为什么 HBM 场景不能用硬度过高的高导热片 —— 不是导热不够,是贴不平。
HBM 的信号速率极高,接口带宽以 TB/s 计,周围还有高速 SerDes 信号。导热材料不能导电,不能产生寄生电容,介电常数要稳定,否则会影响信号完整性,导致误码率上升、带宽下降。 这也是很多高导热的石墨片、金属片不能直接用在 HBM 上的原因 —— 导电风险高,介电特性不可控,容易出信号问题。
一张标准的 AI 加速卡,HBM 相关的导热硅胶片应用至少有三处,每一处的选型逻辑都不一样。
这是最核心的散热路径,90% 的 HBM 热量从这里导出。 这个位置的核心矛盾是:既要足够低的热阻,又要足够的柔性来吸收高度公差,还要控制压力,不能压坏封装。主流方案是选用 6~10W/m・K 的中高导热软质硅胶片,厚度根据实际间隙选型,工作压缩量控制在 20%~30% 之间。 实际项目里,把普通 3W 的消费级片子换成 8W 级的软质专用片,HBM 满载温度普遍能降 8~12℃,降频现象基本消失,对应的训练速度能稳定提升 10% 以上。提升的关键不是导热系数涨了多少,是贴合度变好了,实际接触面积上去了。
很多早期方案这个位置是空的,或者只用普通泡棉。但高堆叠 HBM 的侧面也是重要的散热面,尤其底层的热量,从侧面导出比从顶面层层传导更快。 用低硬度的薄型导热硅胶片填充 HBM 侧面与屏蔽罩之间的间隙,既能辅助侧面散热,拉低层间温差,又能缓冲振动、固定位置,防止运输和振动工况下封装受损。这个位置对导热系数要求不高,1~3W/m・K 就足够,重点是要非常软,不能对封装侧面产生应力。
HBM 旁边的供电 MOS 管、电感阵列,本身就是高发热元件,而且高度和 HBM 不一样,高低错落。如果分开做散热,结构复杂,成本高。 用一片整体的导热硅胶片,同时覆盖 HBM 和周边 VRM 元件,依靠柔性变形同时贴合不同高度的发热体,把热量统一导到冷板上。一片材料解决两个区域的散热,还能简化装配,提升量产一致性。这个位置要选压缩量范围大的软质片,3~6W/m・K 的导热系数就够用。
行业里最大的误区,就是选 HBM 用导热硅胶片先看导热系数。实际上对 HBM 场景来说,导热系数的优先级根本排不到前三。
正确的选型优先级应该是:厚度精度与匹配度 → 柔软度与压缩回弹 → 低出油与耐老化 → 绝缘与介电性能 → 导热系数。
HBM 的间隙公差本身就只有几十微米,厚度选型的精准度要求远高于普通场景。原则是:测量最大静态间隙,考虑基板和冷板的翘曲量,选择压缩 20%~30% 后刚好填满的厚度。
HBM 是精密器件,能承受的压力非常有限,不能靠大力压来保证贴合。这就要求硅胶片在很低的压力下就能充分压缩,同时回弹性能要好,温度循环、长期受压后不产生永久变形。 行业通用的参考是:邵氏 00 级硬度,25% 压缩率下的应力不超过 0.3MPa;85℃、1000 小时老化后,压缩永久变形≤15% 为合格,≤10% 为优秀。超过 20% 的材料,基本不建议用在 HBM 上 —— 回弹不够,用一段时间就贴不实了。 很多标称 12W、15W 的高导热片,硬度做到邵氏 A 以上,看着参数好看,压在 HBM 上根本贴不平,实际散热效果还不如 6W 的软片。
AI 服务器是 7×24 小时满负载运行,设计寿命 5~7 年。如果导热硅胶片的硅油析出率高,用个一两年就开始出油,不仅散热性能下降,渗出来的硅油还会污染基板和连接器,导致接触不良、信号异常。 正规的算力级产品都会做低出油配方优化,高温老化后失重率低,无明显油渗。普通消费级的片子,常温下看着没问题,长期高温跑下来,出油粉化是大概率事件。
击穿电压≥15kV/mm,体积电阻率≥10¹³Ω・cm,这是基础绝缘要求。在此之上,HBM 场景还要关注介电常数和介电损耗,避免影响高速信号。 一般要求介电常数稳定在 3~4 之间,介电损耗因子低于 0.005,这样才不会对 HBM 的高速接口产生干扰。很多普通工业级硅胶片不控制介电参数,用上去可能温度降了,但信号出问题了。
国内像新越电子的 EC、XG 系列算力级导热硅胶片,之所以能在 AI 显卡和服务器行业批量用,核心不是导热系数标得多高,是低硬度、高回弹、低出油这些 HBM 核心需求做得扎实,厚度精度也能满足精密封装的要求,批次一致性够支撑大规模量产。
做热设计这些年,见过的 HBM 导热失效案例,基本都踩在这几个坑里。
买了标称 12W 以上的 “顶级” 导热硅胶片,结果装上 HBM 温度没降反升。原因就是高导热配方填料多,硬度高,HBM 和冷板的锁附压力有限,压不下去,实际接触面积很小,热阻反而更高。
拿普通显存的厚度经验直接套 HBM,差个零点几毫米,要么压不实悬空,要么压过应力大。HBM 的高度公差是微米级的,厚度必须按实际测量值选,不能凭经验拍脑袋。
为了降本,拿消费电子、普通显卡用的导热硅胶片往 AI 加速卡上装。价格确实便宜不少,但耐老化、低出油、压缩回弹都过不了算力级标准。跑一年多就出油、变硬、回弹失效,HBM 温度一路走高,频繁降频,后续返工的成本是当初节省的几十倍。
样件阶段测常温温升,数据都很漂亮,就直接批量上线。实际长期高温运行,材料老化,性能断崖式下跌。等运维发现算力下降、HBM 降频的时候,内部材料已经劣化很严重了。
AI 算力的竞争,说到底是每一个细节的竞争。GPU 核心、HBM 堆叠是明面上的技术高地,而导热硅胶片这类基础界面材料,是藏在里面的性能底线。
现在行业都在卷 HBM 的堆叠层数、卷带宽、卷容量,却很少有人关注这层几毛钱的硅胶片。但恰恰是这些不起眼的基础部件,决定了 HBM 能不能跑满标称带宽,决定了 GPU 能不能释放全部算力,决定了 AI 集群能不能 7×24 小时稳定运行。
热管理从来没有什么捷径,把每一层界面的热阻控制住,把每一个基础部件的可靠性做足,才是算力持续释放的真正根基。
邮 箱:18926853136@163.COM Q Q:3244624350 地 址:广东省东莞市万江街道牌楼基工业路2号302室 版权所有:东莞市新越电子科技有限公司 粤ICP备18159648号