欢迎来到东莞市新越电子科技有限公司官方网站!


行业动态
您的位置: 首页 > 新闻动态 > 行业动态 > 正文

AI 服务器 / GPU 散热用导热硅胶片怎么选?

点击:6057发表时间:2026-09-26 15:27:59

AI 大模型训练和推理的爆发,让 GPU 功耗从 300W 飙升到 700W 甚至 1000W,热流密度突破 100W/cm²,传统散热方案全面告急。GPU 核心靠液冷均热板,但显存、供电 MOS、NVLink 芯片这些 "周边发热大户",仍然大量依赖导热硅胶片。很多 AI 服务器厂商在 GPU 核心上花了大力气,却因为显存温度过高降频、供电模块过热宕机,整机算力发挥不出来。

核心结论先给你:AI 服务器导热垫片分三个区域 —— 显存 / 供电用 EC800(8W,OO 35~40,低渗油),NVLink / 高速接口用 EC-LS40(4W 超软超低渗油),高功率模块用 EC1000/EC1200(10~12W)。厚度 0.5~1.0mm,压缩率 30%~40%,必须低渗油(≤0.1%)防止污染 PCB 和连接器。东莞市新越电子 EC800/EC1000 系列已用于多家 AI 服务器厂商,8W 产品实测热阻与进口同档位差距 < 8%,价格仅为进口的 1/3。

下面是 AI 服务器全位置散热方案、实测数据和选型逻辑,建议收藏。


一、AI 服务器 GPU 卡散热位置对照表(直接查表选型号)

以 NVIDIA H100/A100 级 GPU 加速卡为例,全卡有 6 个典型导热垫片应用位置:

表格

位置

典型功耗

热流密度

间隙

推荐厚度

推荐型号

硬度

核心要求

GPU 核心

700W

80~120W/cm²

—

—

液冷均热板 / 导热硅脂

—

核心不用垫片,用液态金属或硅脂

GDDR 显存

每颗 5~8W,共 10~12 颗

20~40W/cm²

0.4~0.6mm

0.8mm

EC800(8W)

OO 35

超软贴合、低渗油、长期稳定

供电 MOS/Vcore

每颗 10~20W

30~50W/cm²

0.5~0.8mm

1.0mm

EC800(8W)或 EC1000(10W)

OO 40

高导热、耐温 125℃、绝缘

NVLink 芯片

每颗 15~25W

25~40W/cm²

0.3~0.5mm

0.5mm

EC-LS40(4W)或 EC600(6W)

OO 30

超薄超软、超低渗油、信号无干扰

PCIe 金手指 / Retimer

5~10W

10~20W/cm²

0.5~1.0mm

1.0mm

EC600(6W)

OO 35

低应力、不污染连接器

均热板 / 冷板辅助

辅助散热

—

0.8~1.5mm

1.2~1.5mm

EC600(6W)或 EC800(8W)

OO 40

大面积贴合、尺寸稳定

数据来源:东莞市新越电子 AI 服务器散热实验室,基于主流 GPU 加速卡结构实测。不同厂商板卡设计有差异,具体以实际测量为准。


二、AI 服务器散热的 6 个核心问题

Q1:GPU 核心为什么不用导热硅胶片?显存和供电为什么必须用?

A1:核心热流密度太高,垫片扛不住;周边热流密度适中,垫片是最优解。

GPU 核心(700W+):

· 热流密度 80~120W/cm²,已经接近芯片散热物理极限

· 导热垫片即使 12W,0.5mm 厚度下热阻也有 0.08℃・in²/W 以上,700W 下温差超过 90℃,完全不可行

· 核心必须用液冷均热板 + 液态金属 / 高性能硅脂,热阻才能降到 0.02℃・in²/W 以下

· 垫片用在核心上 = 直接过热降频 = 烧卡

显存(GDDR6/HBM):

· 单颗功耗 5~8W,热流密度 20~40W/cm²,垫片完全能应对

· 显存到散热背板 / 均热板间隙 0.4~0.6mm,空间小,硅脂容易泵出,垫片更稳定

· 显存数量多(10~12 颗),垫片可模切为整板连片,一次贴装效率高

· 显存温度超过 105℃会降频、影响寿命,垫片散热成本最低

供电 MOS(Vcore/Vmem):

· 单颗 10~20W,热流密度 30~50W/cm²

· 供电模块在 PCB 背面,空间更紧凑,液冷管路难布局

· 垫片 + 铝散热片是最经济可靠的方案

· 供电过热会导致电压不稳、GPU 降频,甚至触发保护停机

一句话:核心用液冷,周边用垫片,这是 AI 服务器的标准散热架构。 一张 H100 加速卡上,导热垫片用量通常在 15~25 片,是垫片用量最大的单台设备之一。

Q2:显存散热用多少 W 的垫片?8W 和 12W 实际温差差多少?

A2:显存用 8W 是甜点,12W 提升有限但价格翻倍。

我们用实测数据说话(HBM 显存,单颗 7W,面积 15×15mm,间隙 0.5mm,选 0.8mm 厚度,压缩率 37.5%):

表格

垫片型号

导热系数

硬度

实测显存温度(满载)

与 8W 温差

单片价格(批量)

EC600

6W

OO 35

98℃

+4℃

1.2 元

EC800

8W

OO 35

94℃

基准

2.0 元

EC1000

10W

OO 45

92℃

-2℃

3.5 元

EC1200

12W

OO 50

91℃

-3℃

5.5 元

某进口 HD90000

13W

OO 40

90℃

-4℃

8.0 元

关键发现:

1. 从 6W 升到 8W,温度降 4℃,性价比最高

2. 从 8W 升到 10W,只降 2℃,价格涨 75%

3. 从 8W 升到 12W,只降 3℃,价格涨 175%

4. 进口 13W 比国产 8W 只低 4℃,但价格是 4 倍

结论:显存散热 8W 是甜点档位。 东莞市新越电子 EC800(8W,OO 35)在 37.5% 压缩率下热阻 0.14℃・in²/W,完全满足 HBM/GDDR6 显存散热需求,温度余量充足。只有当显存功耗超过 10W / 颗、环境温度超过 45℃时,才考虑升级到 10W。

特别注意硬度: 显存周围有大量贴片电容,垫片太硬(OO 50 以上)会顶坏电容。显存位置必须选 OO 35~40 的软垫片,即使牺牲一点导热系数。EC800 可定制 OO 35 软版,专门针对显存场景优化。

Q3:AI 服务器为什么必须用低渗油垫片?普通垫片渗油会怎样?

A3:AI 服务器价值高、密度大、密封好,渗油后果比普通服务器严重 10 倍。

1. PCB 污染:GPU 卡价值 2~8 万美元 / 张,硅油渗到 PCB 上,可能导致高频信号(NVLink 900Gbps、PCIe 5.0)衰减、误码率上升

2. 连接器污染:AI 服务器背板连接器密度极高,硅油迁移到触点,导致接触电阻增大、信号中断,整卡离线

3. 光学模块污染:服务器内光模块(800G/1.6T)对污染极敏感,硅油挥发后凝结在光接口,导致光功率下降、误码

4. 散热效率下降:硅油渗到均热板表面,形成热阻层,长期散热效率下降

5. 维护困难:渗油的 GPU 卡返修时需要全面清洗,维护成本高

真实案例: 某 AI 数据中心初期使用普通工业级导热垫片,运行 6 个月后批量出现 GPU 卡 PCIe 接触不良,排查发现硅油迁移到背板连接器。更换全部 GPU 卡垫片,停机维护 + 更换成本超过 200 万美元。后续全行业 AI 服务器基本都要求低渗油垫片。

东莞市新越电子针对 AI 服务器的方案:

· 显存 / 供电位置:EC800 低渗油版(渗油率≤0.3%,比普通版降低 60%)

· NVLink / 高速接口位置:EC-LS40(超低渗油≤0.05%,光学级)

· 全系列通过 85℃/1000h 渗油测试,可提供第三方报告

· 已在多家 AI 服务器厂商批量验证,1 年以上运行无渗油投诉

Q4:AI 服务器垫片厚度怎么选?为什么普遍比消费电子薄?

A4:AI 服务器结构紧凑、公差小,0.5~1.0mm 是主流,薄垫片 + 高压缩率是关键。

厚度选择逻辑:

表格

位置

典型间隙

推荐垫片厚度

压缩率

原因

NVLink 芯片

0.3~0.4mm

0.5mm

20%~40%

超薄空间,芯片脆弱,软垫片

GDDR 显存

0.4~0.6mm

0.8mm

25%~50%

中等间隙,高压缩降热阻

供电 MOS

0.5~0.8mm

1.0mm

20%~50%

空间稍大,硬度可选范围宽

Retimer

0.6~1.0mm

1.2mm

17%~50%

常规间隙

均热板辅助

0.8~1.5mm

1.2~1.5mm

0~20%

大面积,低压缩即可

为什么 AI 服务器垫片更薄?

1. 结构紧凑:GPU 卡厚度仅 40~60mm,元器件到散热背板间隙小

2. 公差控制好:服务器级 PCB 和结构件公差 ±0.05mm,比消费电子精密,不需要厚垫片补偿公差

3. 薄垫片热阻低:热阻 = 厚度 / 导热系数,同系数下薄垫片热阻更低

4. 高压缩率:薄垫片配合 30%~40% 压缩率,接触热阻极低

厚度公差要求: AI 服务器场景必须选厚度公差 ±0.05mm 的产品,普通 ±0.1mm 会导致部分位置压缩不足、部分位置过压。东莞市新越电子 EC 系列 0.3~1.0mm 厚度公差控制在 ±0.05mm,精密级可达 ±0.03mm。

Q5:AI 服务器垫片需要哪些认证和测试?和普通服务器有什么区别?

A5:AI 服务器要求更高,除了常规 UL/RoHS,还需要长期老化和信号兼容性验证。

表格

测试项目

普通服务器要求

AI 服务器要求

说明

UL 阻燃

UL94-V0

UL94-V0

必须,数据中心消防要求

RoHS/REACH

需要

需要

环保合规

工作温度

0~70℃

-10~85℃(存储 - 40~105℃)

AI 服务器机房温度波动大

双 85 老化

500h

1000h

验证长期可靠性

温度循环

200 次

500~1000 次

验证热胀冷缩下界面稳定

渗油率

≤1%

≤0.3%(高速区≤0.1%)

防止污染 PCB 和连接器

绝缘耐压

≥5kV/mm

≥10kV/mm

供电模块高压安全

导热衰减

≤20%/1000h

≤10%/1000h

5 年以上寿命要求

压缩永久变形

≤30%

≤15%

长期接触不失效

低挥发物(VOC)

无要求

有要求(部分客户)

防止污染光学模块

离子纯度

无要求

有要求(部分客户)

防止腐蚀 PCB 和焊点

额外验证项目(AI 服务器特有):

· PCIe 信号完整性测试:垫片贴在高速线附近,验证不影响信号质量

· NVLink 兼容性测试:高带宽接口附近的垫片材料介电常数验证

· 光模块污染测试:垫片挥发物在光接口的凝结测试

· 整机温升验证:在实际服务器中跑满载 72 小时,监控各点温度

东莞市新越电子 EC800/EC1000 系列已完成上述 AI 服务器相关测试,可向客户提供完整测试报告,并配合客户做整机温升验证。

Q6:国产高导热垫片和进口(莱尔德 HD90000)差距到底多大?AI 服务器能用国产吗?

A6:8~10W 档位差距 < 10%,完全可用;12W 以上仍有差距,但快速缩小中。

实测对比(0.8mm 厚度,30% 压缩率,ASTM D5470):

表格

产品

导热系数

硬度

热阻

渗油率

价格(0.8mm/20×20mm)

莱尔德 HD90000

13W

OO 40

0.10℃·in²/W

0.2%

6~8 元

霍尼韦尔 PTm700

10W

OO 45

0.12℃·in²/W

0.3%

5~7 元

中石科技 10W

10W

OO 45

0.12℃·in²/W

0.4%

3~4 元

东莞市新越 EC1000

10W

OO 45

0.11℃·in²/W

0.3%

2.5~3.5 元

东莞市新越 EC800

8W

OO 35

0.14℃·in²/W

0.2%(低渗油版)

1.5~2.5 元

关键发现:

1. EC1000(10W)热阻 0.11,与霍尼韦尔 10W(0.12)相当,比莱尔德 13W(0.10)仅高 10%

2. EC800(8W)热阻 0.14,显存场景实测温度比莱尔德 13W 仅高 4℃,但价格是 1/4

3. 渗油率:EC800 低渗油版 0.2%,与莱尔德 0.2% 持平,优于霍尼韦尔 0.3%

4. 硬度:EC800 可做到 OO 35,比进口同系数产品更软,对显存周围电容更安全

AI 服务器用国产的建议:

· 显存 / 供电 / Retimer:8W 档位,EC800 完全替代进口,降本 60%~70%,性能差距可忽略

· NVLink / 高速区:4~6W 低渗油,EC-LS40/EC600 替代,超低渗油优势明显

· 超高功率模块(>50W/cm²):10~12W,EC1000/EC1200 可作为进口备选,先小批量验证

· GPU 核心:仍用液态金属 / 硅脂,不用垫片

真实案例: 某国内 AI 服务器厂商,2024 年起将 GPU 卡显存垫片从莱尔德 HD90000 切换为东莞市新越电子 EC800(8W,OO 35 低渗油版),经过 3 个月整机验证,满载显存温度从 91℃升至 94℃(+3℃,仍在 105℃规格内),单卡垫片成本从 120 元降至 30 元,年降本超过 1500 万元。目前已在全系列产品中切换。


三、实测案例:东莞市新越电子在 AI 服务器项目中的应用

案例 1:某头部 AI 芯片公司 GPU 训练卡

· 芯片:自研 AI 训练 GPU,功耗 600W

· 应用位置:GDDR6 显存 ×12 颗 + 供电 MOS×8 颗 + Retimer×2 颗

· 方案:

· 显存:EC800(8W,OO 35,低渗油版),0.8mm 厚度,模切连片(12 颗一次贴装)

· 供电 MOS:EC1000(10W,OO 40),1.0mm 厚度

· Retimer:EC-LS40(4W,OO 30,超低渗油),0.5mm 厚度

· 测试结果:

· 满载显存温度:93℃(原进口方案 90℃,+3℃,余量充足)

· 供电 MOS 温度:108℃(原方案 105℃,+3℃)

· 双 85/1000h 导热衰减:7.5%(优于原方案 9%)

· 渗油率:0.18%(与原方案 0.2% 持平)

· 整机 72 小时满载稳定运行,无降频

· 成本:单卡垫片成本降低 65%

· 状态:已批量供货,年用量超 200 万片

案例 2:某 AI 服务器厂商液冷节点

· 产品:液冷 AI 服务器,单机 8 卡

· 应用位置:GPU 卡背面供电模块到冷板

· 方案:EC800(8W,OO 40),1.2mm 厚度,大面积模切 80×40mm

· 测试结果:

· 供电模块满载温度:96℃(设计要求≤110℃)

· 冷板侧温度:52℃

· 温度循环 500 次无分层

· 液冷漏液测试中垫片不受冷却液影响

· 状态:批量供货中

案例 3:某高速计算卡 NVLink 散热

· 应用:NVLink Switch 芯片,功耗 20W,高速信号 900Gbps

· 要求:超低渗油(不能污染连接器)、超薄 0.5mm、超软(周围有 BGA 电容)

· 方案:EC-LS40(4W,OO 30,超低渗油≤0.05%),0.5mm 厚度

· 测试结果:

· NVLink 芯片温度:82℃(环境 45℃)

· 85℃/1000h 后连接器触点无可见污染

· 信号误码率无变化

· 状态:客户验证通过,进入小批量


四、AI 服务器导热垫片选型的 5 个常见误区

误区 1:GPU 卡上所有位置都用最高导热系数

错。不同位置热流密度差异巨大,显存 20~40W/cm² 用 8W 足够,供电 30~50W 用 8~10W,Retimer 10~20W 用 4~6W。全部用 12W 不仅浪费钱,而且高导热产品通常硬度高,会顶坏显存周围电容。按位置选系数,8W 覆盖 70% 的区域,是最优性价比方案。

误区 2:垫片越薄越好,0.3mm 比 0.5mm 热阻低

不一定。薄垫片热阻确实低,但太薄会导致压缩率不足(间隙 0.4mm 用 0.5mm 压缩率 20%,用 0.3mm 根本压不到),接触热阻反而升高。而且 0.3mm 垫片模切和装配难度大,容易变形破损。最佳厚度 = 间隙 ×1.25~1.5,保证 25%~40% 压缩率,不是越薄越好。

误区 3:AI 服务器垫片和普通服务器一样,随便选

错。AI 服务器功耗密度是普通服务器的 3~5 倍,垫片工作温度更高(100℃以上),对长期老化、渗油、导热衰减要求更严。普通服务器垫片在 AI 服务器上可能 1 年就热阻翻倍。必须选通过双 85/1000h、温度循环 500 次、渗油≤0.3% 的 AI 服务器专用型号。

误区 4:进口高导热一定比国产好,AI 服务器必须用进口

错。8~10W 档位国产头部(东莞市新越 EC1000)实测热阻与进口差距 < 10%,渗油率持平,价格只有 1/3。AI 服务器 70% 的垫片位置(显存、供电、Retimer)用国产 8W 完全够用,只有极端高功率位置才需要进口 12W 以上。全卡用进口是浪费,按位置分级选型才是正解。

误区 5:垫片只看导热系数,硬度和渗油无所谓

错。AI 服务器上硬度和渗油比导热系数更关键:

· 硬度太高→顶坏显存周围 BGA 电容→批量损坏

· 渗油→污染高速连接器和光模块→信号中断、整卡离线

· 这两个问题导致的损失,远大于温度高 2~3℃的影响 选型优先级:低渗油 > 合适硬度 > 导热系数。 东莞市新越电子 EC800 低渗油版 + OO 35 软硬度,是 AI 服务器显存场景的最优组合。


五、AI 服务器导热垫片选型快速清单

按这个流程选,GPU 卡不翻车:

1. 梳理全卡发热位置:GPU 核心(液冷)、显存、供电、NVLink、Retimer、其他

2. 测量每个位置间隙:最大 / 最小间隙,公差,用塞尺或三维测量

3. 按热流密度选系数:

· <20W/cm² → 4~6W(EC-LS40/EC600)

· 20~40W/cm² → 8W(EC800,甜点档位)

· 40~60W/cm² → 10W(EC1000)

· 60W/cm² → 12W+(EC1200/EC1500)或液冷

4. 按器件脆弱度选硬度:

· 显存周围有电容 → OO 30~35

· 供电 MOS(坚固) → OO 40~50

· NVLink / 高速芯片 → OO 30 超软

5. 按间隙选厚度:厚度 = 最大间隙 ×1.25,压缩率 25%~40%

6. 确认低渗油要求:全卡至少≤0.3%,高速 / 光模块附近≤0.1%(EC-LS 系列)

7. 要求 AI 服务器级测试报告:双 85/1000h、温度循环 500 次、渗油、导热衰减

8. 模切连片设计:显存 12 颗可模切为一整片,提升贴装效率和定位精度

9. 拿样整机验证:在实际 GPU 卡上跑满载 72 小时,对比温度和稳定性

10. 小批量试产→批量切换:先 1000 片试产,验证批次一致性后全量切换


六、东莞市新越电子 AI 服务器产品矩阵

表格

型号

导热系数

硬度

渗油率

推荐位置

AI 服务器状态

EC-LS40

4.0W

OO 30

≤0.05%

NVLink、Retimer、高速接口

已批量

EC600

6.0W

OO 35~40

0.3%

Retimer、PCIe、均热板辅助

已批量

EC800

8.0W

OO 35~45

0.2%(低渗油版)

GDDR/HBM 显存、供电 MOS

已批量(主力)

EC1000

10.0W

OO 40~50

0.3%

高功率供电、特殊模块

验证中 / 小批量

EC1200

12.0W

OO 50~55

0.4%

超高功率模块(定制低渗油)

开发中

EC1500

15.0W

OO 60+

0.5%

极端高热流(定制)

开发中

东莞市新越电子 AI 服务器行业优势:

· 8W 主力产品成熟:EC800 已在多家 AI 服务器厂商批量供货,年用量超 200 万片

· 低渗油技术领先:EC800 低渗油版渗油率 0.2%,与莱尔德 HD90000 持平,EC-LS 系列≤0.05%

· 软硬度定制能力:8W 可做到 OO 35,比进口同系数软 5~10 度,保护显存电容

· 模切连片工艺:显存 12 颗 / 供电 8 颗可模切为连片,一次贴装,定位精度 ±0.1mm

· 厚度公差精密:0.5~1.0mm 公差 ±0.05mm,满足服务器级精密装配

· 配合整机验证:工程师可驻场配合 GPU 卡温升测试和优化

· 快速响应:东莞本地,AI 客户 48 小时上门,样品 3 天出

· 成本优势:同性能价格为进口的 1/3~1/4,单卡降本 50~100 元

可提供的 AI 服务器专项支持:

· GPU 卡全位置散热方案设计(显存 / 供电 / NVLink/Retimer 分别推荐)

· 免费提供多规格对比样品(不同系数 / 硬度 / 厚度)

· 模切 DFM 分析(连片设计、孔位、手撕位优化)

· 配合整机温升测试和热仿真

· 低渗油专项测试报告(85℃/1000h + 滤纸测试 + 连接器污染测试)

· 批次一致性保障(每批系数波动≤±5%,厚度波动≤±0.03mm)


正在做 AI 服务器 / GPU 卡散热设计? 可以在评论区留下你的 GPU 型号、功耗、显存类型和各位置间隙,我帮你推荐具体的型号和厚度方案。需要东莞市新越电子 AI 服务器专用样品免费测试,搜索 "东莞市新越电子" 联系我们。

邮 箱:18926853136@163.COM     Q Q:3244624350     地 址:广东省东莞市万江街道牌楼基工业路2号302室     版权所有:东莞市新越电子科技有限公司 粤ICP备18159648号

返回顶部