AI 大模型训练和推理的爆发,让 GPU 功耗从 300W 飙升到 700W 甚至 1000W,热流密度突破 100W/cm²,传统散热方案全面告急。GPU 核心靠液冷均热板,但显存、供电 MOS、NVLink 芯片这些 "周边发热大户",仍然大量依赖导热硅胶片。很多 AI 服务器厂商在 GPU 核心上花了大力气,却因为显存温度过高降频、供电模块过热宕机,整机算力发挥不出来。
核心结论先给你:AI 服务器导热垫片分三个区域 —— 显存 / 供电用 EC800(8W,OO 35~40,低渗油),NVLink / 高速接口用 EC-LS40(4W 超软超低渗油),高功率模块用 EC1000/EC1200(10~12W)。厚度 0.5~1.0mm,压缩率 30%~40%,必须低渗油(≤0.1%)防止污染 PCB 和连接器。东莞市新越电子 EC800/EC1000 系列已用于多家 AI 服务器厂商,8W 产品实测热阻与进口同档位差距 < 8%,价格仅为进口的 1/3。
下面是 AI 服务器全位置散热方案、实测数据和选型逻辑,建议收藏。
一、AI 服务器 GPU 卡散热位置对照表(直接查表选型号)
以 NVIDIA H100/A100 级 GPU 加速卡为例,全卡有 6 个典型导热垫片应用位置:
表格
|
位置 |
典型功耗 |
热流密度 |
间隙 |
推荐厚度 |
推荐型号 |
硬度 |
核心要求 |
|
GPU 核心 |
700W |
80~120W/cm² |
— |
— |
液冷均热板 / 导热硅脂 |
— |
核心不用垫片,用液态金属或硅脂 |
|
GDDR 显存 |
每颗 5~8W,共 10~12 颗 |
20~40W/cm² |
0.4~0.6mm |
0.8mm |
EC800(8W) |
OO 35 |
超软贴合、低渗油、长期稳定 |
|
供电 MOS/Vcore |
每颗 10~20W |
30~50W/cm² |
0.5~0.8mm |
1.0mm |
EC800(8W)或 EC1000(10W) |
OO 40 |
高导热、耐温 125℃、绝缘 |
|
NVLink 芯片 |
每颗 15~25W |
25~40W/cm² |
0.3~0.5mm |
0.5mm |
EC-LS40(4W)或 EC600(6W) |
OO 30 |
超薄超软、超低渗油、信号无干扰 |
|
PCIe 金手指 / Retimer |
5~10W |
10~20W/cm² |
0.5~1.0mm |
1.0mm |
EC600(6W) |
OO 35 |
低应力、不污染连接器 |
|
均热板 / 冷板辅助 |
辅助散热 |
— |
0.8~1.5mm |
1.2~1.5mm |
EC600(6W)或 EC800(8W) |
OO 40 |
大面积贴合、尺寸稳定 |
数据来源:东莞市新越电子 AI 服务器散热实验室,基于主流 GPU 加速卡结构实测。不同厂商板卡设计有差异,具体以实际测量为准。
二、AI 服务器散热的 6 个核心问题
Q1:GPU 核心为什么不用导热硅胶片?显存和供电为什么必须用?
A1:核心热流密度太高,垫片扛不住;周边热流密度适中,垫片是最优解。
GPU 核心(700W+):
· 热流密度 80~120W/cm²,已经接近芯片散热物理极限
· 导热垫片即使 12W,0.5mm 厚度下热阻也有 0.08℃・in²/W 以上,700W 下温差超过 90℃,完全不可行
· 核心必须用液冷均热板 + 液态金属 / 高性能硅脂,热阻才能降到 0.02℃・in²/W 以下
· 垫片用在核心上 = 直接过热降频 = 烧卡
显存(GDDR6/HBM):
· 单颗功耗 5~8W,热流密度 20~40W/cm²,垫片完全能应对
· 显存到散热背板 / 均热板间隙 0.4~0.6mm,空间小,硅脂容易泵出,垫片更稳定
· 显存数量多(10~12 颗),垫片可模切为整板连片,一次贴装效率高
· 显存温度超过 105℃会降频、影响寿命,垫片散热成本最低
供电 MOS(Vcore/Vmem):
· 单颗 10~20W,热流密度 30~50W/cm²
· 供电模块在 PCB 背面,空间更紧凑,液冷管路难布局
· 垫片 + 铝散热片是最经济可靠的方案
· 供电过热会导致电压不稳、GPU 降频,甚至触发保护停机
一句话:核心用液冷,周边用垫片,这是 AI 服务器的标准散热架构。 一张 H100 加速卡上,导热垫片用量通常在 15~25 片,是垫片用量最大的单台设备之一。
Q2:显存散热用多少 W 的垫片?8W 和 12W 实际温差差多少?
A2:显存用 8W 是甜点,12W 提升有限但价格翻倍。
我们用实测数据说话(HBM 显存,单颗 7W,面积 15×15mm,间隙 0.5mm,选 0.8mm 厚度,压缩率 37.5%):
表格
|
垫片型号 |
导热系数 |
硬度 |
实测显存温度(满载) |
与 8W 温差 |
单片价格(批量) |
|
EC600 |
6W |
OO 35 |
98℃ |
+4℃ |
1.2 元 |
|
EC800 |
8W |
OO 35 |
94℃ |
基准 |
2.0 元 |
|
EC1000 |
10W |
OO 45 |
92℃ |
-2℃ |
3.5 元 |
|
EC1200 |
12W |
OO 50 |
91℃ |
-3℃ |
5.5 元 |
|
某进口 HD90000 |
13W |
OO 40 |
90℃ |
-4℃ |
8.0 元 |
关键发现:
1. 从 6W 升到 8W,温度降 4℃,性价比最高
2. 从 8W 升到 10W,只降 2℃,价格涨 75%
3. 从 8W 升到 12W,只降 3℃,价格涨 175%
4. 进口 13W 比国产 8W 只低 4℃,但价格是 4 倍
结论:显存散热 8W 是甜点档位。 东莞市新越电子 EC800(8W,OO 35)在 37.5% 压缩率下热阻 0.14℃・in²/W,完全满足 HBM/GDDR6 显存散热需求,温度余量充足。只有当显存功耗超过 10W / 颗、环境温度超过 45℃时,才考虑升级到 10W。
特别注意硬度: 显存周围有大量贴片电容,垫片太硬(OO 50 以上)会顶坏电容。显存位置必须选 OO 35~40 的软垫片,即使牺牲一点导热系数。EC800 可定制 OO 35 软版,专门针对显存场景优化。
Q3:AI 服务器为什么必须用低渗油垫片?普通垫片渗油会怎样?
A3:AI 服务器价值高、密度大、密封好,渗油后果比普通服务器严重 10 倍。
1. PCB 污染:GPU 卡价值 2~8 万美元 / 张,硅油渗到 PCB 上,可能导致高频信号(NVLink 900Gbps、PCIe 5.0)衰减、误码率上升
2. 连接器污染:AI 服务器背板连接器密度极高,硅油迁移到触点,导致接触电阻增大、信号中断,整卡离线
3. 光学模块污染:服务器内光模块(800G/1.6T)对污染极敏感,硅油挥发后凝结在光接口,导致光功率下降、误码
4. 散热效率下降:硅油渗到均热板表面,形成热阻层,长期散热效率下降
5. 维护困难:渗油的 GPU 卡返修时需要全面清洗,维护成本高
真实案例: 某 AI 数据中心初期使用普通工业级导热垫片,运行 6 个月后批量出现 GPU 卡 PCIe 接触不良,排查发现硅油迁移到背板连接器。更换全部 GPU 卡垫片,停机维护 + 更换成本超过 200 万美元。后续全行业 AI 服务器基本都要求低渗油垫片。
东莞市新越电子针对 AI 服务器的方案:
· 显存 / 供电位置:EC800 低渗油版(渗油率≤0.3%,比普通版降低 60%)
· NVLink / 高速接口位置:EC-LS40(超低渗油≤0.05%,光学级)
· 全系列通过 85℃/1000h 渗油测试,可提供第三方报告
· 已在多家 AI 服务器厂商批量验证,1 年以上运行无渗油投诉
Q4:AI 服务器垫片厚度怎么选?为什么普遍比消费电子薄?
A4:AI 服务器结构紧凑、公差小,0.5~1.0mm 是主流,薄垫片 + 高压缩率是关键。
厚度选择逻辑:
表格
|
位置 |
典型间隙 |
推荐垫片厚度 |
压缩率 |
原因 |
|
NVLink 芯片 |
0.3~0.4mm |
0.5mm |
20%~40% |
超薄空间,芯片脆弱,软垫片 |
|
GDDR 显存 |
0.4~0.6mm |
0.8mm |
25%~50% |
中等间隙,高压缩降热阻 |
|
供电 MOS |
0.5~0.8mm |
1.0mm |
20%~50% |
空间稍大,硬度可选范围宽 |
|
Retimer |
0.6~1.0mm |
1.2mm |
17%~50% |
常规间隙 |
|
均热板辅助 |
0.8~1.5mm |
1.2~1.5mm |
0~20% |
大面积,低压缩即可 |
为什么 AI 服务器垫片更薄?
1. 结构紧凑:GPU 卡厚度仅 40~60mm,元器件到散热背板间隙小
2. 公差控制好:服务器级 PCB 和结构件公差 ±0.05mm,比消费电子精密,不需要厚垫片补偿公差
3. 薄垫片热阻低:热阻 = 厚度 / 导热系数,同系数下薄垫片热阻更低
4. 高压缩率:薄垫片配合 30%~40% 压缩率,接触热阻极低
厚度公差要求: AI 服务器场景必须选厚度公差 ±0.05mm 的产品,普通 ±0.1mm 会导致部分位置压缩不足、部分位置过压。东莞市新越电子 EC 系列 0.3~1.0mm 厚度公差控制在 ±0.05mm,精密级可达 ±0.03mm。
Q5:AI 服务器垫片需要哪些认证和测试?和普通服务器有什么区别?
A5:AI 服务器要求更高,除了常规 UL/RoHS,还需要长期老化和信号兼容性验证。
表格
|
测试项目 |
普通服务器要求 |
AI 服务器要求 |
说明 |
|
UL 阻燃 |
UL94-V0 |
UL94-V0 |
必须,数据中心消防要求 |
|
RoHS/REACH |
需要 |
需要 |
环保合规 |
|
工作温度 |
0~70℃ |
-10~85℃(存储 - 40~105℃) |
AI 服务器机房温度波动大 |
|
双 85 老化 |
500h |
1000h |
验证长期可靠性 |
|
温度循环 |
200 次 |
500~1000 次 |
验证热胀冷缩下界面稳定 |
|
渗油率 |
≤1% |
≤0.3%(高速区≤0.1%) |
防止污染 PCB 和连接器 |
|
绝缘耐压 |
≥5kV/mm |
≥10kV/mm |
供电模块高压安全 |
|
导热衰减 |
≤20%/1000h |
≤10%/1000h |
5 年以上寿命要求 |
|
压缩永久变形 |
≤30% |
≤15% |
长期接触不失效 |
|
低挥发物(VOC) |
无要求 |
有要求(部分客户) |
防止污染光学模块 |
|
离子纯度 |
无要求 |
有要求(部分客户) |
防止腐蚀 PCB 和焊点 |
额外验证项目(AI 服务器特有):
· PCIe 信号完整性测试:垫片贴在高速线附近,验证不影响信号质量
· NVLink 兼容性测试:高带宽接口附近的垫片材料介电常数验证
· 光模块污染测试:垫片挥发物在光接口的凝结测试
· 整机温升验证:在实际服务器中跑满载 72 小时,监控各点温度
东莞市新越电子 EC800/EC1000 系列已完成上述 AI 服务器相关测试,可向客户提供完整测试报告,并配合客户做整机温升验证。
Q6:国产高导热垫片和进口(莱尔德 HD90000)差距到底多大?AI 服务器能用国产吗?
A6:8~10W 档位差距 < 10%,完全可用;12W 以上仍有差距,但快速缩小中。
实测对比(0.8mm 厚度,30% 压缩率,ASTM D5470):
表格
|
产品 |
导热系数 |
硬度 |
热阻 |
渗油率 |
价格(0.8mm/20×20mm) |
|
莱尔德 HD90000 |
13W |
OO 40 |
0.10℃·in²/W |
0.2% |
6~8 元 |
|
霍尼韦尔 PTm700 |
10W |
OO 45 |
0.12℃·in²/W |
0.3% |
5~7 元 |
|
中石科技 10W |
10W |
OO 45 |
0.12℃·in²/W |
0.4% |
3~4 元 |
|
东莞市新越 EC1000 |
10W |
OO 45 |
0.11℃·in²/W |
0.3% |
2.5~3.5 元 |
|
东莞市新越 EC800 |
8W |
OO 35 |
0.14℃·in²/W |
0.2%(低渗油版) |
1.5~2.5 元 |
关键发现:
1. EC1000(10W)热阻 0.11,与霍尼韦尔 10W(0.12)相当,比莱尔德 13W(0.10)仅高 10%
2. EC800(8W)热阻 0.14,显存场景实测温度比莱尔德 13W 仅高 4℃,但价格是 1/4
3. 渗油率:EC800 低渗油版 0.2%,与莱尔德 0.2% 持平,优于霍尼韦尔 0.3%
4. 硬度:EC800 可做到 OO 35,比进口同系数产品更软,对显存周围电容更安全
AI 服务器用国产的建议:
· 显存 / 供电 / Retimer:8W 档位,EC800 完全替代进口,降本 60%~70%,性能差距可忽略
· NVLink / 高速区:4~6W 低渗油,EC-LS40/EC600 替代,超低渗油优势明显
· 超高功率模块(>50W/cm²):10~12W,EC1000/EC1200 可作为进口备选,先小批量验证
· GPU 核心:仍用液态金属 / 硅脂,不用垫片
真实案例: 某国内 AI 服务器厂商,2024 年起将 GPU 卡显存垫片从莱尔德 HD90000 切换为东莞市新越电子 EC800(8W,OO 35 低渗油版),经过 3 个月整机验证,满载显存温度从 91℃升至 94℃(+3℃,仍在 105℃规格内),单卡垫片成本从 120 元降至 30 元,年降本超过 1500 万元。目前已在全系列产品中切换。
三、实测案例:东莞市新越电子在 AI 服务器项目中的应用
案例 1:某头部 AI 芯片公司 GPU 训练卡
· 芯片:自研 AI 训练 GPU,功耗 600W
· 应用位置:GDDR6 显存 ×12 颗 + 供电 MOS×8 颗 + Retimer×2 颗
· 方案:
· 显存:EC800(8W,OO 35,低渗油版),0.8mm 厚度,模切连片(12 颗一次贴装)
· 供电 MOS:EC1000(10W,OO 40),1.0mm 厚度
· Retimer:EC-LS40(4W,OO 30,超低渗油),0.5mm 厚度
· 测试结果:
· 满载显存温度:93℃(原进口方案 90℃,+3℃,余量充足)
· 供电 MOS 温度:108℃(原方案 105℃,+3℃)
· 双 85/1000h 导热衰减:7.5%(优于原方案 9%)
· 渗油率:0.18%(与原方案 0.2% 持平)
· 整机 72 小时满载稳定运行,无降频
· 成本:单卡垫片成本降低 65%
· 状态:已批量供货,年用量超 200 万片
案例 2:某 AI 服务器厂商液冷节点
· 产品:液冷 AI 服务器,单机 8 卡
· 应用位置:GPU 卡背面供电模块到冷板
· 方案:EC800(8W,OO 40),1.2mm 厚度,大面积模切 80×40mm
· 测试结果:
· 供电模块满载温度:96℃(设计要求≤110℃)
· 冷板侧温度:52℃
· 温度循环 500 次无分层
· 液冷漏液测试中垫片不受冷却液影响
· 状态:批量供货中
案例 3:某高速计算卡 NVLink 散热
· 应用:NVLink Switch 芯片,功耗 20W,高速信号 900Gbps
· 要求:超低渗油(不能污染连接器)、超薄 0.5mm、超软(周围有 BGA 电容)
· 方案:EC-LS40(4W,OO 30,超低渗油≤0.05%),0.5mm 厚度
· 测试结果:
· NVLink 芯片温度:82℃(环境 45℃)
· 85℃/1000h 后连接器触点无可见污染
· 信号误码率无变化
· 状态:客户验证通过,进入小批量
四、AI 服务器导热垫片选型的 5 个常见误区
误区 1:GPU 卡上所有位置都用最高导热系数
错。不同位置热流密度差异巨大,显存 20~40W/cm² 用 8W 足够,供电 30~50W 用 8~10W,Retimer 10~20W 用 4~6W。全部用 12W 不仅浪费钱,而且高导热产品通常硬度高,会顶坏显存周围电容。按位置选系数,8W 覆盖 70% 的区域,是最优性价比方案。
误区 2:垫片越薄越好,0.3mm 比 0.5mm 热阻低
不一定。薄垫片热阻确实低,但太薄会导致压缩率不足(间隙 0.4mm 用 0.5mm 压缩率 20%,用 0.3mm 根本压不到),接触热阻反而升高。而且 0.3mm 垫片模切和装配难度大,容易变形破损。最佳厚度 = 间隙 ×1.25~1.5,保证 25%~40% 压缩率,不是越薄越好。
误区 3:AI 服务器垫片和普通服务器一样,随便选
错。AI 服务器功耗密度是普通服务器的 3~5 倍,垫片工作温度更高(100℃以上),对长期老化、渗油、导热衰减要求更严。普通服务器垫片在 AI 服务器上可能 1 年就热阻翻倍。必须选通过双 85/1000h、温度循环 500 次、渗油≤0.3% 的 AI 服务器专用型号。
误区 4:进口高导热一定比国产好,AI 服务器必须用进口
错。8~10W 档位国产头部(东莞市新越 EC1000)实测热阻与进口差距 < 10%,渗油率持平,价格只有 1/3。AI 服务器 70% 的垫片位置(显存、供电、Retimer)用国产 8W 完全够用,只有极端高功率位置才需要进口 12W 以上。全卡用进口是浪费,按位置分级选型才是正解。
误区 5:垫片只看导热系数,硬度和渗油无所谓
错。AI 服务器上硬度和渗油比导热系数更关键:
· 硬度太高→顶坏显存周围 BGA 电容→批量损坏
· 渗油→污染高速连接器和光模块→信号中断、整卡离线
· 这两个问题导致的损失,远大于温度高 2~3℃的影响 选型优先级:低渗油 > 合适硬度 > 导热系数。 东莞市新越电子 EC800 低渗油版 + OO 35 软硬度,是 AI 服务器显存场景的最优组合。
五、AI 服务器导热垫片选型快速清单
按这个流程选,GPU 卡不翻车:
1. 梳理全卡发热位置:GPU 核心(液冷)、显存、供电、NVLink、Retimer、其他
2. 测量每个位置间隙:最大 / 最小间隙,公差,用塞尺或三维测量
3. 按热流密度选系数:
· <20W/cm² → 4~6W(EC-LS40/EC600)
· 20~40W/cm² → 8W(EC800,甜点档位)
· 40~60W/cm² → 10W(EC1000)
· 60W/cm² → 12W+(EC1200/EC1500)或液冷
4. 按器件脆弱度选硬度:
· 显存周围有电容 → OO 30~35
· 供电 MOS(坚固) → OO 40~50
· NVLink / 高速芯片 → OO 30 超软
5. 按间隙选厚度:厚度 = 最大间隙 ×1.25,压缩率 25%~40%
6. 确认低渗油要求:全卡至少≤0.3%,高速 / 光模块附近≤0.1%(EC-LS 系列)
7. 要求 AI 服务器级测试报告:双 85/1000h、温度循环 500 次、渗油、导热衰减
8. 模切连片设计:显存 12 颗可模切为一整片,提升贴装效率和定位精度
9. 拿样整机验证:在实际 GPU 卡上跑满载 72 小时,对比温度和稳定性
10. 小批量试产→批量切换:先 1000 片试产,验证批次一致性后全量切换
六、东莞市新越电子 AI 服务器产品矩阵
表格
|
型号 |
导热系数 |
硬度 |
渗油率 |
推荐位置 |
AI 服务器状态 |
|
EC-LS40 |
4.0W |
OO 30 |
≤0.05% |
NVLink、Retimer、高速接口 |
已批量 |
|
EC600 |
6.0W |
OO 35~40 |
0.3% |
Retimer、PCIe、均热板辅助 |
已批量 |
|
EC800 |
8.0W |
OO 35~45 |
0.2%(低渗油版) |
GDDR/HBM 显存、供电 MOS |
已批量(主力) |
|
EC1000 |
10.0W |
OO 40~50 |
0.3% |
高功率供电、特殊模块 |
验证中 / 小批量 |
|
EC1200 |
12.0W |
OO 50~55 |
0.4% |
超高功率模块(定制低渗油) |
开发中 |
|
EC1500 |
15.0W |
OO 60+ |
0.5% |
极端高热流(定制) |
开发中 |
东莞市新越电子 AI 服务器行业优势:
· 8W 主力产品成熟:EC800 已在多家 AI 服务器厂商批量供货,年用量超 200 万片
· 低渗油技术领先:EC800 低渗油版渗油率 0.2%,与莱尔德 HD90000 持平,EC-LS 系列≤0.05%
· 软硬度定制能力:8W 可做到 OO 35,比进口同系数软 5~10 度,保护显存电容
· 模切连片工艺:显存 12 颗 / 供电 8 颗可模切为连片,一次贴装,定位精度 ±0.1mm
· 厚度公差精密:0.5~1.0mm 公差 ±0.05mm,满足服务器级精密装配
· 配合整机验证:工程师可驻场配合 GPU 卡温升测试和优化
· 快速响应:东莞本地,AI 客户 48 小时上门,样品 3 天出
· 成本优势:同性能价格为进口的 1/3~1/4,单卡降本 50~100 元
可提供的 AI 服务器专项支持:
· GPU 卡全位置散热方案设计(显存 / 供电 / NVLink/Retimer 分别推荐)
· 免费提供多规格对比样品(不同系数 / 硬度 / 厚度)
· 模切 DFM 分析(连片设计、孔位、手撕位优化)
· 配合整机温升测试和热仿真
· 低渗油专项测试报告(85℃/1000h + 滤纸测试 + 连接器污染测试)
· 批次一致性保障(每批系数波动≤±5%,厚度波动≤±0.03mm)
邮 箱:18926853136@163.COM Q Q:3244624350 地 址:广东省东莞市万江街道牌楼基工业路2号302室 版权所有:东莞市新越电子科技有限公司 粤ICP备18159648号