ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

HBM 发展演进全解:从 460GB/s 到 2.8TB/s,为何是 40/80/96/141/288/576GB,带宽bit/叠层/封装如何推动,相比 NVLink 与 PCIe 强在哪

HBM 发展演进全解:从 460GB/s 到 2.8TB/s,为何是 40/80/96/141/288/576GB,带宽bit/叠层/封装如何推动,相比 NVLink 与 PCIe 强在哪 HBM 发展演进全解从 460GB/s 到 2.8TB/s为何是 40/80/96/141/288/576GB带宽bit / 叠层 / 封装如何推动相比 NVLink 与 PCIe 强在哪声明本文作为笔者个人备忘的文章不喜勿喷。本文由AI辅助生成技术参数与市场信息整理自公开资料仅供参考。〇、一句话结论HBMHigh Bandwidth Memory高带宽内存是为了打穿大模型的内存墙而诞生的 3D 堆叠内存。它不像 GDDR/DDR 那样靠加引脚、提速率平面扩展而是把几十颗 DRAM用 TSV硅通孔垂直堆叠 2.5D 封装CoWoS/EMIB 中介层贴在 GPU 旁边通过 1024→2048-bit 超宽并行接口换取超高带宽。一句话HBM 用堆得高 离得近 接口宽换取带宽快。一、HBM 完整演进史从 2011 到 2027代际时间/首发每 die 接口宽度引脚速率单堆栈带宽单堆栈容量关键工艺HMC/原型20111024-bit———TSV 堆叠内存业界首次提出HBM12015AMD Fiji1024-bit~1Gbps~128GB/s4/8GB2.5D 中介层 TSV 微凸点HBM22016V1001024-bit2.4Gbps256GB/s8/16GB微凸点成熟HBM2E20191024-bit3.2-3.6Gbps~460GB/s8/24GB堆叠层数提升HBM32022H1001024-bit6.4-7.2Gbps~717GB/s16/24GB8/12-Hi 大规模堆叠HBM3E2023H200/B2001024-bit8-9.6Gbps~1.0-1.2TB/s24/36GB12-Hi 量产HBM42025 标准/2026 量产2048-bit翻倍10-11Gbps~2.8-3.3TB/s36GB 12-Hi/48GB 16-Hi接口翻倍 可定制 base dieHBM4E2027 放量2048-bit11Gbps3.5TB/s48GB 16-Hi/24Hi混合键合 3D 封装推进数据依据SK海力士/Hot Chips 2026单堆栈带宽 HBM2E≈460GB/s → HBM3≈717GB/s → HBM3E≈1024GB/s →HBM4≈2048GB/s代际约翻倍2025年 JEDEC 正式将 HBM4 接口 I/O 从 1024 位翻倍至 2048 位。二、为什么是 40 / 80 / 96 / 141 / 288 / 576GB容量背后的算术2.1 容量公式单颗 GPU 的 HBM 总容量 每 die 容量(bit) × 堆叠层数(Hi) × 堆叠数量(Stack)决定容量的是三个整数变量die 密度先进制程决定、叠几层封装决定、放几堆栈封装面积/GPU 设计决定。所以容量一定是几的倍数看起来像怪数。2.2 典型值拆解典型容量代表 GPU推算逻辑口径各异供参考40GBA100 (40GB 版)早期 HBM2e 中容量配置80GBA100-80G / H10016GB/栈×5 栈 etc.同代最大通用配置96GBHBM3 世代中/高配置24GB/栈×4 栈141GBH200HBM3E8 颗高密度栈的非整数合192GBB200HBM3E24GB/栈 × 8 栈 192GB288GBB300 / Vera RubinHBM436GB/栈(Rubin) 或 大密度栈 ×8576GBRubin Ultra V300HBM4E48GB/栈 × 高栈数Ultra 翻倍结论所谓怪数并非随机而是die 密度 × 堆叠层数 × 堆栈数的组合结果每一代通过提高 die 密度、加高堆叠、增加堆栈来推动容量翻倍。2.3 背后的三大演进驱动力带宽 bit接口宽度HBM1→HBM3E 一直 1024-bit/die靠提高速率1→9.6Gbps提带宽HBM4 接口翻倍到 2048-bit一次提升 2 倍带宽——这是带宽跃迁的关键结构性变化。叠层变化从 4-Hi → 8-Hi → 12-Hi → 16-Hi(→24-Hi)叠得越高容量越大、但散热和良率越难。封装变化微凸点micro-bump→混合键合hybrid bonding取消焊点、铜对铜直连密度/带宽更高、电容更低2.5D CoWoS 整片中继层 →EMIB 嵌入式硅桥SK海力士联手英特尔只在互连处用高密度布线降成本也为 HBM4E/3D 封装铺路。三、HBM 如何与 GPU/CPU 通信走什么协议3.1 物理连接关键离得极近HBM 与 GPU 靠2.5D 封装放在同一硅中介层CoWoS上或 EMIB 硅桥连接每颗 HBM 通过PHY 物理层连接 GPU1024 个 I/O、16 个伪通道HBM3HBM4 扩展到2048 个 I/O走线长度仅毫米级信号电容/电感低——这是高带宽能跑起来的物理基础。3.2 协议HBM 使用专有内存接口协议DDR 的伪通道变体栈内通过TSV 垂直互连是内存协议不是像 NVLink 那样的对等互联协议也不是 PCIe 那样的通用外设协议。3.3 三种高速互联定位对比维度HBM内存NVLinkGPU全互联PCIe通用I/O本质靠近计算的堆叠内存GPU-GPU 直接互联通用外设/扩展总线距离毫米级封装内同机/机柜铜缆/光板卡级接口1024-2048 bit 并行高速串行链路PCIe 串行 lane延迟极低紧贴低高需 CPU/协议中转每卡带宽(参考)A100 2TB/s / H100 3.35TB/s600GB/s / 900GB/s64 / 128GB/s双向容量有限40-576GB~用于互联—定位解决带宽墙解决卡间协同通用连接3.4 为什么 HBM 能这么快快的内因超宽并行接口1024→2048-bit 同时传等于上千根内存线同时工作对比 DDR 72 pinTSV 垂直互连穿过堆叠的数千条 TSV 提供低电感、超短路径离 GPU 极近2.5D 封装距离毫米级信号不必出芯片跨越长 PCB单位带宽功耗低HBM 比 GDDR 以更优 pJ/bit 实现带宽。四、为什么有 HBM怎么想到的核心解决什么问题4.1 痛点内存墙Memory Wall一个残酷的物理事实算力每 18 个月翻倍内存带宽增速仅为算力增速的约 1/3DDR/GDDR 平面扩展受引脚数、面积、功耗限制靠加大频率收益递减LLM 的三重饥渴容量参数优化器梯度Llama 3.1 405B 在 FP8 下约需400GB带宽自回归生成每生成 1 个 token 要读取整个模型权重KV Cache长上下文推理的缓存也吃内存。4.2 怎么想到的架构逻辑与其平铺更多引脚不如垂直堆叠 让内存贴近计算 1. 用TSV把 DRAM 叠成 3D 堆栈省面积、缩短互连 2. 用2.5D 封装CoWoS/EMIB把堆栈贴到 GPU 身旁 3. 用1024→2048-bit 超宽接口换取远超平面内存的带宽。4.3 核心解决带宽墙把内存带宽提升到可以喂饱 GPU 算力功耗/面积单位带宽功耗更低、占用基板面积更小相对 GDDR 大量走线算力-内存同步让 AI 集群吞吐(Throughput)不再卡在内存。五、成本变化为什么 HBM 这么贵、还涨这么凶5.1 单价与占比HBM 单价 ≈DDR5 的 5 倍HBM 占 DRAM 总产能/产值比产能占比2023 约 2% → 2024 约 5% → 2025 约 10%产值占比2023 约 8% → 2024 约 21% → 2025 约 30%HBM 单机柜价值摩根士丹利/彭博口径B200≈15.6 万美元 → Rubin V200≈38.2 万美元 →Rubin Ultra≈153.4 万美元这是HBM4/LPDDR5X 涨价致 AI 服务器 2027 涨价超 15%的根源。5.2 成本构成TSV 工艺约占 HBM 成本30%深硅刻蚀 铜电镀工序复杂、良率压力大加上 减薄(bonding)、微凸点/混合键合、中介层(CoWoS)、基板、测试——HBM 壁垒分散在一条很长的工艺链上贵是有缘由的。六、投资视角行业占比、投资情况与趋势6.1 市场规模与高增长指标数据全球 HBM 市场2023 约 43.56 亿美元 → 2024 约 169.14 亿(288%) →2026 约 546 亿美元(58%)占 DRAM 近四成需求增速2024-2026 CAGR 超 60%2026-2028 bit 需求 CAGR 约 63%摩根大通远期空间2027-2028 达 1600 亿~2820 亿美元供需缺口50%-60%2026-2028 持续短缺-20%→-16%产能结构新增 DRAM 产能 58% 投向 HBMHBM 占 DRAM 产能 19%→31%6.2 竞争格局寡头垄断厂商HBM 份额(2026Q2 Counterpoint)动态SK海力士50%HBM 出货量全球第一、三分之二供应英伟达与英伟达深度绑定HBM4 领先三星32%DRAM 总份额第一(39.4%)2026H2 HBM4 占比升 60%扩产至月 25 万片美光18%反击扩张四大基地同步扩产、HBM4 已达产份额追赶长鑫CXMT(国产)—(DRAM 排第四 9.5%)已具 HBM3 量产能力上海先进封装厂投资 171 亿6.3 国产替代与设备机遇国产替代率预计 2026 突破25%长鑫合肥 2 厂北京 1 厂月产约 30 万片上海 2027 投产后总量翻倍若 2027 出货 300 万颗 24GB 等效 HBM3可支撑50-75 万颗国产 GPU寒武纪/海光等设备TSV 成本占比 30%刻蚀/沉积/键合/减薄设备国产替代空间大混合键合设备海外 BESI/ASMPT/KS/AMAT 等领先2024 年 12 月美国 BIS 将 HBM 纳入严格管控倒逼国产加速。6.4 相关标的公开资料列示非荐股海外SK海力士、三星、美光国产存储长鑫未上市、北京君正、江波龙、佰维封测/模组太极实业海力士封测、香农芯创海力士代理、深科技材料/设备雅克科技前驱体、联瑞新材、华海诚科、德邦科技盛美上海、中微公司、拓荆科技、北方华创、芯源微、华卓精科。七、当前主要优劣HBM 技术本身优点带宽极高A100 2TB/s → Rubin 22TB/s/卡专治内存墙单位带宽功耗低能效 pJ/bit 优封装紧凑、节省基板面积。缺点容量小 成本极高DDR5 五倍、工艺链复杂、TSV 占 30%散热难十几层 DRAM 叠成被子紧贴高功耗 GPU刷新功耗与可靠性受温度威胁良率/供应受限微凸点→混合键合对平整度/洁净度要求极高全球被三家垄断、BIS 管控供给缺口大50-60%是当前 AI 基建的核心卡点。八、小结HBM是打穿内存墙的 3D 堆叠内存TSV 垂直堆叠 2.5D 封装贴着 GPU 1024→2048-bit 超宽接口典型容量值是 die 密度 × 堆叠层数 × 堆栈数的整数组合40/80/96/141/192/288/576GB演进驱动力接口 bit 翻倍HBM4、叠层加高4→16Hi、封装升级TSV微凸点→混合键合/EMIB与 GPU 通信走专有内存协议 PHY1024/2048 I/O 毫米级中介层相比 NVLink/PCIe带宽更高、延迟更低但它解决的是带宽墙而非卡间协同投资主线HBM 高景气546 亿美元、CAGR 60%、供需缺口 50-60%、三巨头垄断、美国 BIS 管控倒逼国产替代长鑫、TSV/混合键合设备国产化。附参考来源公开资料整理SK海力士 / Hot Chips 2026HBM2E 460→HBM3 717→HBM3E 1024→HBM4 2048GB/s、工艺链、散热、堆叠层数美光HBM42048-bit 接口、11Gbps、2.8TB/s/栈、36GB 12-Hi/48GB 16-Hi、时间线 2011-2027与非网/CSDNHBM 架构、TSV 工艺、带宽公式、成本测算、GB200 NVL72 报价移动通信网/CSDNSK海力士联手英特尔 EMIB、HBM4 2048GB/s、16-Hi、IO 位宽翻倍、容量公式电子发烧友HBM4 放量、KV Cache、单堆栈 36→48GB、CoWoS 缺口、三条国产 HBM 路线中证网/腾讯HBM 2026 546 亿美元58%、产能缺口 50-60%、DRAM 涨价、摩根大通供需观点网/中证摩根大通 2027-2028 1600-2820 亿美元、新增产能 58% 投 HBM、规格误读国海证券/三个皮匠2024 全球 HBM 169 亿美元288%、三巨头垄断、TSV 成本 30%、设备国产化腾讯/搜狐Q2 DRAM 份额 三星 39.4%/海力士 24.9%/美光 23.3%/长鑫 9.5%HBM 份额海力士 50%/三星 32%/美光 18%美光扩产东方财富/新浪国产 HBM长鑫产能、武汉新芯、171 亿先进封装厂、国产替代率 25%、50-75 万国产 GPU笔者按本文为个人备忘与学习笔记结合小红书、同花顺问财、慧博研报与公开资料讲清 HBM 的演进史、带宽/叠层/封装的迭代驱动力、典型容量的由来、与 NVLink/PCIe 的定位差异及投资机会。因厂商口径差异具体容量值以官方规格为准存储市场数据以机构最新研报为准文中公司均为公开资料列示不构成投资建议。
返回列表