ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ai推理工程的一些思考笔记

ai推理工程的一些思考笔记 文章目录1.SGLang的P/D分离为什么能解决decode阶段的延迟抖动为什么存在延迟抖动2.不同并行的比较3.关于HBM4.Nvidia一些显卡介绍包括A\L\B\H5、NVIDIA工作站卡RTX A系列的坑1.SGLang的P/D分离为什么能解决decode阶段的延迟抖动为什么存在延迟抖动Decode 通常是逐 token 生成每一步都需要完成一次模型推理。它的特点是每次计算量较小但需要频繁执行对单步延迟非常敏感依赖 KV Cache常常受显存带宽、KV Cache 访问和 GPU kernel 调度影响。而 Prefill 的特点是一次处理大量输入 token计算密集容易占满 GPU会产生大量 KV Cache任务长度差异很大容易形成长尾请求。如果 Prefill 和 Decode 共用 GPU就会产生几类抖动1.Prefill 抢占 GPU 计算资源一个长 prompt 到来时Prefill 可能运行较长时间Decode 请求只能等待或被切分执行。2.Batch 动态变化连续批处理会不断加入新请求、移除已完成请求。Batch 大小和形状变化会导致 kernel 执行时间不稳定。3.请求长度差异导致排队不稳定短 prompt 和超长 prompt 混在一起时长 Prefill 会拖慢其他请求形成 head-of-line blocking。4.显存和 KV Cache 压力变化Prefill 会突然分配大量 KV Cache可能导致显存碎片、Cache eviction、内存拷贝或重新调度。5.Decode 对资源竞争更敏感Decode 单步耗时本来就短哪怕被 Prefill 延迟几毫秒也会明显反映在 ITLInter-Token Latency上2.不同并行的比较传送门3.关于HBMHBMHigh Bandwidth Memory是一种基于3D堆叠技术的高性能DRAM内存通过垂直堆叠多层DRAM芯片并用TSV硅通孔实现高速互联提供极高带宽和低延迟。在AI训练中HBM作为GPU的超高速工作内存其最新HBM3E单栈带宽可达1.4TB/s是DDR5的5倍能显著突破“内存墙”瓶颈。相比传统内存HBM功耗降低40%-50%且封装更紧凑是AI、HPC等高性能计算领域的核心存储技术。当前主流供应商包括SK海力士、三星和美光2026年HBM4产品已开始量产。4.Nvidia一些显卡介绍包括A\L\B\H连接5、NVIDIA工作站卡RTX A系列的坑链接
返回列表