ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

TokenSpeed量化实战:fp8、NVFP4与KV缓存压缩如何省下50%显存

TokenSpeed量化实战:fp8、NVFP4与KV缓存压缩如何省下50%显存 TokenSpeed量化实战fp8、NVFP4与KV缓存压缩如何省下50%显存【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeedTokenSpeed 是一个光速级的 LLM 推理引擎而它的量化能力正是大模型上生产的关键通过fp8 权重量化、NVFP4 4-bit 压缩和 FP8 KV 缓存你可以在不损失可感知精度的前提下把大模型显存占用直接砍掉近一半。本文带你快速搞懂这三个开关的原理、适用硬件与上手配方。上图Kimi K2.5 在 Attn TP4/TP8 × MoE TP/EP 四种布局下的吞吐表现TokenSpeed 在低并发下优势显著。 显存都花在哪了部署一个大 MoE 模型显存主要被两样东西吃掉组成BF16 原始占用量化后模型权重100%fp8 → 50%NVFP4 → 约 25%KV 缓存100%随上下文线性增长fp8 → 50%mxfp8 → 50%激活与临时缓冲—随计算精度下降长上下文、高并发的场景下KV 缓存往往比权重还吃显存。所以省显存要两条腿走路一边压权重一边压缓存。⚙️ 权重量化--quantization怎么选TokenSpeed 的启动参数支持多种量化方式定义在 server_args.py量化方式精度/显存典型硬件适用场景fp88-bit显存减半Hopper / Blackwell通用首选精度损失极小nvfp44-bitgroup size 16显存约剩 1/4BlackwellSM100极致省显存需 ModelOpt 量化好的检查点mxfp44-bit 微缩放格式Hopper / BlackwellAMD gfx950、Hopper 混合部署w8a8_fp8权重8-bit 激活8-bitHopper / Blackwell追求 GEMM 速度NVFP4Blackwell 的显存杀手NVFP4 配置类的实现在 nvfp4.py几个要点使用16 个权重共享一个缩放因子的分组方式动态范围更好要求 GPU 计算能力SM100Blackwell即 B200/GB200/GB300 系列检查点由 NVIDIA ModelOpt 预先量化产出启动时引擎自动从hf_quant_config.json读取配置对 MoE 专家权重还有专门的 NVFP4 加载路径moe/weights/nvfp4.py 和稠密层实现 dense/nvfp4.py。 KV缓存压缩--kv-cache-dtype的三档选项KV 缓存精度由--kv-cache-dtype控制支持四种取值server_args.py取值存储格式相比 BF16 的显存auto/bfloat16BF161×基线fp8/fp8_e4m3FP8 E4M3单位缩放0.5×mxfp8块缩放 FP8每 32 个 head_dim 元素一个 UE8M0 缩放因子0.5×动态范围更好 提示mxfp8需要配合--block-size 128并搭配 MHA 注意力后端。KV 池的整体设计逻辑可以在官方文档 cache-concepts.md 中找到详细说明。FP8 KV 缓存是免费午餐几乎所有模型在 FP8 缓存下的精度损失都可以忽略而长上下文中省下的显存可以转化为更大的并发数或更长的上下文。 实战配方Kimi K2.5 的 NVFP4 FP8 KV 组合拳官方模型配方文档 models.md 给出了 Kimi K2.5 的标准量化启动方式tokenspeed serve nvidia/Kimi-K2.5-NVFP4 \ --served-model-name kimi-k2.5 \ --trust-remote-code \ --max-model-len 262144 \ --kv-cache-dtype fp8 \ --quantization nvfp4 \ --tensor-parallel-size 4 \ --enable-expert-parallel \ --attention-backend trtllm_mla \ --moe-backend flashinfer_trtllm \ --host 0.0.0.0 --port 8000两个量化开关叠加后的效果权重NVFP4 把权重显存压到 BF16 的约 1/4KV 缓存FP8 再砍掉一半262K 长上下文 256 并发序列在 4 卡上轻松跑起DeepSeek、Qwen、GLM、MiniMax 等大模型在 models.md 中几乎都默认推荐--quantization fp8 --kv-cache-dtype fp8的组合例如 Qwen 3.8 2.4T 的双节点部署models.md。✅ 选型速查表你的情况推荐配置HopperH100/H200 大 MoE--quantization fp8 --kv-cache-dtype fp8Blackwell 想塞下超大模型--quantization nvfp4 --kv-cache-dtype fp8需要更好 KV 精度--kv-cache-dtype mxfp8 --block-size 128显存充足、只追求速度BF16 缓存 w8a8_fp8权重 延伸阅读模型部署配方含各模型的量化启动命令docs/recipes/models.mdKV 缓存池与调度器设计docs/design/cache-concepts.md数值精度与位级一致性设计docs/design/numerics.mdNVFP4 量化配置源码python/tokenspeed/runtime/layers/quantization/nvfp4.pyKV 缓存参数定义python/tokenspeed/runtime/utils/server_args.py量化不是越狠越好而是够用就行先用 fp8 双开权重缓存拿到 50% 显存红利显存仍然紧张再上 NVFP4 把权重压到极限。按这个顺序调大多数场景都能一次配通。【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表