ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SiLQ: Simple Large Language Model Quantization-Aware Training

SiLQ: Simple Large Language Model Quantization-Aware Training 文章主要内容总结本文提出了一种名为SiLQ(Simple Large Language Model Quantization-Aware Training)的简单大语言模型量化感知训练方法,旨在解决大语言模型(LLMs)量化过程中精度损失、训练成本高及与专用推理加速器兼容性的问题。核心目标:通过量化降低LLMs的推理延迟、模型大小和能耗,同时最小化精度损失,并确保与专用推理加速器兼容。方法流程:在模型中添加量化操作,使用直通估计器(straight through estimator)计算训练时的梯度;通过校准初始化量化器步长,再使用LSQ(Learned Step Size Quantization)进一步优化;结合知识蒸馏(knowledge distillation)进行端到端训练,可使用公开数据集或模型原始微调数据。性能表现:仅增加不到0.1%的总训练预算(以训练token计),在常识推理(CSR)、Huggingface Open LLM排行榜(OLLMv1、OLLMv2)等基准测试中,显著优于SmoothQuant、SpinQuant等主流后训练量化(PTQ)方法,且在基模型和指令微调模型上均保持接近原始全精度模型的精度。优势:适用于不同模型架构,可量化激活值、缓存和权重,无需添加额外操作,兼容专用加速器(如NorthPole),
返回列表