ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference 文章主要内容总结本文聚焦边缘设备上大语言模型(LLM)推理的挑战,提出了一种基于混合 systolic阵列(HSA)架构的边缘LLM推理加速器,旨在优化推理过程中计算密集的prefill阶段和内存受限的decode阶段的效率。背景与挑战:边缘LLM推理需兼顾安全性、低延迟和成本效益,但面临内存容量有限、功耗约束严格、decode阶段内存带宽窄导致性能受限等问题。LLM推理的prefill阶段以矩阵-矩阵乘法(MMM)为主,decode阶段以矩阵-向量乘法(MVM)为主,且decode阶段占总延迟的80%以上,外部内存访问(EMA)是能耗的主要来源。解决方案:提出混合 systolic阵列(HSA)架构,结合传统systolic阵列和向量单元的优势,在prefill阶段实现高能效,在decode阶段保持高硬件利用率和面积效率。采用MXINT4权重量化方案减少EMA,并设计适配HSA的数据流,确保低量化开销和100%硬件利用率,同时精度损失极小。优化根 mean square 归一化(RMSNorm)和旋转位置编码(RoPE)单元,减少其延迟、面积和内存访问开销,支持端到端推理。实验结果:在1.3B参数的RetNet模型上,长输入/长输出场景下实现247/117 token/s/mm²的性能,较现有方案提升2.45×/13.5×,同时在token生成中保持优异的能效。创新
返回列表