ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows

KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows 文章主要内容和创新点主要内容本文针对基于大语言模型(LLM)的多智能体工作流中KV缓存管理效率低下的问题,提出了一种工作流感知的KV缓存管理框架KVFlow。背景:多智能体工作流通过多个专业化智能体协作解决复杂任务,每个智能体有固定提示词,现有系统通过前缀缓存(prefix caching)复用KV张量以减少冗余计算,但采用LRU(最近最少使用)淘汰策略,常在缓存即将被重用前将其淘汰,导致缓存失效(cache miss)和大量重新计算开销。KVFlow设计:引入智能体步骤图(Agent Step Graph)抽象智能体执行依赖关系,计算每个智能体的“步骤到执行值(steps-to-execution)”,估计其未来激活的时间 proximity;基于该值设计工作流感知的淘汰策略,在KV节点级别分配优先级,保留可能被重用的缓存,高效管理树结构缓存中的共享前缀;提出完全重叠的KV预取机制,通过后台线程提前将下一步所需KV张量从CPU加载到GPU,避免生成过程中的缓存失效停滞。实验结果:相比使用分层基数缓存的SGLang,KVFlow在大型提示词的单工作流中实现最高1.83倍加速,在多并发工作流场景中最高2.19倍加速。
返回列表