ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSeek V4.1 Flash 发布,百万上下文开始算缓存这笔账

DeepSeek V4.1 Flash 发布,百万上下文开始算缓存这笔账 模型每调用一次工具终端日志、搜索结果、代码修改和报错信息都会继续塞进上下文。任务跑得越久重新读入历史的计算越多KV Cache 也越大。100 万 token 能不能装下反倒只是最先遇到的问题。后面还有显存、SSD、带宽以及长会话恢复时的等待。近日DeepSeek 发布 V4.1 Flash目标“更强、更快、更普惠”。主要处理三个问题减少长输入的重复计算压低历史状态的存储开销再给 Agent 的思考长度加上一档可调预算。V4.1 Flash 的参数规模比上一代 Flash 大得多运行时全局缓存却只有后者的约四分之一。报告中的多项设计都围绕这个对聊天模型来说长上下文意味着一次可以多放几份文档。到了 Agent 场景它会变成一笔不断滚大的账。变化展开。对聊天模型来说长上下文意味着一次可以多放几份文档。到了 Agent 场景它会变成一笔不断滚大的账。01 代码和 Agent 成绩DeepSeek V4.1 Flash 是原生多模态 MoE 模型语言主干有 40 层 Transformer。它包含 552B 主干参数和 196B Engram 条件记忆参数处理输入时每个 token 激活约 8B 参数生成阶段约激活 16B。上下文长度仍是 100 万 token。主要 Agent 成绩包括Terminal-Bench 2.1 为 90.6DeepSWE v1.1 为 74.2CyberGym 为 88.1Automation-Bench 为 54.8。Terminal-Bench 把模型放进终端。它得先判断当前环境里有什么再执行命令、处理失败最后交出能通过验证的结果。DeepSWE 更接近真实的软件工程问题散落在仓库的多个文件中一处修改可能引出新的测试失败。CyberGym 面向网络安全任务Automation-Bench 则把模型放进跨应用操作流程。单轮写代码只是其中很小的一部分。一个仓库任务跑到第三十轮时Agent 可能已经看过几十个文件改过配置装过依赖还留下两段失败日志。此时真正难的是别把最初的验收条件忘掉也别把刚刚排除的错误再查一遍。V4.1 Flash 的高分主要出现在这类连续任务上。这些成绩显示V4.1 Flash 的代码能力已经延伸到更复杂的多轮执行。和 V4-Flash 0731 相比Terminal-Bench 2.1 从 82.7 升到 90.6DeepSWE v1.1 从 54.4 升到 74.2NL2Repo-Bench、CyberGym 和 Automation-Bench 也分别提高了 11.2、11.4 和 17.1 分。无论是修改完整仓库、操作终端还是处理安全任务和跨应用流程进步都很明显。横向比较同样出色。Terminal-Bench 2.1 的 90.6 高于表中的 Claude Opus 5、GPT-5.6-Sol、GLM-5.3 和 Kimi K3DeepSWE v1.1 的 74.2 略高于 Claude Opus 5 的 74.0CyberGym、Automation-Bench 和 Agents’ Last Exam 也拿到了表中最高分。这组结果说明V4.1 Flash 已经能够承担强度较高的代码与 Agent 任务而且优势并不限于某一种任务形式。换用不同的 Agent 框架分数会有波动但整体仍处在较高水平。报告中DeepSWE 得分落在 65.5 到 74.2 之间Terminal-Bench 2.1 落在 84.1 到 90.6 之间。模型本身提供了扎实的能力底座系统提示词、工具接口和上下文管理则会决定这些能力最终能发挥到什么程度。更困难的评测上差距仍然明显。Terminal-Bench 4.0 中V4.1 Flash 为 31.2 Opus 5 为 51.8HLE 分别是 36.8 和 56.3。02 这次更新为什么一直在谈 KV Cache过去几代模型已经把长序列的注意力计算压低了不少。计算下降之后原本没那么显眼的 KV Cache 开始卡住部署。KV Cache 保存历史 token 的注意力状态。模型生成下一个 token 时可以直接取用这些状态不必从头再算。问题是长会话一多缓存会迅速占满高带宽显存。为了让 Agent 之后接着干还要把部分缓存放进主机内存或 SSD恢复任务时再把它们搬回来。于是同一份上下文会同时消耗显存容量、持久化存储和传输带宽。工具调用会频繁触发预填充。新的观察结果经常会连同旧历史一起送入模型如果前缀缓存没有命中整段输入就得重新处理。上下文已经累积到几十万 token 时这一步很贵。DeepSeek 为此设计了 Causal Encoder-Decoder简称 CED。40 层网络从中间切开前 20 层是因果编码器后 20 层是解码器。长输入先经过编码器解码器需要的全局 KV不再由每一层拿着完整输入重新生成而是从编码器最后一层的隐藏状态投影出来。局部信息的处理没有省掉。每一层仍有滑动窗口注意力照看离当前 token 最近的内容。恢复解码器局部状态时系统只重放最近 128 个 token而不是让整段历史再走一遍后 20 层。输入远长于窗口时CED 可以把预填充计算降到原来的近一半。压缩后的全局分支负责较远的历史滑动窗口保留近期内容的完整状态。刚返回的报错和上一条工具结果通常需要逐字处理几百轮之前的信息只在相关时被调回。V4.1 Flash 还把原来的 mHC 改成 Single-Pass mHC。mHC 负责深层网络里的信息混合旧实现要经过四个内核新版把过程合并相应的 Mega-mHC 内核将激活内存流量减半。它解决的是内存读写次数而非注意力计算本身。03CSA2 怎么把每个 token 压到 890 字节CSA2 负责减少缓存。V4.1 Flash 放弃了上一代 CSA 与 HCA 混合的全局注意力结构。除编码器最前面的两层只使用滑动窗口外其余层的全局分支统一改用 CSA2。CSA2 有 Full、Reindex 和 Reuse 三种模式。Full 层负责生成全局 KV、索引键和 Top-K 位置Reindex 层沿用前面 Full 层的 KV但根据本层查询重新排一次相关位置Reuse 层更省KV 和 Top-K 结果都直接复用。三种模式仍会计算各自的查询并保留本层的滑动窗口 KV。FULL完整缓存与索引负责生成全局 KV、索引键和 Top-K 位置REINDEX重排相关位置沿用前面 Full 层的 KV根据本层查询重新排序REUSE直接复用结果KV 和 Top-K 结果都直接复用尽可能减少重复工作Full 层承担完整的缓存和索引计算Reindex 层保留本层重新选择相关位置的机会Reuse 层则尽可能减少重复工作。这样既不用给每层各存一套全局 KV也没有强迫所有层使用完全相同的检索结果。解码器里还有一层粗筛。第一个索引器先从完整历史中找出最多 16384 个候选位置后续索引器只在这个候选池里打分最后取 Top-512 送入注意力。这样既缩小搜索范围又允许后面的层根据自己的问题改变选择。缓存精度也降了。全局 KV 使用 FP4局部滑动窗口仍为 FP8。跨层复用、稀疏检索和低精度存储叠在一起后V4.1 Flash 的全局 KV Cache 为 890 字节/token。上一代 V4 Flash 是 3514 字节前者大约只有后者的四分之一如果和 2023 年的 DeepSeek V1 相比已经缩小约 437 倍。运行时缓存主要待在 HBM跨请求保存的持久化缓存则更多落在 SSD 或主机内存。SWA Bounded Replay 不再把每一层的滑动窗口 KV 全部写进 SSD而是在会话恢复时用最近一个窗口近似重建。根据报告这带来的性能损失很小持久化 KV Cache 则降至 V4 Flash 的约八分之一。同样的显存因此可以容纳更多长会话缓存落盘和恢复时需要传输的数据也更少。Agent 进行几十次工具调用后历史还在继续增长但缓存成本不会再按原来的幅度上涨。04 Engram 和DSpark 各管一件事V4.1 Flash 有 196B Engram 参数。MoE 负责从大量专家中选出少数参与当前计算Engram 更像一块可查询的条件记忆。它使用二元、三元和四元 n-gram再通过八组哈希头定位记忆条目。相关内容可以从主机侧提前取回不需要让全部 Engram 参数随每个 token 一起激活。某些常见搭配、实体关联和局部知识可以直接查找需要结合上下文判断的部分再交给神经网络计算。这样增加模型容量算力不必跟着总参数一比一增长。查找本身仍会占用带宽因此 Engram 表采用分片存储并通过 RDMA 提前取回可能用到的条目。DSpark 处理的是另一段等待逐 token 解码。它并行起草多个后续位置再交给主模型验证。候选足够可靠就一次接纳多个 token不可靠则回到常规生成。置信度调度器会根据候选质量决定验证时机。DSpark 不改变主模型的答案能力只缩短生成等待。05 Agent 后训练要先解决沙箱V4.1 Flash 使用 45T token 的多模态语料进行预训练文本与多模态数据约为 7:1。视觉信息从语言模型预训练阶段就进入同一条序列。视觉编码器 DeepSeek-ViT 支持可变分辨率。图片经过 3×3 pixel-unshuffle 后视觉 token 数量减少九倍支持的输入分辨率可到约 1344×1344。模型可以读取网页、图表、软件界面和执行后的截图。完成操作后再检查环境的新状态它才有机会发现按钮点错了或者生成的页面已经溢出。后训练依次经过 SFT、异步强化学习和 OPD。算法名称并不新鲜真正花力气的是训练环境。DeepSeek 为此建设了 DSec 沙箱系统让代码、终端和工具任务可以大规模执行和验证。系统采用定制调度器目标规模达到数百万容器在相近负载下单个物理节点的并发容器数量从约 1000 个提高到 2500 个以上。这类环境决定了 Agent 能学到什么。如果训练数据只有问题和标准答案模型很难学会命令失败之后怎么改。沙箱会返回真实日志、测试结果和系统状态模型的整条操作轨迹都能被判断。报告还提到有些训练中的 Agent 会删掉关键二进制文件、破坏文件系统甚至尝试利用环境漏洞。DSec 用 AppArmor 和基于 eBPF 的网络策略做隔离环境被破坏则把本轮轨迹记为失败。Agent 后训练因此需要建设和维护大量可执行环境。06 思考越久不一定越划算V4.1 Flash 把 reasoning effort 作为强化学习的显式条件取值范围为 1 到 100。API 目前分成 low、high 和 max 三档分别对应 50、75 和 100。从 effort 25 提高到 100八项推理测试的平均 Pass1 从 67.1% 上升到 76.3%DeepSWE 从 66.0% 升至 74.2%Terminal-Bench 2.1 从 82.4% 升至 90.6%。平均输出 token 同时增加到约 2.5 倍。曲线前半段涨得快后半段逐渐变平。effort 60 到 80 已拿到大部分准确率收益从 80 继续拉到 100Agent 轨迹会增长约 1.6 至 1.8 倍分数只再上升一点。日常代码修改把预算开到 max往往只是让模型想得更久。跨文件调试、复杂安全任务或者需要多次验证的工作才更值得付这笔 token 成本。调用方可以根据任务难度调整预算。同一个 Agent 流程也不必从头到尾使用一档设置先用中档定位问题遇到测试反复失败再把关键步骤升到高档。07 100 万上下文的边界部署门槛仍然很高。V4.1 Flash 每个 token 会激活数十亿参数权重体量达到数百 GB。即使采用混合精度普通工作站也很难完整承载如果还要跑到 100 万 token上下文缓存和服务冗余也要占掉额外资源。V4.1 Flash 能接收 100 万 token不表示放在窗口里的每个细节都能稳定找回。基础模型在 LongBench V2 上得到 45.2只比 V4 Flash 的 44.7 略高低于 V4 Pro 的 51.5。CSA2 可能选错相关位置SWA Bounded Replay 的近似重建也可能在极端输入下损失信息。DeepSeek 同时下调了 V4.1 Flash 的 API 价格。每百万 token 的空闲时段价格为缓存命中输入 0.02 元未命中输入 1 元输出 4 元高峰时段分别为 0.04 元、2 元和 8 元。Agent 一项任务可能调用几十轮还会携带越来越长的历史。此时总费用取决于缓存命中、输出长度和失败重试次数不能只看一次请求的单价。预填充少算近一半全局 KV Cache 降到 890 字节/token持久化缓存也只有上一代的约八分之一。长任务因此可以少占一些显存和存储会话恢复时需要搬运的数据也更少。不过缓存压缩解决不了所有问题。V4.1 Flash 在高难任务上仍有差距100 万 token 的窗口里也可能漏掉线索。它到底能省下多少成本最后还要看完成一项真实任务需要调用多少轮、生成多少 token又会失败重试几次。08 模型下载OpenCSG社区https://opencsg.com/models/deepseek-ai/DeepSeek-V4.1-FlashHugging Face社区https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash09 OpenCSG vs 魔搭如何选择模型部署在魔搭、OpenCSG 等模型社区中均可实现但 OpenCSG/CSGHub 的核心在于它不只是让模型跑起来而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是模型怎么部署、怎么调用的问题更是模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营的问题。对于企业来说CSGHub 可以帮助构建自己的私有模型资产中心降低对外部平台的依赖对于个人开发者来说也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭CSGHub 更适合那些希望把 AI 能力真正沉淀下来并长期维护、持续迭代的用户。关于 OpenCSGOpenCSG是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态AgenticOps 是人工智能领域的一种 AI 原生方法论由 OpenCSG开放传神提出。AgenticOps是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。
返回列表