
Clef-Flash vs Clef vs JevCloudflare 决策模型家族终极对比你的业务该选哪一个【免费下载链接】clef-flash项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clef-flashClef-Flash 是 Cloudflare 推出的 9B 多模态决策模型一次前向推理即可对结构化问题给出概率化决策Clef 是其高精度大版本Jev 则是官方决策 APISystemOne 协议的基线模型。本文用一张表讲清 Clef-Flash vs Clef vs Jev 的取舍帮你找到最省成本、最合适的 AI 决策模型选型方案。一、什么是决策模型与聊天大模型有什么区别传统聊天大模型回答业务问题时流程是生成自由文本 → 人工或代码解析 → 得到结果。中间环节可能跑题、格式出错、需要重试延迟还高。Cloudflare 的 Clef 系列换了一条路聊天大模型Clef 决策模型输入自由提示词状态state 带类型的问题清单schema输出自由文本需解析每个问题、每个允许选项的概率推理方式逐 token 生成一次前向推理全部算完典型延迟数百毫秒~秒级Clef-Flash 中位仅38.8ms一句话理解你给它一份事实可以是文本、JSON、图片甚至视频和一份选择题清单它直接告诉你每道题每个选项的概率——没有自由文本生成也没有输出解析详见 README.md。三种题型开箱即用noul是/否判断题choice多选项选择题如发票状态paid / overdue / draftscore有序程度题如紧急程度可等待 / 本周 / 今天二、三兄弟速览Clef、Clef-Flash、Jev 各是什么Clef家族中的精度担当更大的版本追求 Decision Index 榜单上的最高分。Clef-Flash9B 参数的轻量版由 Qwen/Qwen3.5-9B 后训练而来支持文本 图片 视频多模态输入单卡 H200 即可运行主打快且准。JevCloudflare 决策 APISystemOne 协议的基线模型也是 API 兼容性的参照物。它还可以与不同底座组合评测表中的 DiffusionGemma Jev 就是换底座后的变体。 关键点Clef-Flash 的 API 与 Jev / SystemOne 完全兼容——也就是说把请求从 Jev 切到 Clef-Flash业务代码几乎不用改。三、Clef-Flash 内部结构9B 底座 联合 Schema 头Clef-Flash 由两部分组成模型结构定义见 config.json骨干网络Qwen3.5-9B 含视觉编码器32 层、隐藏维度 4096、词表 248320最大支持 262144 token 上下文联合 Schema 头Joint Schema Head一个小型 transformer 头见 joint_head_config.json4 层、宽度 1024、16 头、2 层证据路由读取骨干的最终隐藏状态把状态中的证据路由到各个问题并联合打分所有问题的所有选项——每个允许选项产出一个 logit按问题做 softmax 就得到概率。仓库核心文件一览文件作用model-00001-of-00004.safetensors ~ 04骨干权重含视觉编码器分片存储joint_head.safetensors joint_head_config.json联合 Schema 头joint_schema_model.py记录编码encode_record、批处理collate_records、模型加载load_release_model与systemoneAPI 封装tokenizer.json、chat_template.jinja、processor_config.json分词器与图片/视频处理器视频按 2fps 抽帧最多 768 帧LICENSEApache-2.0 许可四、硬碰硬Clef vs Clef-Flash vs Jev 基准数据以下数据来自官方 Decision Index 0.2.1 评测完整 35 项见 README.md分数均为百分比基准ClefClef-FlashJevBFCL工具调用98.598.895.8API-Bank工具调用91.993.188.2BANKING77意图分类94.290.979.7家电模拟器指令执行83.097.752.3MMLU综合知识90.391.891.7ContractNLI合同理解81.484.371.7GPQA Diamond科学推理48.051.078.3BBH复杂推理73.768.992.9MMLU-Pro知识推理65.965.382.7ForecastBench预测越低越好13.910.617.4中位延迟ms209.338.8524.1p95 延迟ms238.6122.4536.0 一眼看懂Clef-Flash工具调用、业务执行类任务全面领先延迟是 Jev 的1/13短板是深度推理GPQA、BBH、MMLU-Pro。Clef综合均衡分类、检索类BANKING77、ToolRet分数最高但延迟约为 Clef-Flash 的 5 倍。Jev推理类任务BBH 92.9、GPQA 78.3一骑绝尘但延迟最高更适合离线/低 QPS 场景。端到端业务工作流实测四项真实业务流程发票处理、客服、安全事件、Agent 轨迹观测的决策准确率README.md工作流ClefClef-FlashJev发票处理精确动作64.757.161.8客服精确动作76.377.076.0安全事件精确动作62.961.761.7Agent 轨迹观测主动作68.569.871.6五、选型指南你的业务该选哪一个✅选 Clef-Flash如果你的场景是高吞吐、低延迟的在线决策中位 38.8msp95 122.4ms需要多模态输入发票扫描件、小票截图、监控画面甚至视频工具调用 / 指令路由 / 表单化业务判断家电模拟器 97.7、BFCL 98.8希望从 Jev/SystemOne零改造迁移——API 完全兼容。✅选 Clef如果你的场景是离线批处理、对延迟不敏感追求榜单最高精度意图分类、合同/金融实体抽取BANKING77 94.2、FinEntity 97.1端到端工作流中动作必须严格匹配发票处理 64.7 全场最高。✅选 JevSystemOne 官方 API如果你的场景是不想自运维模型直接调用托管服务任务偏深度推理BBH 92.9、GPQA 78.3或复杂知识问答QPS 不高、可接受约 524ms 的中位延迟。一句话总结在线高并发 多模态 → Clef-Flash离线要极致精度 → Clef省心托管 强推理 → Jev。六、快速上手三步跑起 Clef-Flash环境要求torch2.11、transformers5.10.2单张 H200 即可多模态输入需额外安装pillow。第 1 步获取模型git clone https://gitcode.com/hf_mirrors/Cloudflare/clef-flash第 2 步加载模型与处理器joint_schema_model.py 提供了load_release_model传入本地路径与设备即可自动组装骨干 联合 Schema 头。第 3 步用 SystemOne 接口发请求systemone函数接收与 Jev/SystemOnePOST /v1/systemone完全相同的请求体返回按问题 ID 组织的answers含choice/score/noul三类答案、置信度与概率分布。一个典型请求长这样{ model: clef-flash, state: Our checkout started returning errors and orders are blocked., questions: { department: {type: choice, criteria: {billing: Payments, technical: Bugs or outages}}, outage: {type: noul, instructions: Is a service down?} } }纯文本与图文记录可以混在同一个 batch 里推理encode_record还支持max_length默认 16384 token与max_state_tokens限制输入长度。七、常见问题 FAQQ1Clef-Flash 能处理图片和视频吗可以。视觉编码器随骨干一起发布images传 PIL 图片、videos传帧数组即可processor_config.json 中视频默认 2fps 抽帧。Q2没有 H200 能跑吗官方测试环境是单张 H2009B 参数量级、bfloat16 精度下其他 80GB 级 GPU 通常也可运行具体以实测为准。Q3许可证允许商用吗允许仓库采用Apache-2.0见 LICENSE。Q4三个模型能混合部署吗可以。Clef-Flash 与 Jev/SystemOne API 完全兼容常见做法是在线热路径用 Clef-Flash 扛量疑难样本再路由到 Clef 或 Jev 复核。数据来源官方 Decision Index 0.2.1 内部评测与 Typesafe Evals 工作流评测详见 README.md。【免费下载链接】clef-flash项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clef-flash创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考