
判断模型SystemOne的对比 lev、Jev、JevK5、decider、laya 与 kev摘要这六个模型做的是同一件事读一段状态在你给定的选项上给出概率不生成自由文本。能放在同一张卷子上的只有 S1Bench 已完成的六个子集。Jev 的准确率和校准领先lev 与同尺寸的开源模型站在一档decider 快一个数量级但榜上带有训练集污染标记。JevK5 不在这张榜上。以一张 10GB 的消费级显卡为例选项不多时本地默认用 JevK5选项经常超过十六个时改用 lev。它们回答的不是下一句聊天模型的输出是一段新文本。System One 的输出是一个分布是或否的概率、多选里的一项或若干档位上的期望分数。选项集合由调用方当场给出模型不能交回集合之外的标签因为答案空间就是这些选项。它仍然可以选错。结构上的保证不是正确性的保证。六个模型共用这一接口形态线上协议是/v1/systemone。差别在基座、读出方式以及概率有没有被校准过。基座怎么读答案选项与上下文权重Jev闭源RLCD专有最多 255 项只有托管 APIlevQwen3.5-4B LoRA r32单 token 标签读 logit放不下时改用学过的匹配头。按题型、读出方式、选项数量分段设温度标签码到几百项匹配头没有固定上限Apache-2.0JevK5同一 4BLoRA r16已合并进权重SemIf对答案字母做 softmax再除一个温度。超过 16 项分多趟 knockout超过 16,384 token 直接拒绝Apache-2.0decider-2bQwen3.5-2B-Base6 层全注意力 18 层 delta-net标签 token固定 schema 可跨请求缓存255 项上下文 32k开源自报训练集污染layaModernBERT-large421M另加 2 层编码器在 mask 位置给选项打分状态上限512 token开源kev-0.5bQwen2.5-0.5B LoRA 读出头小模型上的读出头能在笔记本上跑开源banking77 自报污染lev 和 JevK5 用的是同一个 4B 基座读法不同。lev 的温度是分段的JevK5 v0.3 是一个全局温度大选项集再加第二个 knockout 温度公开材料为 1.22 和 0.93。decider 的双 prompt 布局和 schema 缓存是 lev 设计时明确参考过的。Snake 演示则是从 laya 移植的规则和提示词保持原样以便对照。中文意图如果要一个写明支持中文的检查点对应的是另一个模型laya-multilingualmmBERT-base约 322M不是上表里参加 S1Bench 的 laya-gpu。下文分开写。同一张卷子S1Bench 六子集S1Bench 有两组数字。完成组是 6 个子集、每个目标 1,999 条决策可以横比。中途停掉的运行只做了其中一个子集不能拿来排座次。下面这张图里Jev、decider-2b、laya-gpu、kev-0.5b 用的是榜上自己的 harness。lev 不在原榜上0.719 是本仓库用同一批题重跑的结果。重跑的 Jev 在这六个子集上是 0.769比榜上的 0.775 低 0.6 个点差距几乎全在 aegis2 这一项。所以 lev 和榜上模型差半个点以内时不要读成已分出胜负。带 † 的两个目标榜单记了作者自己声明的污染decider-2b 用了大量公开决策数据集其中包含 S1Bench 的子集kev-0.5b 涉及 banking77。模型在评测时见过相近的题分数会被抬高而且看不出来抬了多少。lev 的数据构建会直接拒绝全部 13 个 S1Bench 子集因此 0.719 和 0.703 不是同一套条件下的比较。把 decider 读成「只比 lev 低 1.6 个点、还快得多」这个读法不成立。十三个子集的完整对照只在 lev 和 Jev 之间做过3,880 条同一 harness宏平均准确率0.689 对 0.761平均 ECE0.115 对 0.091。lev 在 multinli、helpsteer2 上略高差距落在抽样噪声里在 paws、vitaminc 上落后约 12 到 13 个点在 summeval-consistency 上落后 54 个点未微调的基座在这项上反而有 0.826。这个子集的宏平均不要和上面的六子集混着念。速度也分口径。榜上的「决策/秒」不能和 H100 容器里的前向时间画在同一根轴上。Jev 的 2.39 决策/秒是托管 API延迟里含网络中位数大约 0.42 秒一次和厂商自己说的 70–500 毫秒同一量级。它比让大语言模型逐 token 吐 JSON 快两个数量级又比 decider、laya 这类本机小模型慢大约一个数量级。lev 公开的 69 毫秒是 H100 上短请求的引擎计算从笔记本打到同一张卡的端到端是 414–654 毫秒。消费级显卡会更慢短文本仍然是交互式的。另一张卷子JevBenchJevK5 没有出现在 S1Bench 完成榜上。它的公开名次在 JevBench。那张榜把智力、校准、速度、成本合成一个 0–100 的综合分。lev 没有提交下面的分数不能和上一节的准确率相加或相减。综合分智力校准速度难题密封集decider-4b v264.149.475.092.967.3%34.7%Jev 1.13.063.353.176.383.374.1%36.7%JevK5 v0.262.048.974.591.170.0%33.1%这里的 decider 是后来的 4B v2不是 S1Bench 上的 2B。综合分领先主要来自本机 GPU 的速度和成本。论答对率Jev 仍在前面智力 53.1 对 49.4难题 74.1% 对 67.3%。JevK5 v0.3 当时还没交到这张榜。作者在公开题上的自述是难题准确率从 v0.2 的 0.739 到 v0.3 的 0.784H100 上开 CUDA graph 大约 13 毫秒一次。选项一多两套读法就分开了。JevK5 超过 16 个选项要拆成多趟MASSIVE 的 60 类大约 0.74banking7777 类大约 0.65–0.69。lev 把这类大标签集改走单 token 读出之后held-out 上 banking77 到过 0.980。这是读出路径的差别不是「4B 比 4B 更聪明」。校准比多答对几道更值钱probabilities是分布对数损失、Brier、ECE 打在它上面。confidence不是模型另预测的一个数而是从这个分布算出来的集中度分布越尖越高越平越低。Jev 上核对过的公式是机会校正后的最大概率(K·max(p) − 1)/(K − 1)。ECE 低只说明概率和实际命中率对得上不说明任务做得好。榜上 ECE 最好的开源条目准确率比 Jev 低二十多个点它对自己的不确定是诚实的但判断本身弱。未做温度校准的原始骨干ECE 可以到 0.4 以上置信度几乎不能用。所以选型时看两列不要只看准确率六子集上榜内 Jev 的 ECE 是 0.076。lev 在本仓库同题重跑里这六项的 ECE 是 0.123十三项平均是 0.115Jev 是 0.091。lev 在十三项里的五项上校准更好最差的地方也是它最不准的地方。decider-2b 的 ECE 0.114、laya-gpu 0.130、kev-0.5b 0.149都差于榜上的 Jev。decider 的数字还带着污染标记。score不是百分制。它是各档下标的概率加权平均从 0 档起算。返回 2.27表示质量落在第 2 档和第 3 档之间不是「2.27 分满分 5」。置信度很低时概率摊在相邻几档上这个分数不适合拿来做自动拦截。中文基座能读不代表概率校准过lev 的发布说明把适用范围写成英文因为微调数据和校准温度都来自英文任务。基座 Qwen3.5-4B 能读中文德语意图分类也测到过 0.823但发布时没有中文评测。你发中文它会返回一个选项和概率这些数没有在中文上校准过。JevK5 的模型卡同样写的是只支持英文。Jev 没有公布中文成绩。明确把中文列进语言列表的是laya-multilingual。接口仍是/v1/systemone权重大约 647MB10GB 显卡放得下。官方在 MASSIVE 的 51 种语言上测过意图分类宏平均准确率 0.366随机猜是 0.050英文检查点在这些语言上是 0.227。这是「比瞎猜强并且比英文检查点更能跨语言」不是英文 S1Bench 上 0.8 那一档。一份使用笔记里它的是/否题经常把概率顶到接近 1。换上去之后用你自己的中文句子对一下再决定能不能拿概率做自动判断。本机上用 lev 对过四则短句中英文选项对齐。这不是评测集只能说明直白的路由它跟得上。场景英文中文设置崩溃该谁处理technical0.57是故障 0.95technical0.90是故障 0.96差评骂人complaint0.29有毒性 0.45complaint0.71有毒性 0.71银行 Python 候选人匹配 2.83建议面试 0.97匹配 2.60建议面试 0.94周五前会签的合同contract0.64认为今天要回 0.95contract0.83认为今天要回 0.94四道多选和三道是/否中文都判对了。两道打分的方向也对置信度只有 0.17 和 0.28。严重度 2.27 落在「功能用不了」和「完全无法使用」之间可以这么读候选人匹配 2.60 停在「部分匹配」和「匹配较好」之间偏保守。差评那题英文更犹豫毒性 0.45若按超过 0.5 才算「是」会判成没有毒性。中文选项写了说明英文只写了键名置信度更高有一部分是题面信息更多不全是语言本身。周五前会签却给出「今天要回」0.95中英文一样偏高。10GB 显卡上怎么排下面按一张 RTX 3080、10GB 显存来排。4B 的 bf16 大约 8GB 权重再加运行时开销10GB 刚好够一个不够两个同时驻留。默认是 JevK5。官方写明大约 9GBLoRA 已经合并装完就是一个模型。它和 lev 一样是 Qwen3.5-4B、零输出 token、本地提供/v1/systemone。H100 上大约 13 毫秒一次3080 会慢一些。显存顶满时可以用它的 GGUF作者报告 Q5 在 231 道公开题上有 224 道和原权重答案相同。Jev 没有可下载的权重这一档仍然是托管 API。选项经常超过二三十个时改 lev。代价是基座加 LoRA10GB 上更紧而且仓库里的速度是在 H100 上测的。decider-2b 不是不能装是不该因为「只低 1.6 个点」就当成默认。它的强项是本机速度、32k 上下文、最多 255 项以及可以缓存固定 schema。3080 跑它很轻松。弱项是六子集上那个 0.703 带污染标记而你的卡放得下 4B没有必要为了显存降到 2B。后来的 decider-4b v2 会和 JevK5、lev 一样顶满 10GB综合分高在速度答对率仍低于 Jev。laya-gpu421MCPU 也能跑准确率 0.625状态一长就被 512 token 截断共享状态这件事先不成立。要中文覆盖看 laya-multilingual不要把它的 0.366 和 laya-gpu 的 0.625 当成同一个模型的两个分数。kev-0.5b放得下。六子集准确率 0.493速度仍是那张榜上最慢的一档0.55 决策/秒还带 banking77 的污染标记。它适合确认「这台机器能不能跑起来」不适合作为判断质量的默认。一次只启动一个服务。权重可以都留在磁盘上切换就是停掉当前进程再开下一个。各自用独立环境避免 torch 和 transformers 的版本互相覆盖。端口可以这样分lev 8000JevK5 8090decider-2b 8100。客户端只改地址state和questions不动。fromtypesafe_sdkimportTypeSafeClient clientTypeSafeClient(base_urlhttp://localhost:8090,api_keylocal,timeout120)8090是 JevK5改成8000是 lev改成8100是 decider。Jev 仍指向它的托管 API。写在数字后面这篇文章比较的是「给定状态和选项返回一个校准过的分布」不是聊天质量也不是谁更能写中文。把判断模型接进产品时生成回复的仍然是另一个语言模型判断结果如果没有写进那一次生成的提示词它就不会改变句子只会影响你怎么展示和排序。数字有三处不能混S1Bench 六子集、十三子集、JevBench 综合分是三套口径。榜上的 harness 和本仓库重跑的 harness差零点几个点是测量不是模型。带污染标记的分数不能当作干净持有集上的准确率。单次子集差异大约要 5 到 9 个点才超出这类样本量下的噪声。文中的 0.719 与 0.7189同基座、未做本文这套微调的 reflex-4b是同一水平不是谁赢了一局。出处lev 仓库README.md的十三子集表docs/FINDINGS.md§9S1Bench 完成榜与 §17十三子集同题重跑docs/ARCHITECTURE.md的模型解剖。JevBench 综合分与分项2026 年 9 月公开榜v1.4.2 口径。decider-4b v2、Jev 1.13.0、JevK5 v0.2。JevK5Hugging Facealibiserikbay/JevK5模型卡显存、16 项 knockout、温度、GGUF、英文范围。laya-multilingualconvaiinnovations/laya-multilingualMASSIVE 51 语言意图分类。