
零训练新闻推荐器JEV-27B-VL 如何在 MIND 数据集上实现 AUC 0.642 的完整实战指南【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VLJEV-27B-VL 是一个开源的零训练zero-shot多模态决策模型一次前向推理就能对任意选项输出校准概率。它无需任何训练在 MIND 真实新闻推荐数据集上达到AUC 0.642——超过所有零样本基线甚至超过在该数据上训练过的传统排序模型。本文带你完整走一遍它是什么、实验怎么做、结果如何以及如何一键部署并调用这个零训练新闻推荐器。JEV-27B-VL 是什么一个会做决策的大模型 大多数人用大模型的方式是问一句、回一段文字而 JEV-27B-VL 的定位完全不同——它是一个决策模型decision model内置了两种工作模式模式做什么输出典型耗时System 1直觉决策对文本或图片做是/否、二选一、0–5 打分判断每个选项一个校准概率一次前向推理完成约 0.1 sSystem 2深度推理完整 27B 模型逐步思考同样支持图片输入文字 / 推理过程数秒对新闻推荐来说System 1 是关键把用户最近点过的新闻标题作为状态state把用户会不会点这条候选新闻作为问题模型直接返回{true: 0.83, false: 0.17}这样的概率——不需要解析 JSON、不需要提示词技巧。更妙的是它的决策头从未见过任何新闻数据也从未在 MIND 上训练过纯靠读标题就能排序。MIND 新闻推荐实验是怎么做的MIND 是微软公开的 MSN News 真实用户点击数据集是新闻推荐领域的经典基准。实验设置详见 README.md 与 blog/JEV-27B-VL.md零训练方式把用户历史点击的新闻标题作为state输入对每条候选新闻问一个 yes/no 问题System 1 输出 P(点击) 作为排序分数——全程零样本不在 MIND 上训练任何参数。传统对照LightGBM 排序模型分别只用1,000 条和4,000 条MIND 曝光记录训练。特征融合方式把 JEV 的零训练打分作为一个特征加进 LightGBM仍只用 1,000 条数据。新闻推荐结果零训练 AUC 0.642超过训练过的模型AUC 越高越好随机猜测约 0.5方法是否在 MIND 上训练AUC随机排序否0.515按流行度排序popularity so far否0.546标题相似度TF-IDF否0.546类目匹配category match否0.606LightGBM1,000 条曝光是0.590LightGBM JEV 打分1,000 条曝光是0.617LightGBM4,000 条曝光是0.616JEV-27B-VL System 1纯零训练否0.642三个值得记住的结论零训练赢过训练模型0.642 高于任何零样本基线最好的是类目匹配的 0.606也高于只用 1/4 数据训练的 LightGBM0.590和用 4 倍数据训练的 LightGBM0.616。一个特征 四倍数据把 JEV 打分加进只用 1,000 条数据的 LightGBMAUC 升到 0.617——恰好追平用4,000 条数据训练的 LightGBM。也就是说一次零训练推理的分数顶替了三倍训练数据。没有冷启动负担传统推荐模型要先积累曝光/点击而 JEV 只需要标题文本新文章上传瞬间就能被排序。快速开始一键部署 JEV-27B-VL 新闻推荐服务仓库自带 serve.sh底层是 vLLM serve_decide.py 扩展的POST /v1/decide决策接口hf download autotrust/JEV-27B-VL --local-dir JEV-27B-VL bash JEV-27B-VL/serve.sh # vLLM 监听 :8000需要一张 80GB 显存的 GPU决策适配器LoRA 决策头位于 adapter_vllm/其中 decision_head.json 定义了各类型问题的词表槽位与偏置calibration.json 保存了每类问题的校准温度——这也是概率可信的来源期望校准误差仅 0.0009。调用决策接口拿到会不会点的校准概率新闻推荐的每个候选本质就是一个 yes/no 决策。任意 HTTP 客户端都能调curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: noul, state: 用户最近点击过: 《央行降准》《AI 芯片出口管制》《新能源补贴政策》, question: 用户会不会点击这条新闻: 《半导体行业年度报告发布》 }返回示意{kind: noul, options: [false, true], probabilities: [0.21, 0.79], choice: true, ...}实战要点kind支持noul是/否、choice2–256 个选项一次排完、score0–5 打分对一批候选新闻循环调用用 P(true) 直接当排序分数就得到零训练推荐列表想加图片如图文混排的新闻封面把state改成文本与图片交错的列表即可System 1 同样一次前向出概率--max-num-seqs 8是必须的参数否则多模态批处理下概率会出错serve.sh 已帮你配好。进阶System 1 只答有把握的剩下的交给 System 2真实线上系统不必让 27B 大模型思考每一题。项目实测的按需升级策略System 1 先答置信度低于 0.70 才转给 System 2 深度思考——70% 的问题在 0.11 s 内解决整体准确率从 0.792 提升到 0.892接近每题都思考的 0.917成本却低得多。这套模式同样适用于新闻推荐里的高价值决策同一范式的其他零训练应用读内容 → 输出点击/选择概率这套 System 1 范式在推荐与裁判任务上都被验证过短视频推荐MicroLens只看用户最近 5 个视频封面 候选封面AUC 0.727与用59,045 名用户行为日志训练出的协同过滤0.728打平且 Top-5 命中率更高59% vs 49%——封面比标题多 0.078 AUC新视频上传第一秒就能被推荐。⚖️模型裁判RewardBenchSystem 1 一次前向判出更好答案的得分 89.9超过 Gemini 1.5 Pro88.2与 GPT-4o86.7。这些细节含对比图表都可以在 blog/JEV-27B-VL.md 里查到实验报告数据位于 reports/。注意事项与局限性 ⚠️MIND 结果是离线评测标题相似度、类目匹配等简单基线在特定场景仍有价值实际系统建议零训练打分 传统特征融合使用System 1 的决策头是在文本上训练的图片决策为零样本排序能力已验证但图片任务的概率校准未经系统测量256K 长上下文需要MAX_MODEL_LEN262144约 17GB 额外 KV 缓存80GB 显卡建议用 128K。总结零训练为什么能打赢训练模型关键点说明校准概率每个选项的概率经过温度校准可直接当分数、可设阈值一次前向无采样、无解析约 0.1 s / 个候选适合排序阶段语义理解大模型读得懂标题与用户历史的语义关联这是 TF-IDF 和 LightGBM 特征缺失的零冷启动新内容无需任何行为数据即可被排序可融合它的打分作为一个特征等于给小模型加了 4 倍训练数据对新手来说最值得记住的一句话是把用户会不会喜欢这条新闻当成一个 yes/no 决策问题交给 System 1拿回的概率就是你的推荐排序分——不需要特征工程不需要训练集一行 curl 就能跑通整个新闻推荐器的核心。【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考