ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何给Agent技能做防作弊评测?Yao Meta Skill的train/dev/holdout与盲测体系完整指南

如何给Agent技能做防作弊评测?Yao Meta Skill的train/dev/holdout与盲测体系完整指南 如何给Agent技能做防作弊评测Yao Meta Skill的train/dev/holdout与盲测体系完整指南【免费下载链接】yao-meta-skillYAO Yielding AI Outcomes. A rigorous engineering, evaluation, governance, and portability system for reusable agent skills.项目地址: https://gitcode.com/gh_mirrors/ya/yao-meta-skill给 Agent 技能写评测集最大的陷阱是自己出题、自己答题——改描述直到训练集全绿上线却翻车。开源项目Yao Meta SkillYAO Yielding AI Outcomes提供了一套严谨的 Agent 技能评测方法论用 train/dev/holdout 数据集切分、盲测blind holdout、对抗样本和晋升门禁防止技能描述过拟合小基准集。下面带你完整拆解这套防作弊评测体系。为什么Agent技能评测容易作弊Agent 技能的触发描述description决定了什么时候该激活这个技能。优化它和调模型参数很像你不断改写描述用一组提示词测试改到测试集全过就觉得变强了但这组提示词已经被看过了成绩虚高更糟的情况是路由偷占route theft为了多触发自己把兄弟技能该触发的场景也抢过来或把本该不触发的提示词也触发了。Yao 把这类风险写成正式的晋升策略只有当候选版本不仅局部更好而且在路由边界上可测量地更安全时才允许晋升。数据集切分train / dev / holdout 各管什么核心目录在 evals/README 说明了完整结构evals/README.md数据集路径职责回归全集evals/trigger_cases.json带 family 标签的完整回归集合训练集evals/train/参与迭代调优的提示词开发集evals/dev/仅用于给候选版本排名不授权晋升验收集evals/holdout/最终验证要求不回归盲测集evals/blind_holdout/不参与候选排名的验收提示词对抗集evals/adversarial/更难的路由冲突提示词混淆集evals/confusion/兄弟技能路由用例抓偷路由以 evals/dev/trigger_cases.json 为例每个数据集分成三类桶源自评测手册should_trigger明确该触发的提示词验证召回率。比如把这份运维清单转成可复用技能should_not_trigger明确不该触发的验证精确率。比如翻译这些笔记到法语并保持结构不变near_neighbor长得像但属于别的技能或不需要技能抓假阳性每条用例还带family标签如workflow_to_skill、paraphrase_trigger、long_context_trigger用于按家族统计——即使总分上升某个家族悄悄变差也会被发现。盲测体系让考试和复习彻底分开盲测集 evals/blind_holdout/trigger_cases.json 的设计意图很直接优化描述时不准看这些题。比如其中的负例把这个流程说明转成 wiki 参考文档不要创建任何技能文件——措辞与打包成文档高度重叠是典型的边界陷阱。运行方式是用裁判脚本做第二意见python3 scripts/judge_blind_eval.py --description-file SKILL.md \ --cases evals/blind_holdout/trigger_cases.json \ --semantic-config evals/semantic_config.json它基于 rubric评分细则对盲测提示词给出独立判分避免描述里悄悄塞进盲测原题这种作弊路径。语义配置 定义了本地意图概念、排除词与权重保证判分标准统一。对抗集给路由边界加压evals/adversarial/trigger_cases.json 里的样本更刁钻包含带噪声的正例和欺骗性的不触发请求例如正例会议杂音里夹一句把这套支持升级流程做成维护中的技能包负例总结这份 SOP 并翻译成日语放进知识库只当文档用——翻译、总结、SOP 全是触发技能的高频词但意图明确是纯文档对抗风险带必须保持healthy才允许晋升共享或受治理的资产。六道晋升门禁dev分数再好也不能直接上线evals/promotion_policy.md 定义了完整的晋升流水线dev 分数只是第一道Dev 排名只在 dev 上比较候选优先级是更少误报 → 更少漏报 → 近邻更强 → 措辞更短。dev 本身不授权晋升可见 holdout 不回归不能新增任何误报/漏报盲测不回归盲测上不能新增任何误报/漏报对抗不回归对抗集风险带须为healthy路由混淆门禁如果技能库里有兄弟技能路由记分卡必须干净——不允许误路由歧义分差不得超阈值家族稳定性不允许出现新的失败盲测家族或对抗家族三种结局Promote全部门禁通过、Keep Current只是 dev 更好或有门禁回归、Block对抗风险变成overlap、偷了兄弟路由、或本不该路由的提示词开始触发。这套机制直接回答了为什么需要它防止元技能只是因为过拟合了一个小基准而看起来被优化了。混淆矩阵防止抢兄弟技能的路由当技能不是单独存在而是技能库一员时光看自己够不够准还不够。evals/confusion/route_cases.json 把多个技能的路由放在一起考每条用例声明expected_route比如跑一次合并前前端审查必须路由到team-frontend-review而不是yao-meta-skill配置margin_warning_threshold0.08两个候选路由分差过小就标记为歧义同时跟踪no_route不该路由进任何技能的提示词必须留在门外生成的路由记分卡展示混淆矩阵每条路由的精确率、召回率、平均分差一目了然。配套的 evals/failure-cases.md 则持续记录当前仍弱的场景如一次性提示词请求只改文档不做技能作为长期回归检查项而不是修完就删。如何跑起整套评测常用入口都在 evals/README.md 中列出核心命令包括# 单跑触发评测对比基线描述 python3 scripts/trigger_eval.py --description-file evals/improved_description.txt \ --cases evals/trigger_cases.json --baseline-description-file evals/baseline_description.txt # 跑完整评测套件 python3 scripts/run_eval_suite.py # 生成混淆矩阵与评测仪表盘 python3 scripts/build_confusion_matrix.py python3 scripts/render_eval_dashboard.py对比用的基线描述故意写得弱Create and improve agent skills.与当前更强的描述形成可量化的进步证据。生成的报告落在 reports/ 目录如描述优化报告、漂移历史description_drift_history.md等。新手可落地的最小实践不需要一步到位按 references/eval-playbook.md 的分层标准起步即可个人技能2 条真实提示词 人工审查团队技能3 到 5 条真实提示词加上近邻用例修订循环顺序先修边界/描述问题再动正文把脆弱逻辑移进脚本或模板每次改完用同一套评测集重跑再扩大范围核心要点回顾实践防住的作弊train/dev/holdout 切分在复习题上刷分盲测集 裁判脚本把验收题泄进训练过程对抗集靠表面高频词侥幸通过路由混淆矩阵偷占兄弟技能的路由家族稳定性门禁总分涨但某类场景悄悄退步总结Yao Meta Skill 的评测哲学一句话评测集的价值取决于它有多干净而不是它有多难。用数据集切分隔离复习与考试用盲测和对抗样本抬高作弊成本用多重晋升门禁把看起来更好变成可证明更好。当你开始认真维护可复用的 Agent 技能时这套 train/dev/holdout 盲测 混淆矩阵的组合拳值得直接抄作业。【免费下载链接】yao-meta-skillYAO Yielding AI Outcomes. A rigorous engineering, evaluation, governance, and portability system for reusable agent skills.项目地址: https://gitcode.com/gh_mirrors/ya/yao-meta-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表