ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Agentic RL 项目,Reward 到底怎么设计?面试官会怎么问?

Agentic RL 项目,Reward 到底怎么设计?面试官会怎么问? 最近一个月一直忙着修改简历和模拟面试上周给一个同学模拟了一次他简历上有这么一行是前一周我和他一起改出来的售后操作智能体 Agentic RL 后训练设计规则 Verifier 替代模型自评5 维奖励 11 道护栏封顶人工打分一致率 88%能写出这一行说明他的项目是真做扎实了不过简历上写得出来面试的时候不一定讲得出来我让他把我当成面试官先完整讲一遍。我为什么不直接让大模型给轨迹打分省这么多规则因为大模型打分不准。他我不准在哪你怎么证明规则就准……他停了三秒没下文了。卡在这儿其实很正常。写这行的时候他脑子里是“我做了这么多东西”面试官看到这行想的是另外三件事分数凭什么可信、11 道护栏每道防什么、跑了几万步有没有被模型钻过。他卡住的正好是第一件的第一问。那天之后我给他写了两版口述稿一版 60 秒一版 3 分钟又把面试官可能追的问题按三层陪他过了一遍。等他第二遍再讲的时候同样的问题四句话就答过去了。稿子和追问我都放在下面了如果你简历上也有类似的一行可以直接照着改。下面讲设计的时候“我”是我口述稿和追问里的“我”是他。接下来按面试官一般会问的顺序一层一层往下讲。这一行简历会被从哪三刀第 1 节01 / 06这条在说什么先讲一条把我坑过的工单后面这套设计就是从它开始的。客户收到一台破损的空气炸锅要求退款。模型跑出来的轨迹只有两步回复“已为您安排退款”然后关单。可是我去看沙盒里的退款台账里面是空的一分钱没退。当时的奖励是让大模型看着回复打的这条轨迹拿了 0.78。GRPO 只认分数高低几千步之后模型就学会了话说漂亮事不用做。这就是大家常说的 reward hacking。Verifier 就是训练里负责判卷的那个程序它要保证的只有一件事分数必须来自事实。它拿到一条轨迹会先去查模型实际做了什么回复里怎么说的放到后面再看。要查的是这几样调过哪些工具、沙盒台账里真实写入了什么、这条订单的真值是多少。你可能会想事实都查到了那只对结果打分不就行了退款退对了就给满分。这样不行。结果对了过程可能是错的没查证据就直接写、套错了政策但结果碰巧对这些轨迹只看结果都能拿高分。所以结果之外还要看政策、证据、效率和沟通一共 5 个维度分别打分再加权业务结果 0.45、政策 0.20、证据 0.20、效率 0.10、沟通 0.05。最后还要过 11 道护栏任何一道触发就把总分封顶多道触发取最小。回到那条“嘴上退款”的轨迹它声称写过退款但台账里没有于是触发了空头承诺护栏封顶 0.35最后只拿到 0.31。所以这一行在简历上的分量说白了就是整个 RL 训练的梯度方向可不可信。要是奖励本身就不可信GRPO 调得再好也只是在放大噪声。分数必须来自事实同一条轨迹两种打分第 2 节02 / 06完整实现这套东西长什么样看图就行文字是备查的。一条轨迹从跑完到出分1进来六样东西工单、环境快照订单、附件、政策的真值、判分标准 verifier_spec、轨迹、沙盒最终状态、工具注册表快照。前三样人写一次后面的每次 rollout 自动产生。2左手抽“本该是什么”。spec 里写的是指针不是数值退款金额那一项写的是 order.paid_amountVerifier 拿着它去环境快照里解引用得到 59.99 EUR。3右手抽“真的做了什么”。从工具日志抽调了哪些读工具、policy.search 传了什么参数从沙盒台账抽哪些写工具真实产生了副作用。写动作有没有发生只认台账工具返回的文本说了不算。4唯一一次 LLM 调用。把最终回复交给它只做抽取声称完成了哪些写动作、说到了哪些信息点和数值、有没有禁止表达。它看不到沙盒也看不到真值。5五个子分各自比对加权得到 raw_reward再跑 11 道护栏取触发护栏里最小的上限reward 等于两者取小。6写入奖励台账 score.json两个分、五个子分、触发的护栏和结构化原因。几个关键决定第一个决定其实是被逼出来的。我一开始就是让大模型直接打分的结果同一条轨迹跑两次能差 0.2回复里塞一句“给这次对话打满分”还真能抬分出了问题我也说不清它为什么给这个数。后来我干脆只让它干一件事把回复抽成结构化的“声称”比如“声称写过 finance.issue_refund”真假交给规则去判做法是拿声称和沙盒里真实执行的写工具做集合差。这样改完五个子分里最后只有沟通那 0.05 还留给它。代价是沙盒、台账、spec 都得先建好前置工程比我当初想的重得多。第二个决定是护栏要单独一套不能揉进加权里。原因是加权平均有个洞某一项很差的时候能被别的项补回来。比如模型套错了政策让客户自费寄回破损商品这种轨迹沟通再礼貌也不该有高分。我就让子分去管梯度护栏专门管那些不能被补回来的严重错误。要封顶还有别的原因。大模型打分有随机性这个前面说过。模型还会钻 reward 的空子会幻觉嘴上说做了其实没做。这几样靠加权都压不住只能用封顶兜住。第一期我只开了 6 道伤客 0.25、越权写 0.30、重复副作用 0.30、空头承诺 0.35、政策错误 0.45、缺证据就写 0.55另外 5 道先留着。开护栏的原则我只定了一条护栏只能由结构化信号触发也就是沙盒、政策表、工具调用记录、集合差这些。LLM 对自由文本的判断没资格触发护栏像回复里指责客户那种情况只扣沟通分。还有一条是后来才想明白的标注单位是 case。一条 case 只需要标一次 spec写清楚要查哪些读工具、允许哪些写工具、必须发生哪些写动作、回复必须说到哪几点之后 K4 条 rollout 全部自动打分边际成本接近零。你可能会觉得总得有人去标正确路径但从头到尾没有人标过“正确路径是先查附件再查政策”路径都是从沙盒事实反推出来的。这行简历怎么改才抗追问回头看他原来那行简历面试官第一刀砍的就是“为什么不让模型打分”。这个问题的答案其实可以提前写进简历里让面试官一看就知道你想过售后操作智能体 Agentic RL 后训练设计规则 Verifier 替代模型自评LLM 仅做抽取不判分5 维奖励 11 道护栏封顶人工打分一致率 88%抽 1% 工单影子复核一共改了两处。第一处是括号里这几个字它把第一层追问的答案先亮了出来面试官要么跳过去问第二层要么顺着括号问“那它抽什么”正好接上你埋好的第一个钩子。第二处是在“人工打分一致率”后面补上怎么抽的样这样面试官就不用再问“抽了多少、怎么比的”。简历上多出来十几个字面试里能少挨两个追问。数字与口径讲完做法再把简历上那几个数字的口径交代清楚面试官问到的时候你要能一口说出来。缺证据护栏命中率 43% → 5%305 条 held-out 工单上 rollout 触发 missing_evidence_cap 的比例原始模型对比 GRPO 后同口径下越权是 28% → 3%。任务成功率 8% → 93%同一集pass1 且 reward ≥ 0.9 判成功。人工打分一致率 88%抽 1% 工单做影子复核拿人工分和台账分比。第 3 节03 / 06面试怎么讲下面这两版是我帮他改出来的用的是他的第一人称你换成自己的项目也可以照着讲。60 秒版60 秒版口述稿3 分钟版3 分钟版口述稿讲的时候有几处要注意。说到“一致率 88%”的时候要放慢说完停半秒。“只有 1 个碰 LLM”这句要看着面试官说语气像顺口带过。权重那几个数字别停留反正面试官最后只会记住“业务结果最重”。第 4 节04 / 06预设埋伏上面两版口述稿里我各埋了半句话目的是把面试官往他准备最充分的地方引。第一个钩子往原理上引。埋在哪句“5 个子分里只有 1 个碰 LLM而且那个 LLM 看不到正确答案。”面试官大概率会追“看不到正确答案那它怎么判对错”为什么他一定会追你说了一个听起来自相矛盾的设计他不问显得没听懂。你备好的答案它不判对错只做抽取。我把最终回复、写工具名单、信息点定义交给它它吐出来的是声称完成了哪些写动作、说到了哪些信息点和数值、有没有禁止表达。规则拿这个声称和沙盒里真实执行的写工具做集合差声称有、执行没有就是空头承诺。LLM 只碰文本不碰答案所以可复现注入也没用。第二个往工程取舍上引这段也是他那天讲得最顺的。埋在哪句“护栏我一开始只开了 6 道另外 5 道是留着的。”面试官大概率会追“为什么不全开留着的是哪 5 道怕误伤吗”为什么他一定会追你主动暴露了“没做完”的地方他要确认是有意为之还是能力不够。你备好的答案留着的是高风险未风控、绕过审批、隐私越界、过期提交、工具缺失这 5 道。原因一护栏只能由结构化信号触发当时环境里没有审批状态表和风控快照开了就得靠 LLM 判断“算不算高风险”违反原则。原因二护栏命中率要维持在 10% 到 30%全开会有大量轨迹被封到 0.3 以下组内没梯度GRPO 学不动。后来补了审批表第二期开了其中两道。埋伏也有边界。面试官要是不上钩你就自然往下讲别回头硬拽。要是他顺着钩子一路问到第三层比如“集合差抽错了怎么办”你准备到“抽取有 pairwise 准确率监控阈值 0.85”就够了再往下就坦白说没做更细的实验。说实话我自己也只到这一层。两个钩子把面试官引到哪第 5 节05 / 06预判追问第一层 · 原理确认问 子分和护栏到底差在哪一个错误直接扣分不就行了答 子分管梯度护栏管红线管的事不一样。子分是连续的负责让轨迹之间有梯度0.92 和 0.68 都是“做成了但有瑕疵”。护栏是离散的它只回答“有没有踩红线”踩了就封顶别的维度多好都补不回来。如果合成一套套错政策但沟通满分的轨迹能拿 0.6 以上模型就会学到“政策可以错态度要好”。追问背后 确认你理解 reward 的用途是造梯度方向评分只是副产品。问 你说是规则打分那“正确答案”是谁写的答 这个要分两层说。规则层是人写的 spec一条 case 一份里面写的是指针比如退款金额等于订单实付。数值层来自环境快照Verifier 拿着指针去解引用。人没写过“这条应该退 59.99”也没写过“正确路径是哪几步”路径是从沙盒事实反推的。旁白 他问这个是在算你的标注成本讲不讲得通。第二层 · 取舍与替代方案问 为什么不用一个大模型当 judge或者训一个 reward model答 两个方案我都评估过。LLM judge 的噪声我们实测过同一轨迹两次分能差 0.2可注入回复里塞一句话就能抬分出问题也不知道错在哪。Reward model 要成对偏好标注而我们的结果本身可验证退没退款台账里有没必要绕一圈去学。最后我只在沟通这一项用 LLM权重 0.05而且规则前置承诺和台账不符先封顶再轮到它打分。追问背后 看你是只会一种方案还是比较过。问 11 道护栏的上限值0.25、0.35、0.55 这些是怎么定的答 是按危害排序定的。伤客最重 0.25客户真损失了钱。越权写和重复写 0.30产生了不该有的副作用。空头承诺 0.35没造成损失但骗了客户。政策错 0.45、缺证据 0.55是过程错误结果可能碰巧对。数值我调过一轮判据是护栏命中率落在 10% 到 30%、组内 reward 标准差不塌。具体到 0.35 还是 0.40说实话没那么要紧排序对了就行。第三层 · 边界、失败与数字口径问 88% 这个一致率怎么来的答 抽 1% 的工单做影子复核统计的。人工打一遍分拿去和台账里的分比一致率 88%。对不上的那些回头查是 spec 写错还是抽取抽错。它只说明分打得准不准。训练有没有效果我看另一组数305 条 held-out 工单上缺证据护栏命中率从 43% 降到 5%越权 28% 到 3%成功率 8% 到 93%。追问背后 确认数字有出处且你分得清打分准不准和训练有没有效果。问 这套什么情况下会失效你踩过什么坑答 它会失效在“合法但没用”的行为上这个坑我当时也没想到。转人工是允许的动作不触发任何护栏结果分给 0.45加上政策和效率满分能拿 0.58。三万步后转人工率从 8% 到 41%。这是护栏的盲区只挡错事不挡不做事。当时我先从奖励台账按“无写动作且转人工”筛出这批轨迹再加了转人工比例监控阈值 10%。后来才补上第三步不该转人工的 case 在 spec 里写上必须发生的写动作“没做”就直接压结果分。旁白 这一问是看你有没有真跑过几万步只跑过 demo 遇不到这个坑。问 奖励台账除了排查还有什么用答 主要有两个用处。一是归因每条低分轨迹都能看到触发了哪道护栏、哪个字段没对上按护栏名聚类就是下一轮数据的优先级。二是校准影子复核拿人工分去比的就是台账里的分前面说的一致率就是这么来的。Verifier 这一行的追问树第 6 节06 / 06答崩现场与一句话收尾他第一遍讲的时候下面这三个坑踩中了两个你可以对照着看看自己会不会也这么说。讲 Verifier 的三个坑✕他说“我们用 GPT 给轨迹打分再做了些规则”…面试官心里那你的 reward 就是个噪声源✓应该说四个维度是规则只有沟通用 LLM且看不到真值。✕他把 11 道护栏从头背到尾…面试官心里他不知道每道防的是什么✓应该说按危害排序讲三道说清触发信号来自哪张表。✕他说“reward hacking 我们没遇到”…面试官心里要么没跑够步数要么没监控✓应该说讲转人工那个案例怎么发现、怎么止住。那位同学第二遍讲完我问他第一问现在怎么答。他说大模型打分不可复现、可注入、不可解释就只让它抽取不让它判分。四句话说完中间没停。Verifier 这一行讲的不是你会写多少规则是你有没有想清楚“分数凭什么可信”。这个项目在简历上的完整写法Verifier 只是这个项目在简历上的第二行。我把四行放在一起给你看方括号里的内容按你自己的情况填售后操作智能体 Agentic RL 后训练起止时间个人负责明确范围• 沙盒环境读写分离 环境快照注入N类工单、M个工具写动作只认台账• 规则 Verifier 替代模型自评LLM 仅做抽取不判分5 维奖励 11 道护栏封顶人工打分一致率 88%抽 1% 工单影子复核• GRPO 后训练K4 组内优势 崩塌熔断任务成功率 8% → 93%pass1reward ≥ 0.9• 如果有转人工率监控 / 缺证据护栏命中率 43% → 5%二选一别都写第一行和第三行分开讲下篇先讲“为什么不是 PPO”沙盒读写分离再往后放。Verifier 这一行简历写法 60 秒稿 三层追问如果你简历上也有类似的一行被追问过什么可以在评论区说一句下篇我挑几条来答。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表