那份文件是周五下班前发出来的
监管发文我见得多了,做金融这行,谁手机里没存着几个"新规解读"的 PDF。但那天不一样。下午五点四十,业务群弹出通知:新产品申报暂停,存量业务限期整改,已上架的三条产品线,两条要下架重报。
我在上海一家金融科技公司做合规方向的产品经理,五年。工作内容说出来有点枯燥:把监管文件翻译成产品需求。每个条款落到页面上,是一个字段、一个弹窗、一段强制阅读十五秒的协议。我桌上常年摆着一摞打印文件,最上面那本小额贷款管理办法的征求意见稿,翻得起了毛边,贴满黄色便利贴。
我的 Excel 里有张整改清单,187 行,每行一个条款对应一个改造点,状态栏标着"已上线"“开发中”“待法务确认”。五年,我最好的战绩是一次现场检查零问题通过。检查组的老师说"你们是我见过最规矩的",我把这句话写进了年终总结。
然后行业说停就停了。销售线先砍一半,工位区肉眼可见地空了一排。我们合规组倒是留着——整改还得有人收尾,但谁都看得出来,这叫善后,不叫前途。
招聘软件教我做人
公司没裁我,但也没活给我干。业务停新,合规 PM 成了全公司最闲的人,闲到我开始刷招聘软件。这一刷,心凉了半截。
金融科技的产品岗,JD 长这样:“熟悉大模型应用,有评测集建设经验者优先”“负责 LLM 产品的效果评估与迭代”。翻来覆去就这几个词:评测、幻觉、RAG。我投了十几份,三个给了面试。
第三个面试我记到现在。面试官翻着我简历问:"你这五年都是合规整改,模型评测做过吗?"我说没有,但可以学,合规的底层是风险控制,跟模型质量管控是相通的。他笑了笑,那种礼貌的笑:“我们更想要即插即用的。幻觉率怎么测,了解吗?”
我说:“可以通过人工复核。”
他没接话,在我的简历上画了个圈,翻到最后一页,问了个不痛不痒的问题。我知道没戏了。果然三天后 HR 回复"岗位匹配度不太够"。
那晚我把"幻觉率"三个字搜了两个小时。越搜越窝火——不是因为它难,是因为我发现它根本不难,只是没人给过我一个靠近它的机会。
朋友的一句吐槽
转机来自一顿烧烤。一个做智能客服创业的朋友跟我吐苦水,说他们最头疼的不是模型答不出来,是不知道模型答得对不对。“几百条问答,三个人一条条看,看到凌晨两点,第二天模型一更新,白看。”
我问:“你们没有标准吗?哪条算对,哪条算错,哪条算事故?”
他说:“有啊,金融客服,答错利率是事故,答错活动时间是故障,语气冲了是瑕疵。”
我说:“那你们把三类各攒几百个例子,让另一个模型照着标准打分不就行了?人只抽查机器打的分靠不靠谱。”
他说:“这叫评测集加 LLM-as-Judge,道理我懂。可谁来定标准、谁来攒例子、谁来一条条校对边界?这活儿又细又烦,没人愿意干。”
我愣了几秒。定标准、攒例子、校对边界——这不就是我干了五年的活儿吗?监管条款里一句"不得诱导借贷",落到产品上要判几十种页面情况算不算诱导;评测标准里一句"不得答错利率",落到语料上也要判几十种问法算不算答错。抠字眼、判边界、留证据,同一种轴劲。
回家路上我一直在想这事。合规审查和模型评测,本质上是同一种工作:回答"什么叫错",然后把"错"一个个穷举出来。
把轴劲换个地方使
想明白就干。我没辞职,利用业务停摆的空窗期,给自己排了三个月的计划。
第一个月,补方法论。评测集怎么设计、样本怎么分层、LLM-as-Judge 的打分 prompt 怎么写。白天上班装忙,晚上学到十二点多。最大的坎不是理解概念,是克服"这不是我专业"的心理障碍。后来发现全是纸老虎——评测集的字段跟我那张整改清单的字段,重合度六成以上:编号、场景、标准答案、错误类型、严重等级、状态。
第二个月,真刀真枪建集。我主动请缨,给公司仅剩的存量业务做智能客服的评测体系——反正这活儿别人也不想碰。把监管文件和我们的产品协议灌进 RAG 知识库,让模型只能基于库里的内容作答。然后建评测集:1200 条,分三层——合规红线题(答错即事故,比如承诺收益、误导性比较)、业务准确题(利率、期限、费用算错)、体验题(答非所问、复读机)。每条都标了标准答案和错误级别。
打分用 LLM-as-Judge,两家不同的模型交叉打,分歧超过阈值的进人工复核。标注那阵子我跟运营吵了一架,一条"这款产品历史年化多少"的回答,她说算对,我说算误导——只说收益不提风险,搁以前的监管口径就是违规。吵到最后她服了:"你是真抠。"我说:“我靠这个吃了五年饭。”
第一版跑下来,幻觉率 7.8%,红线条款答错 23 条。我把这 23 条逐个拆开看:一半是知识库原文表述含糊,一半是检索没召回到对的条款。前者重写知识库,后者调 RAG 的分段策略。三轮迭代,幻觉率压到 1.2%,红线零出错。
第三个月,我把整套东西写成一份金融智能问答评测规范。对,我又干回老本行,写规范。只不过这次规范的对象不是产品经理,是模型。
汇报那天,CTO 听完问了一句:“这套东西,能卖给同行吗?”
经验不会归零,只是换个账户存
后来的事比较平淡。公司没倒闭,靠着这套评测能力接了两个银行的智能问答项目,我转岗成了 AI 评测方向的产品负责人。不带人,title 也没多响亮,但简历上"五年合规整改"那行后面,总算接上了新的一行。
圈里一个做风控出身的老宋,比我早半年转的,去了家做信贷大模型的公司,从投递到拿 offer 两个来月,涨了三成五。老宋请我吃饭时说:"咱们这种跟条文死磕过的人,干评测是降维打击,就是入门那层窗户纸得自己捅破。"这话我认。
这次转型教会我的事:
一,经验不会归零,它只是要换个账户存。五年里我以为自己攒的是"金融合规知识",其实攒的是"把模糊的对错拆成可执行标准"的手艺。知识会过期,手艺不会。监管文件三年一换,但"什么叫错、错到什么程度、怎么防"这套拆法,到哪个行业都用得上。
二,转 AIPM 不用会写代码,但要懂模型能力边界。我到现在不会写 Python,但我清楚 RAG 在什么情况下会检索漏、LLM-as-Judge 在什么分布上会打偏、幻觉率压到什么程度就该上人工兜底。知道边界在哪,就知道护栏该建在哪——这跟当年在条款边上设计弹窗拦截,是一个思路。
三,别信"即插即用"这种鬼话。面试官想要即插即用的人,可真正的即插即用不存在,所有人都是插上去再现学的。区别只在于,你原来的手艺离新插座是三十厘米还是三米。合规到评测,三十厘米。
评论区聊聊:你现在的手艺,离 AI 那个插座有多远?
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2025 年AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇
一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书
2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:
- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!
1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:
2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:
3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:
![]()
三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!
路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。
L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。
L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。
L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。
L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。
L5阶段:专题集丨特训篇 【录播课】
![]()
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇
2025 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!