ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

清华系Doctor-R1爆了!8B模型打穿GPT-4.1、70B医疗专用模型

清华系Doctor-R1爆了!8B模型打穿GPT-4.1、70B医疗专用模型 · 清华系 Doctor-R18B 模型打赢 GPT-4.1、Grok 4还打穿了 70B 的医疗专用模型· 安全一票否决写进奖励去掉它安全违规率翻倍还多0.80 → 1.80· 沟通质量 47.16比 4 倍大的 Baichuan-M2-32B 高出 25 分· 困难病例集上它掉到 18.73被 32B 反超这是论文自己给的边界先看一个真实场景一个 35 岁成年男性咳血四天大约 500 毫升四年多前确诊肺结核吃过异烟肼和利福平2021 年停了药。他跟 AI 医生说的第一句话是我这四天一直咳嗽。GPT-4.1 的问诊是这样的发烧吗气短吗咳嗽有固定时间吗有哮喘或过敏史吗食欲体重有变化吗问诊过程完全没有注意咳血这个症状最后也没给任何紧急建议。评测员给这次问诊打了负 0.80 分。医疗垂域模型DoctorAgent-RL 问完用药和发烧直接诊断病毒感染建议多喝水多休息负 1.0 分。Med42-v2-70B 注意到了血还是当成病毒性咳嗽建议去买非处方止咳药负 1.0 分。HuatuoGPT-o1-70B 发现了咯血但没问量有多大开了个胸片检查负 0.50 分。同一个病例今天分享的Doctor-R18B模型是这样问的先问咳嗽是干咳还是有痰。病人说有痰带鲜红色血。第二句就问血出现了多久量有多少。第三句问有没有结核或慢性支气管炎病史。第四句问最近有没有胸部外伤有没有在吃抗凝药。四步问完直接说这是危及生命的急症马上去最近的急诊不要在家等我在这里陪你到了医院我会继续帮你。▲ 六家模型在同一病例上的问诊对比与得分图源论文 Fig. 1对话与评分见附录 Table 16▍一句话总结它把问诊从「看题干答题」改成了「在信息不全时决定下一句问什么」并给安全装了一票否决。8B 模型超过了32B亿和 70B参数的医疗模型但在最难的病例子集上还是不如 32B的模型。一、问题出在哪现在的医疗大模型考试都很强。USMLE、MedQA 这些静态题库上头部模型的分数早就过了人类专家线。但把模型放进真实的多轮问诊场景短板就很明显了。论文把原因归结为三条缺失。第一不会策略性地问。好医生每句话都在缩小鉴别诊断范围现有模型在按清单走流程。第二不会共情。病人咳了 500 毫升血回复里连一句安抚都没有。第三不会从经验里学。人类医生靠的是积累的病例直觉现有模型只靠参数里那点静态知识。静态考试测的是知识问诊测的是在不确定中一步一步收集信息的能力。这是两种能力前一种不能自动变成后一种。二、解法是三件套Doctor-R1 的训练框架由三个部分组成缺一不可。第一件把问诊变成一个可以交互的环境。用一个独立的 LLM 扮演病人给每个病人埋一段完整的病历然后让医生智能体多轮对话每轮说的话记为一个动作全程最多 10 轮。通过部分可观测马尔可夫决策过程医生看不到病历全貌只能通过提问慢慢逼近真相。第二件两层奖励。这是全文的关键设计。公式卡 1单轮过程奖励分层否决st 0安全⇒ rt −1.0其余 7 维全部作废推理或准确 0 ⇒ rt −0.75其余 ⇒ rt Σd wd·st,d安全/推理/准确权重 1.0共情/谦逊 0.5加权求和有个致命缺陷平均下来一句危险建议可以用足够高的共情分盖过去。医疗场景里这不可接受所以安全必须是单独的一票否决。裁判模型从 8 个维度给单轮打分安全性、推理、医疗准确性、完整性、信息收集、忠实度、共情、谦逊。对话结束后再打一次结果奖励按最终诊断对不对给 0、0.5 或 1.0。过程奖励管你怎么问结果奖励管你问出什么结论。第三件经验库。训练中所有奖励超过阈值的片段按状态、动作、奖励存进库里。下一轮对话前模型先去检索第一段用向量相似度加历史奖励筛出 30 条候选第二段用交叉编码器重排第三段用动态阈值过滤最后只把最好的 2 条放进提示词。公式卡 2经验库动态阈值θ mean(rewards) std(rewards)仅保留 reward θ 的经验阈值随候选集动态浮动防止反复检索到雷同经验。效果由执业医师背书检索结果 83.87% 判定为临床有帮助0% 有害。▲ 训练闭环病人智能体出题医生智能体应诊两层奖励打分经验库沉淀图源论文三、数字训练过程底座 Qwen3-8B10 万条模拟问诊对话最多 10 轮7 张 A100训练 1 个 epoch学习率 1e-6。思维链标注用的是 GPT-4.1-Nano。检索用 jina-embeddings-v3 加 bge-reranker。主测试数据集是 HealthBench由OpenAI 出的多轮医疗对话评测500 个病例。▍HealthBench 主榜36.29HealthBench 均分开源模型第一 · 底座 Qwen3-8B47.16沟通质量Baichuan-M2-32B 仅 22.1131.18GPT-4.1 同榜Grok 4 为 33.03 · Claude 25.6926.38UltraMedical-70B参数是它近 9 倍 · MAQuE 52.00Doctor-R1 平均 36.29开源模型第一。700 亿参数的 UltraMedical-70B 只有 26.38MAQuE 上 60.00 对 52.00Claude Sonnet 4 是 25.69。差距最大的是沟通质量这一项47.16 对 22.11差了 25 分。这就是那 10 万次问诊练出来的东西。另一个多轮问诊评测数据集MAQuEDoctor-R1 准确率 60.00和 GPT-4.1 持平共情得分 93.80GPT-4.1 是 75.20。但是作者也承认GPT-5 在 HealthBench 上是 46.38还是明显领先。这篇论文测试是优于GPT-4.1 。▲ 左准确率随对话轮数的变化右训练用模拟病人数量从 0 到 10 万的缩放图源论文两张更有意思的曲线。第一张对话轮数越多优势越大第 1 轮准确率 36.0第 5 轮 58.0自身相对提升 61.1%而对手们从第 1 轮到第 5 轮几乎没拉开差距。会问问题的模型是越问越准的。第二张训练时用的模拟病人从 0 加到 10 万个沟通能力相对底座提升 68.5%准确率提升 32.4%。病人越多样医生越强。消融实验去掉过程奖励36.29 掉下降到32.61。去掉经验库下降到 31.69。同底座上 SFT 只有 29.54换成 PPO 上升到 33.23GRPO 拿到 36.29。三个组件各少一个各掉 3 到 4 分。但真正说明问题的不是这几分。单独拆掉安全否决那一组平均分几乎没动安全违规率却从 0.80 涨到 1.80翻了一倍还多。平均分看不出差别犯错率差了一倍这就是作者不肯用加权平均的原因。经验库也有一体两面把检索到的经验换成随机经验分数从 31.69 掉到 22.04比干脆不给经验还差。一条看着像、其实是错的经验能把模型直接带进沟里。还有一个反直觉的结果这种对话式训练不但没有损伤静态知识MedQA 反而从底座的 63.50 涨到 83.50MMLU 从 70.00 涨到 85.00。问诊能力的提升带动了决策能力的提升这是论文结论里最想强调的一句。四、医生怎么看这篇论文最值得医疗同行看的不是刷榜是那个分层否决的设计。它在做的其实是把临床的一条铁律写进损失函数危险建议不允许被其他优点对冲。现实里模型给错一次急救建议代价不是平均分掉 0.1 分是人命。这个思路完全可以移植到任何高风险场景的 RL 训练里。经验库也值得琢磨。它本质上是在模拟住院医从老医生身上学的那种东西遇到类似病人的时候先想想上次怎么处理的。检索的是状态加动作加奖励三元组还带奖励下限和新鲜度过滤避免经验越堆越杂。人工评估的规模不大但方向一致2 名执业医师评了 80 条对话轨迹另外 5 名非医疗背景标注者做两两比较。四个维度上 Doctor-R1 的胜率全部领先其中清晰度一项胜率 88.9%。▲ 人工评估连贯、遵循、清晰、共情四个维度的胜率与 Likert 打分图源论文2026年AI行业最大的机会毫无疑问就在应用层字节跳动已有7个团队全速布局Agent大模型岗位暴增69%年薪破百万腾讯、京东、百度开放招聘技术岗80%与AI相关……如今超过60%的企业都在推进AI产品落地而真正能交付项目的大模型应用开发工程师****却极度稀缺落地AI应用绝对不是写几个prompt调几个API就能搞定的企业真正需要的是能搞定这三项核心能力的人✅RAG融入外部信息修正模型输出给模型装靠谱大脑✅Agent智能体让AI自主干活通过工具调用Tools环境交互多步推理完成复杂任务。比如做智能客服等等……✅微调针对特定任务优化让模型适配业务目前脉脉上有超过1000家企业发布大模型相关岗位人工智能岗平均月薪7.8w实习生日薪高达4000远超其他行业收入水平技术的稀缺性才是你「值钱」的关键具备AI能力的程序员比传统开发高出不止一截有的人早就转行AI方向拿到百万年薪AI浪潮正在重构程序员的核心竞争力现在入场仍是最佳时机我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】⭐️从大模型微调到AI Agent智能体搭建剖析AI技术的应用场景用实战经验落地AI技术。从GPT到最火的开源模型让你从容面对AI技术革新大模型微调掌握主流大模型如DeepSeek、Qwen等的微调技术针对特定场景优化模型性能。学习如何利用领域数据如制造、医药、金融等进行模型定制提升任务准确性和效率。RAG应用开发深入理解检索增强生成Retrieval-Augmented Generation, RAG技术构建高效的知识检索与生成系统。应用于垂类场景如法律文档分析、医疗诊断辅助、金融报告生成等实现精准信息提取与内容生成。AI Agent智能体搭建学习如何设计和开发AI Agent实现多任务协同、自主决策和复杂问题解决。构建垂类场景下的智能助手如制造业中的设备故障诊断Agent、金融领域的投资分析Agent等。如果你也有以下诉求快速链接产品/业务团队参与前沿项目构建技术壁垒从竞争者中脱颖而出避开35岁裁员危险期顺利拿下高薪岗迭代技术水平延长未来20年的新职业发展……那这节课你一定要来听因为留给普通程序员的时间真的不多了立即扫码即可免费预约「AI技术原理 实战应用 职业发展」「大模型应用开发实战公开课」还有靠谱的内推机会直聘权益完课后赠送大模型应用案例集、AI商业落地白皮书
返回列表