ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MT Bench 8.12分如何炼成?Starling-LM-7B-beta评测成绩深度解析

MT Bench 8.12分如何炼成?Starling-LM-7B-beta评测成绩深度解析 MT Bench 8.12分如何炼成Starling-LM-7B-beta评测成绩深度解析【免费下载链接】Starling-LM-7B-beta项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Starling-LM-7B-betaStarling-LM-7B-beta 是由 Nexusflow 团队开源的一款 70 亿参数大语言模型它采用 RLAIF基于 AI 反馈的强化学习进行训练在以 GPT-4 为裁判的MT Bench评测中拿下8.12 分。这篇文章带你拆解这个 7B 小模型的完整训练配方并解读它的评测成绩到底意味着什么 30 秒认识 Starling-LM-7B-beta先看一张核心信息速查表项目说明参数量约 70 亿7B基座模型OpenChat-3.5-0106源自 Mistral-7B-v0.1训练方式RLAIF PPO基于 AI 反馈的强化学习奖励模型Starling-RM-34B上下文长度8192 tokensMT Bench 成绩8.12GPT-4 评分许可证Apache-2.0附非竞争条款一句话总结它是一个7B 的身体装着接近 GPT-3.5 水平的回答能力的开源模型MT Bench 8.12 分是什么水平MT Bench 是怎么打分的MT Bench 是大语言模型评测中非常经典的多轮对话基准可以这样理解它的规则 包含80 道问题覆盖写作、角色扮演、推理、数学、代码、信息抽取、STEM、人文 8 大能力维度 每道题包含两轮追问考察模型的多轮对话能力⚖️ 由GPT-4 担任裁判按 1~10 分制打分取平均值8.12 分意味着什么发布时GPT-3.5ChatGPT在 MT Bench 上的成绩约为 7.8 分。也就是说Starling-LM-7B-beta 作为一个只有 7B 参数的开源模型在这套评测中达到了与 GPT-3.5 相当甚至更高的水平——这在 2023 年的开源模型圈是相当亮眼的成绩也是它被社区广泛讨论的原因。8.12 分背后的三大关键好成绩不是天上掉下来的。Starling-LM-7B-beta 的配方由三个核心部件组成1️⃣ 站巨人的肩膀OpenChat-3.5-0106 底座模型并非从零训练而是在 OpenChat-3.5-0106 基础上继续强化。该底座基于 Mistral-7B-v0.1 架构本身已通过多轮指令微调具备了不错的对话基础——底子好是后续 RLHF 能收敛出高分的前提。2️⃣ 升级的评分老师Starling-RM-34B 奖励模型RLAIF 的核心是一个会打分的奖励模型。Starling 团队训练了升级版奖励模型Starling-RM-34B它使用的排名数据集是berkeley-nest/Nectar——由多个大模型对同一提示生成多个回答再由强模型对回答质量进行排序。数据越有梯度奖励模型学得越准策略模型的优化方向就越清晰。3️⃣ 用 AI 代替人类标注RLAIF PPO传统 RLHF 需要大量人类偏好标注成本高且难以规模化。Starling 的做法是让 AI 给出反馈RLAIF再用经典的PPO近端策略优化算法持续更新策略模型。这套数据 → 奖励模型 → PPO的完整流水线正是分数从基座水平提升到 8.12 的关键一步。 简单类比RLHF 是人类老师打分RLAIF 是请了一位 34B 参数的 AI 助教 24 小时不打烊地打分。模型配置速览7B 参数如何排兵布阵打开仓库中的 config.json可以看到这个模型在架构上继承了大量 Mistral 的设计配置项数值通俗理解层数32 层网络的思考深度隐藏层维度4096每层信息通道宽度注意力头32 头 / KV 头 8GQA 分组注意力推理更快最大上下文8192一次最多记住约 8K 内容词表大小32002含 2 个新增特殊 token精度bfloat16显存占用约为 FP32 的一半权重被拆分为 3 个分片文件model-00001-of-00003.safetensors、model-00002-of-00003.safetensors、model-00003-of-00003.safetensors合计约 14.5 GB分片索引记录在 model.safetensors.index.json 中。分片设计是为了方便加载下载后自动合并使用无需手动处理。快速上手三步本地跑通 Starling-LM-7B-beta第一步获取模型文件git clone https://gitcode.com/hf_mirrors/ai-gitcode/Starling-LM-7B-beta第二步用 transformers 加载模型import transformers model transformers.AutoModelForCausalLM.from_pretrained(./Starling-LM-7B-beta) tokenizer transformers.AutoTokenizer.from_pretrained(./Starling-LM-7B-beta)⚠️ 加载 7B 模型建议使用至少 16GB 显存的 GPUbf16 精度下或使用量化方案在消费级显卡上运行。第三步使用正确的对话模板重要官方特别强调必须使用与 OpenChat 一致的对话模板否则模型效果会明显下降。模板规则如下用户轮GPT4 Correct User: 你的问题|end_of_turn|助手轮GPT4 Correct Assistant:代码场景前缀换成Code User:/Code Assistant:生成时建议设置temperature 0可降低输出啰嗦的概率这套模板也内置在 tokenizer_config.json 的chat_template字段中特殊 token 定义见 special_tokens_map.json 与 added_tokens.json。生成参数如最大长度 8192记录在 generation_config.json 中直接使用即可。使用注意事项与许可证 许可证为Apache-2.0但附加了一个条件不得用于与 OpenAI 竞争的场景商用前建议仔细阅读条款️ 模型在极少数情况下回答会偏啰嗦调低 temperature 可有效缓解 该模型主要面向英文场景中文使用效果会打折扣写在最后Starling-LM-7B-beta 用一张三件套配方表回答了标题里的问题强底座OpenChat-3.5-0106保证下限强奖励模型Starling-RM-34B Nectar 数据保证方向RLAIF PPO 流水线保证分数持续爬升三者合力才炼出了 MT Bench 8.12 分这个成绩。对新手而言它最大的价值在于用 7B 的体量证明了一条AI 教 AI的可行路径也是研究 RLAIF 训练范式的绝佳开源样本 ✨【免费下载链接】Starling-LM-7B-beta项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Starling-LM-7B-beta创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表