
模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载Intern-S1 是 InternLM 系列开源的长推理long-thinking模型支持通过思考模式thinking mode输出推理过程。本文基于 OpenCompass 官方教程完整讲解如何从模型下载、API 服务部署、模型配置、数据集编排到 LLM Judger 注入最终在本地一键启动 Intern-S1 的基准评测。读完本文你将掌握 OpenCompass 中OpenAISDK模型接入、思考模式后处理、LLM 裁判模型注入以及评测结果汇总的完整实战链路。评测前置条件与整体流程OpenCompass 评测 Intern-S1 的整体链路分为四个阶段模型下载与部署从 Hugging Face 下载internlm/Intern-S1权重并部署为兼容 OpenAI SDK 的 API 服务模型配置编写OpenAISDK类型的模型配置声明 API 地址、采样参数与思考模式开关评测配置编写数据集配置推理 评测并注入 LLM Judger启动评测通过opencompass命令行加载配置文件自动完成推理、打分与汇总。官方提供的两份核心配置文件分别为模型配置 opencompass/configs/models/interns1/intern_s1.py 与评测入口 examples/eval_bench_intern_s1.py本文后续将逐一拆解。第一步模型下载与 API 服务部署Intern-S1 的模型权重已开源需要先从 Hugging Face 的internlm/Intern-S1仓库获取权重。模型体积较大推理阶段还需配套 tokenizer下载时注意磁盘空间。完成下载后官方推荐不要直接加载权重到本地 Python 进程而是将其部署为 API 服务形式进行调用。可选的部署引擎包括LMDeployInternLM 官方推理引擎对 Intern 系列模型的 KV Cache、量化支持最完整vLLM高吞吐推理引擎支持chat_template_kwargs等请求级参数透传SGLang面向长文本与推理加速的引擎同样支持请求级模板参数。由于 OpenCompass 侧采用OpenAISDK模型类型访问因此只要服务端暴露 OpenAI 兼容的/v1/chat/completions接口无论底层使用哪种引擎都可以无缝接入。部署完成后会得到API_BASE形如http://localhost:8000/v1与API_KEY两个关键信息供后续配置使用。第二步模型配置详解intern_s1.py官方在 opencompass/configs/models/interns1/intern_s1.py 中提供了OpenAISDK形式的模型配置示例完整内容如下from opencompass.models import OpenAISDK from opencompass.utils.text_postprocessors import extract_non_reasoning_content api_meta_template dict( round[ dict(roleHUMAN, api_roleHUMAN), dict(roleBOT, api_roleBOT, generateTrue), ], ), models [ dict( abbrintern-s1, keyYOUR_API_KEY, # 模型服务的 API KEY openai_api_baseYOUR_API_BASE, # 模型服务的 API BASE typeOpenAISDK, pathinternlm/Intern-S1, temperature0.7, meta_templateapi_meta_template, query_per_second1, batch_size8, max_out_len64000, max_seq_len65536, openai_extra_kwargs{ top_p: 0.95, }, retry10, extra_body{ # 基于 vLLM 或 sglang 部署服务后通过该开关调控模型的思考模式 chat_template_kwargs: {enable_thinking: True} }, # 开启思考模式后可在评测时去除 Thinking 内容 pred_postprocessordict(typeextract_non_reasoning_content), ), ]OpenAISDK 模型类型与关键参数OpenAISDK定义于 opencompass/models/openai_api.py继承自OpenAI基类。它在底层使用openaiPython SDK 构建OpenAI(base_url..., api_key...)客户端对服务端的请求协议要求就是标准的 Chat Completions 接口因此与 LMDeploy/vLLM/SGLang 部署的服务天然兼容。各参数作用如下参数示例值说明abbrintern-s1评测报告与输出目录中使用的模型简称便于多模型对比时区分keyYOUR_API_KEY服务端鉴权密钥源码中默认为ENV此时会从环境变量读取openai_api_baseYOUR_API_BASEAPI 服务地址。从源码结构看该参数支持传入字符串列表OpenCompass 会随机选择一个 base 以加速多节点访问见 openai_api.pypathinternlm/Intern-S1服务端识别用的模型名需与部署时指定的模型名称一致temperature0.7采样温度。评测类任务建议保持较低温度以保证可复现性思考型模型可适度调高以增强探索meta_templateapi_meta_template对话模板。示例中将一轮对话定义为HUMAN - BOT(生成)与 API 的user/assistant角色对应query_per_second1每秒请求速率上限用于控制对服务端的 QPS 压力避免触发限流batch_size8每批发送的样本数越大吞吐越高但需与服务端并发能力匹配max_out_len64000单次生成的最大输出 token 数。思考型模型推理链很长需设置足够大的值max_seq_len65536上下文最大长度。当输入超过该值时由mode决定截断策略openai_extra_kwargs{top_p: 0.95}透传给 Chat Completions 请求的额外采样参数retry10请求失败时的重试次数。长推理任务耗时长、易超时建议设置较大值extra_body{chat_template_kwargs: {...}}追加到请求体中的额外 JSON 字段vLLM/SGLang 会将其作为引擎级参数解析pred_postprocessorextract_non_reasoning_content对模型输出做后处理去除思考thinking片段后再送入评测器思考模式开关enable_thinking 与 extract_non_reasoning_contentIntern-S1 的核心特性是思考模式模型先输出Thinking过程再输出最终答案。这一行为通过extra_body中的chat_template_kwargs.enable_thinking控制置为True官方默认配置模型会先产生推理过程再作答适合需要深度推理的基准如 AIME、GPQA置为False直接作答适合对推理过程不敏感的场景如部分科学类基准。开启思考模式后模型输出会包含Thinking内容。若不处理这些内容会干扰基于规则或 LLM 裁判的打分。因此配置中通过pred_postprocessordict(typeextract_non_reasoning_content)在评测打分之前剔除推理片段。该后处理器注册于 opencompass/utils/text_postprocessors.py其核心逻辑为默认以think//think作为推理标签若文本中只有结束标签则截取结束标签之后的内容若成对出现则用正则删除起始与结束标签之间的全部内容。例如输入: 分析如下... /think 最终答案为 42 输出: 最终答案为 42对话模板 meta_template 的作用meta_template将 OpenCompass 内部的多轮对话结构映射为 API 请求中的角色。示例中仅定义了一轮dict(roleHUMAN, api_roleHUMAN), dict(roleBOT, api_roleBOT, generateTrue),含义是用户问题以HUMAN角色进入请求模型以BOT角色生成回复。如果后续需要评测需要 SYSTEM 角色的任务如部分科学基准可参考 examples/eval_intern_s1_pro.py 中补充dict(roleSYSTEM, api_roleSYSTEM)的做法动态调整模板。第三步数据集编排与 LLM Judger 注入eval_bench_intern_s1.py评测入口配置文件为 examples/eval_bench_intern_s1.py官方在其中预置了 Intern-S1 评测所需的数据集。配置文件采用 OpenCompass 基于mmengine的read_base()机制先导入预置数据集配置再统一组装。内置数据集列表通过read_base()引入的数据集覆盖知识、推理、数学、指令遵循、科学等多个维度数据集评测方式考察维度aime2025CascadeEvaluator数学验证 LLM 裁判高难度数学竞赛推理gpqaGPQA_diamondCascadeEvaluator研究生级科学推理mmlu_proGenericLLMEvaluator综合知识与推理IFEval规则评测指令遵循能力SmolInstructLLM 裁判指令遵循细粒度子任务ChemBenchLLM 裁判化学知识与应用matbenchLLM 裁判材料科学ProteinLMBenchLLM 裁判蛋白质语言建模以aime2025为例其评测配置定义于 opencompass/configs/datasets/aime2025/aime2025_cascade_eval_gen_5e9f4f.py采用CascadeEvaluator级联策略——先用MATHVerifyEvaluator做规则校验失败时再用GenericLLMEvaluator交给 LLM 裁判判断从而兼顾精确匹配与开放性答案。这也是思考型模型评测中的常见组合。此外该配置文件还做了两处关键适配将所有数据集的推理max_out_len统一调整为 65536见 eval_bench_intern_s1.py确保长思考链不被截断定义judge_cfg并遍历数据集将其注入到每个数据集的eval_cfg.evaluator中见 eval_bench_intern_s1.py覆盖GenericLLMEvaluator、CascadeEvaluator等所有需要 LLM 裁判的评估器。LLM Judger 配置示例对于依赖 LLM 裁判的数据集如 ChemBench、SmolInstruct、matbench 等必须在评测配置中补充judge_cfg。官方示例如下judge_cfg dict( abbrYOUR_JUDGE_MODEL, typeOpenAISDK, pathYOUR_JUDGE_MODEL_PATH, keyYOUR_API_KEY, openai_api_baseYOUR_API_BASE, meta_templatedict( round[ dict(roleHUMAN, api_roleHUMAN), dict(roleBOT, api_roleBOT, generateTrue), ]), query_per_second1, batch_size1, temperature0.001, # 裁判打分需保持确定性温度极低 max_out_len8192, max_seq_len32768, modemid, # 超长输入时从中间截断 )几点实践要点裁判模型与评测模型分离judge_cfg的type/path/key/openai_api_base应指向独立的打分服务不要复用 Intern-S1 本身避免自我评估偏差温度设为极小值如0.001LLM 裁判是打分而非生成需要高确定性输出modemidmode是 OpenAI 系列模型处理超长输入时的截断策略可选none/front/mid/rear见 openai_api.py。mid表示保留首尾、截断中间适合裁判场景中问题在头部、答案在尾部的阅读习惯。评测结果汇总Summarizer配置尾部通过summarizer声明了评测报告的汇总结构见 eval_bench_intern_s1.py将各数据集的原始得分按语义分组展示Knowledgemmlu_proaccuracyInstruction FollowingIFEvalPrompt-level-strict-accuracyGeneral ReasoningGPQA_diamondaccuracyMath Calculationaime2025accuracyAcademicChemBenchnaive_average、ProteinLMBenchaccuracySmolInstruct一系列 0-shot 指令子任务得分summary_groups进一步将 ChemBench 的 8 个子任务Name_Conversion、Property_Prediction、Mol2caption、Caption2mol、Product_Prediction、Retrosynthesis、Yield_Prediction、Temperature_Prediction聚合成一个 ChemBench 汇总项方便整体阅读。推理与评测的并行调度评测入口还配置了本地执行引擎见 eval_bench_intern_s1.py推理阶段NumWorkerPartitioner(num_worker8)将样本按 8 个 worker 切分LocalRunner(max_num_workers16)并行执行OpenICLInferTask评测阶段NaivePartitioner(n10)将评测任务切为 10 份同样由LocalRunner执行OpenICLEvalTask。retry0表示推理失败不自动重试可根据服务稳定性酌情调大。所有中间结果与最终报告输出到work_dir ./outputs/oc_bench_intern_s1见 eval_bench_intern_s1.py。第四步启动评测完成模型配置与评测配置后在命令行执行opencompass examples/eval_bench_intern_s1.pyopencompass命令会解析配置先按infer配置对 Intern-S1 发起批量推理请求将推理结果落盘随后按eval配置对各数据集打分规则评测直接计算LLM 裁判类调用judge_cfg指定的服务最后依据summarizer生成汇总报告到work_dir目录。几点运行提示推理阶段会以query_per_second限速、batch_size批量发送请求请确保服务端容量足够否则会触发重试retry10max_out_len64000意味着单样本最长可生成 6.4 万 token长思考任务耗时长建议为评测预留充足时间若只想评测其中部分数据集可在datasets列表中按需裁剪OpenCompass 会自动跳过未加载的评测器依赖。进阶参考Intern-S1-Pro 评测配置仓库中还提供了 examples/eval_intern_s1_pro.py 作为 Intern-S1-Pro 的评测参考与本文主题高度同源可用于横向对比或扩展使用OpenAISDKStreaming定义于 opencompass/models/openai_streaming.py以流式方式接收长输出max_out_len/max_seq_len均设为 65536通过deepcopy扩展出lcb_code_generation_v6代码生成数据集并设置了release_versionv6对gpqa、aime2025分别设置重复采样次数n/k 8/32以多次运行取平均的方式降低长推理任务的方差meta_template中额外加入了SYSTEM角色见 eval_intern_s1_pro.py用于评测 Bio_data、Mol_instructions 等需要系统提示词的基准。如果你需要评测多个 Intern 系列模型可直接参照该文件复制扩展。常见问题与排查建议评测打分偏低怀疑思考内容干扰确认模型配置中的extra_body.chat_template_kwargs.enable_thinking已按任务需求设置且pred_postprocessor已配置为extract_non_reasoning_content后者会在打分前剔除think.../think片段实现见 text_postprocessors.py。请求报 400/超时检查openai_api_base是否指向正确的/v1端点、path是否与部署模型名一致、max_out_len是否超过服务端允许上限并适当调大retry与timeout。长上下文被截断当输入超过max_seq_len时OpenAI 系列模型按mode策略截断none为不截断、front/mid/rear分别保留头部/中段/尾部。推理类任务建议保持足够的max_seq_len并谨慎选择截断策略。LLM 裁判结果不稳定将judge_cfg的temperature压至极低值并保证裁判模型服务独立稳定多次运行取平均可进一步降低方差。至此从权重下载、API 部署到 OpenCompass 配置编写与启动评测的完整流程已经打通。你可以基于 opencompass/configs/models/interns1/intern_s1.py 与 examples/eval_bench_intern_s1.py 两份模板快速复现 Intern-S1 的官方评测并按需扩展数据集与裁判模型。赞分享模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载相关推荐使用 OpenCompass 评测 Intern-S1模型接入、LLM Judge 配置与完整评估流程使用 OpenCompass 评测 Intern S1模型接入、LLM Judge 配置与完整评估流程 导读 本文是 OpenCompass 官方针对 Int模型评测人工智能大模型AI 评测OpenCompass 中的 NQ 数据集评测实战NQ / NQ-Open 配置、评分逻辑与模型基准OpenCompass 中的 NQ 数据集评测实战NQ / NQ Open 配置、评分逻辑与模型基准 本文围绕 OpenCompass 仓库中的 nq 数据集模型评测人工智能大模型AI 评测金融大模型评测实战OpenCompass 中的 OpenFinData 数据集接入与配置全解析金融大模型评测实战OpenCompass 中的 OpenFinData 数据集接入与配置全解析 OpenFinData 是由东方财富与上海人工智能实验室联合发模型评测人工智能大模型AI 评测上一篇PHPStan 错误标识符 div.rightNonNumeric 详解除法运算符右操作数不是数值类型下一篇Minimal Mistakes 博客嵌入 Twitter 推文官方嵌入代码与 Jekyll 集成实践创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考