ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

OpenCompass 中的 AIME2024 数学评测:数据集配置、规则/LLM 判分与级联评估实践

OpenCompass 中的 AIME2024 数学评测:数据集配置、规则/LLM 判分与级联评估实践 模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载AIME 2024美国数学邀请赛 2024由 30 道高难度数学题构成是衡量 LLM 数学推理与竞赛级解题能力的重要基准。本文以 OpenCompass 仓库中 aime2024 数据集目录 的 README 与配套配置文件为主线系统讲解该数据集在 OpenCompass 中的数据结构、评测流程配置以及从规则判分、math_verify 符号验证到 LLM Judge、级联评估CascadeEvaluator的完整实践方案。读完本文你将掌握如何在 OpenCompass 中运行 AIME2024 评测、解读其得分口径并能按需切换不同判分策略。一、AIME2024 数据集概览与基准定位按 aime2024/README.md 的描述AIME2024 是一个由 2024 年美国数学邀请赛American Invitational Mathematics Examination 2024题目构成的数学数据集。AIME 每道题要求给出一个 0~999 之间的整数答案题目难度显著高于常规中小学数学基准因而被广泛用于考察模型的竞赛数学推理competition math能力。在 OpenCompass 中该数据集被纳入数学类Math评测分组并出现在官方学术榜单配置中。例如 examples/eval_academic_leaderboard_202412.py 通过read_base()引入aime2024_gen_6e39a4配置并将其作为core_average汇总组的一个子集[aime2024, accuracy]examples/eval_academic_leaderboard_202502.py 则引入基于 LLM Judge 的aime2024_0shot_nocot_genericllmeval_academic_gen配置。可见 AIME2024 是 OpenCompass 学术评测体系中的固定成员也是观察模型竞赛数学能力变化的关键指标。已公开的模型表现参考README 中给出了两类模型的参考成绩第一类为数学专用系列模型Instruct/Chat 数学模型按 0-shot 规则判分口径记录第二类为通用对话模型模型AIME2024 AccuracyQwen2.5-Math-72B-Instruct20.00Qwen2.5-Math-7B-Instruct16.67Qwen2-Math-7B-Instruct16.67Qwen2-Math-1.5B-Instruct13.33internlm2-math-7b3.33模型AIME2024 AccuracyQwen2.5-72B-Instruct31.25Qwen2.5-7B-Instruct26.44internlm2_5-7b-chat9.13说明这些数字来自仓库 README 的既有记录反映的是当时配置与判分口径下的结果不同提示词模板、判分器规则 vs LLM Judge与重复采样次数都会显著影响得分实际评测请以本地运行结果为准。二、数据加载Aime2024Dataset 的实现细节AIME2024 在 OpenCompass 中通过Aime2024Dataset加载实现在 opencompass/datasets/aime2024.py。该数据集类继承自BaseDataset其load静态方法按 JSONL 逐行读取指定路径每一行是一个 JSON 对象包含origin_prompt原始题目文本与gold_answer标准答案加载时统一转换为 OpenCompass 内部字段question origin_prompt[:]answer gold_answer最终通过Dataset.from_list(dataset)返回 Hugging Facedatasets.Dataset对象供下游 Reader 使用。实际运行中路径参数pathopencompass/aime2024会经由get_data_path解析为本地缓存数据文件。由于题目以 JSONL 形式存储Aime2024Dataset无需任何额外的 in-context 示例构造逻辑天然适合 0-shot 生成式评测。三、核心评测配置规则判分MATHEvaluator math_postprocess_v2OpenCompass 为 AIME2024 提供了多种开箱即用的配置位于 opencompass/configs/datasets/aime2024其中带_gen.py后缀的配置是推荐入口。最基础的规则判分配置是aime2024_gen.py# opencompass/configs/datasets/aime2024/aime2024_gen.py from mmengine.config import read_base with read_base(): from .aime2024_gen_17d799 import aime2024_datasets # noqa: F401, F403它通过 mmengine 的read_base机制复用aime2024_gen_17d799.py中定义好的数据集列表。真正承载完整逻辑的配置对应 aime2024_gen_17d799.py包含三个核心部分1. Reader 配置aime2024_reader_cfgaime2024_reader_cfg dict( input_columns[question], output_columnanswer )指定评测时模型输入取question列标准答案取自answer列。2. 推理配置aime2024_infer_cfgaime2024_infer_cfg dict( prompt_templatedict( typePromptTemplate, templatedict( round[ dict(roleHUMAN, prompt{question}\nPlease reason step by step, and put your final answer within \\boxed{}.), ], ) ), retrieverdict(typeZeroRetriever), inferencerdict(typeGenInferencer) )采用PromptTemplate构造单轮 HUMAN 提示要求模型逐步推理并把最终答案放入\boxed{}中ZeroRetriever表示 0-shot不做任何示例检索GenInferencer表示生成式推理适用于 base 模型与 chat 模型。3. 评测配置aime2024_eval_cfgaime2024_eval_cfg dict( evaluatordict(typeMATHEvaluator, versionv2), pred_postprocessordict(typemath_postprocess_v2) )最后将三者组合为数据集配置项aime2024_datasets [ dict( abbraime2024, typeAime2024Dataset, pathopencompass/aime2024, reader_cfgaime2024_reader_cfg, infer_cfgaime2024_infer_cfg, eval_cfgaime2024_eval_cfg ) ]其中abbraime2024是该数据集的缩写标识也是汇总器summarizer与命令行--datasets参数引用的名称。底层原理postprocess 与 MATHEvaluator 如何协同判分规则判分的准确性依赖后处理提取答案 数学等价性判断两步二者分别实现在 opencompass/datasets/math.pymath_postprocess_v2math.py#L190-L201先尝试用extract_boxed_answer提取模型输出中的\boxed{...}内容若无 boxed 答案则按句号切分并在包含 final answer/answer is 的片段中提取最后调用normalize_final_answer做规范化normalize_final_answermath.py#L68-L128处理单位词inches、dollars、degrees 等、LaTeX 简写\fracab→\frac{a}{b}、千分位逗号100,000→100000等归一化工作使\frac{1}{2}与1/2等不同写法可以对齐比较extract_boxed_answermath.py#L54-L65定位最后一个 boxed 字符串并去除\boxed{}外壳可选去除双重花括号。随后MATHEvaluatormath.py#L204-L229对每条预测调用is_equiv(pred, ref)判断数学等价统计正确样本并输出{accuracy: ..., details: [...]}。versionv2对应与math_postprocess_v2配套的判分逻辑。变体配置显式 CoT 与更长输出目录中另有 aime2024_gen_6e39a4.py它同样使用MATHEvaluator math_postprocess_v2但做了两点调整aime2024_infer_cfg dict( prompt_templatedict( typePromptTemplate, templatedict( round[ dict(roleHUMAN, prompt{question}\nPlease reason step by step, and put your final answer within \\boxed{}.), ], ) ), retrieverdict(typeZeroRetriever), inferencerdict(typeGenInferencer, max_out_len2048) )即在提示中显式要求逐步推理并把GenInferencer的最大输出长度提升到2048token为长 CoT 推理留出空间默认配置未显式指定max_out_len。该配置正是学术榜单 eval_academic_leaderboard_202412.py 所引用的版本可见其在官方评测流程中的代表性。四、判分升级从字符串匹配到 math_verify 符号验证规则判分对同一数学表达式的不同书写形式存在误判风险。为此 OpenCompass 提供了基于math_verify与latex2sympy2_extended的MATHVerifyEvaluator其实现位于 opencompass/evaluator/math_evaluator.py。对应的评测配置同样内置在 aime2024_gen_17d799.pyaime2024_eval_cfg dict( evaluatordict(typeMATHVerifyEvaluator) )MATHVerifyEvaluator的核心流程见 math_evaluator.py#L9-L80使用LatexExtractionConfig与ExprExtractionConfig分别解析标准答案与模型预测通过math_verify.parse verify判断两者数学等价例如\frac{1}{2}与1/2、(x1)^2与x^22x1会被识别为等价每次验证在独立子进程中执行并设置 10 秒超时超时timed_out、解析失败error或标准答案无法解析skipped的样本不会被误判为正确最后按100 * correct / count输出 accuracy并附带每条样本的answer_parsed与gold_parsed细节。依赖方面运行该评测需要先安装pip install math_verify latex2sympy2_extended若缺失MATHVerifyEvaluator.score会抛出明确的ImportError提示见 math_evaluator.py#L87-L94。五、LLM Judge 方案用大模型评判答案一致性当模型输出的答案形式过于自由如带解释、多种等价写法混排时OpenCompass 还提供以 LLM 作为裁判的GenericLLMEvaluator方案对应配置 aime2024_llmjudge_gen_5e9f4f.py。入口配置 aime2024_llmjudge_gen.py 同样通过read_base复用该文件。该方案的特点推理阶段与规则判分完全一致0-shot、\boxed{}约束、GenInferencer评测阶段换成GenericLLMEvaluator内部使用一段固定的GRADER_TEMPLATE提示词要求裁判模型只依据标准答案判断候选答案是否正确不重新作答忽略表达形式差异数学表达式、文字描述、公式等价对多选/多空题要求全部匹配才算正确若预测带\boxed{}先忽略外壳再比对最终只输出A: CORRECT或B: INCORRECTdict_postprocessordict(typegeneric_llmjudge_postprocess)负责把裁判输出解析为正确/错误可设置pred_roleBOT指定被评答案的对话角色并通过modesinglescore声明单次打分模式见 aime2024_0shot_nocot_genericllmeval_academic_gen.py。对于面向学术榜单的口径另有 aime2024_0shot_nocot_genericllmeval_academic_gen.py区别在于后处理使用generic_llmjudge_academic_postprocess并显式指定metric_nameaccuracy且提示词不含显式 CoTno CoT。六、级联评估CascadeEvaluator规则优先 LLM 兜底为了兼顾规则判分的低成本与LLM 判分的鲁棒性目录提供了级联评估配置 aime2024_cascade_eval_gen_5e9f4f.pycascade_evaluator dict( typeCascadeEvaluator, rule_evaluatordict( typeMATHVerifyEvaluator, ), llm_evaluatordict( typeGenericLLMEvaluator, prompt_templatedict( typePromptTemplate, templatedict( begin[dict(roleSYSTEM, fallback_roleHUMAN, promptYou are a helpful assistant who evaluates the correctness and quality of models outputs.)], round[dict(roleHUMAN, promptGRADER_TEMPLATE)], ), ), dataset_cfgdict(typeAime2024Dataset, pathopencompass/aime2024, reader_cfgaime2024_reader_cfg), judge_cfgdict(), dict_postprocessordict(typegeneric_llmjudge_postprocess), ), parallelFalse, )rule_evaluator使用MATHVerifyEvaluator做第一轮符号验证llm_evaluator使用GenericLLMEvaluator兜底parallelFalse表示串行级联规则能判定的样本不再调用 LLM只有规则无法判定或判为错误的样本才交给 LLM 裁判从而在保证覆盖率的同时大幅减少裁判调用开销数据集层面可设置n1控制重复评测次数。级联结果的结构与统计口径可由测试用例佐证tests/datasets/test_aime2025_eval.py 验证了规则先判、LLM 只评未通过样本的逻辑——cascade_stats中rule_correct llm_correct合并为final_correctfinal_accuracy与顶层accuracy一致test_parallel_mode_result 则展示了parallelTrue时全部样本都走 LLM 判定的对照口径。该测试同时覆盖了\boxed{42}、\boxed{\frac{1}{2}}等典型预测格式的提取与等价判断test_boxed_extraction、test_mathematical_equivalence。注意test_aime2025_eval.py针对 AIME2025 评测结果结构编写但其验证的级联统计字段cascade_stats与 AIME2024 的级联配置完全同构可作为理解级联评估输出结构的参考。此外aime2024_cascade_eval_rawprompt_gen_2f2c96.py 提供了使用RawPromptTemplate直接以原生消息列表构造提示的等价版本aime2024_infer_cfg dict( prompt_templatedict( typeRawPromptTemplate, messages[ {role: user, content: {question}\nRemember to put your final answer within \\boxed{}.}, ], ), retrieverdict(typeZeroRetriever), inferencerdict(typeGenInferencer), )RawPromptTemplate与PromptTemplate的差异在于它不再经过模板解析器对角色/占位符做二次展开而是按给定的messages原样组装对话适合对提示格式有精确控制要求的场景。七、重复采样与多数投票llmverify_repeat 系列竞赛数学评测中单次采样方差较大OpenCompass 因此提供了重复采样 LLM 验证的配置aime2024_llmverify_repeat8_gen_e8fcee.py 与 aime2024_llmverify_repeat16_gen_bf7475.py。两者结构一致仅在重复次数上不同以 repeat8 为例aime2024_datasets [ dict( abbrfaime2024-run{idx}, typeAime2024Dataset, pathopencompass/aime2024, reader_cfgaime2024_reader_cfg, infer_cfgaime2024_infer_cfg, eval_cfgaime2024_eval_cfg, modesinglescore, ) for idx in range(8) ]关键点通过列表推导一次性生成 8或 16个结构完全相同、仅abbr不同的数据集实例aime2024-run0~aime2024-run7对同一模型执行多次独立采样每次采样都使用GenericLLMEvaluator做 LLM 验证判分输出singlescore模式结果多轮结果可进一步做多数投票等聚合分析缓解单次采样随机性对得分的影响。该配置被官方 DeepSeek-R1 评测示例采用examples/eval_deepseek_r1.py 引入aime2024_llmverify_repeat8_gen_e8fcee并在汇总器中将[faime2024-run{idx}, accuracy] for idx in range(8)全部纳入统计eval_deepseek_r1.py#L178。八、运行方式命令行与配置集成1. 命令行直接运行根据 README.md 中的官方用法AIME2024 有两种推荐入口# 基于规则判分的推荐配置 opencompass --datasets aime2024_gen --models hf_internlm2_5_1_8b_chat # 基于 LLM Judge 的推荐配置 opencompass --datasets aime2024_llmjudge_gen --models hf_internlm2_5_1_8b_chataime2024_gen对应规则判分MATHEvaluator / MATHVerifyEvaluator系列成本低、可复现aime2024_llmjudge_gen对应 LLM Judge 系列对自由形式答案更宽容但需要额外配置裁判模型judge_cfg若使用非预置的 Hugging Face 模型可配合--hf-type chat --hf-path 模型路径直接评测多卡数据并行可用--max-num-worker模型并行则用--hf-num-gpus。2. 集成进自定义评测配置在自定义评测脚本中通过read_base引入数据集配置后即可与其他数据集合并见 eval_academic_leaderboard_202412.pyfrom mmengine.config import read_base with read_base(): from opencompass.configs.datasets.aime2024.aime2024_gen_6e39a4 import \ aime2024_datasets # ... 其他数据集与模型配置 datasets sum((v for k, v in locals().items() if k.endswith(_datasets)), [])随后在summarizer中按[aime2024, accuracy]引用其结果即可把 AIME2024 纳入汇总组参与平均分计算eval_academic_leaderboard_202412.py#L54-L68。3. 配置矩阵速查配置文件位于 opencompass/configs/datasets/aime2024/推理提示判分方式适用场景aime2024_gen.py/aime2024_gen_17d799.pyCoT \boxed{}MATHVerifyEvaluator默认推荐符号级验证aime2024_gen_6e39a4.py显式逐步推理 \boxed{}max_out_len2048MATHEvaluator(v2) math_postprocess_v2学术榜单口径、长 CoT 模型aime2024_0shot_nocot_gen_5e9f4f.py无 CoT \boxed{}MATHEvaluator(v2) math_postprocess_v2快速基线、base/chat 模型通用aime2024_llmjudge_gen.py/aime2024_llmjudge_gen_5e9f4f.py无 CoT \boxed{}GenericLLMEvaluatorLLM 裁判答案形式自由、需要语义判分aime2024_0shot_nocot_genericllmeval_academic_gen.py无 CoT \boxed{}GenericLLMEvaluatoracademic 口径学术榜单 LLM-Judge 口径aime2024_cascade_eval_gen_5e9f4f.py无 CoT \boxed{}CascadeEvaluatorMATHVerify LLM规则与 LLM 兼顾、省裁判调用aime2024_cascade_eval_rawprompt_gen_2f2c96.py原生消息模板 \boxed{}CascadeEvaluator需要精确控制提示格式aime2024_llmverify_repeat8_gen_e8fcee.py无 CoT \boxed{}8 次重复GenericLLMEvaluator降低采样方差、多数投票aime2024_llmverify_repeat16_gen_bf7475.py无 CoT \boxed{}16 次重复GenericLLMEvaluator更高置信度的重复评测九、实践要点与注意事项答案格式约定所有 AIME2024 配置都在提示中要求模型把最终答案放入\boxed{}这是后续math_postprocess_v2、math_verify提取答案的前提若模型不遵守该格式规则判分可能退化为按 final answer 片段猜测得分口径将不一致。判分口径选择影响得分可比性规则判分与 LLM Judge 对同一批预测可能给出不同 accuracy横向对比模型时务必使用同一配置同一_gen后缀、同一判分器。math_verify 依赖使用MATHVerifyEvaluator或级联配置前需安装math_verify与latex2sympy2_extended否则会直接抛 ImportError每个样本的符号验证在子进程中带 10 秒超时执行可避免个别复杂表达式卡死评测。重复采样注意abbr唯一性repeat8/repeat16 通过faime2024-run{idx}区分各次采样汇总时需按相同规则把所有 run 纳入统计否则只会看到单个 run 的结果。资源与并行AIME2024 仅 30 题单机即可快速跑完需要数据并行时用--max-num-worker模型并行用--hf-num-gpus二者含义不同不要混用。十、总结AIME2024 在 OpenCompass 中是一个配置成熟、策略丰富的数学评测数据集数据侧由Aime2024Dataset以 JSONL 方式加载并映射为标准字段评测侧按需求可选用基于math_postprocess_v2 MATHEvaluator的轻量规则判分、基于math_verify的符号验证、基于GenericLLMEvaluator的 LLM 裁判以及CascadeEvaluator的规则优先、LLM 兜底级联方案配合 repeat 系列配置还能进行多次采样以降低方差。无论你是想快速复现学术榜单口径、验证数学专用模型的竞赛能力还是构建更鲁棒的 LLM 裁判流水线opencompass/configs/datasets/aime2024 目录下的配置都可以直接作为起点并可通过 tests/datasets/test_aime2025_eval.py 与 opencompass/evaluator/math_evaluator.py 等源码进一步深入理解其判分原理。赞分享模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载相关推荐OpenCompass 评估 General365级联数学验证与 LLM 判题完整实战指南OpenCompass 评估 General365级联数学验证与 LLM 判题完整实战指南 General365 是由美团长光meituan longcat模型评测人工智能大模型AI 评测DataHub Core 与 DataHub Cloud 全面对比指南从开源元数据平台到企业级 AI 数据上下文平台DataHub Core 与 DataHub Cloud 全面对比指南从开源元数据平台到企业级 AI 数据上下文平台 本指南基于 DataHub 官方对比文档模型评测人工智能大模型AI 评测OpenCompass LLM 评判器GenericLLMEvaluator / CascadeEvaluator使用指南以 LLM 为评判器的模型评估实战OpenCompass LLM 评判器GenericLLMEvaluator / CascadeEvaluator使用指南以 LLM 为评判器的模型评估实模型评测人工智能大模型AI 评测上一篇终极自动驾驶界面设计指南如何用图标提升用户体验下一篇如何自定义LaPreprint的配色、字体与页面布局LaTeX预印本模板二次开发完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表