ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

--cot与--astro如何抉择?MingLi-Bench思维链与命盘注入效果深度对比

--cot与--astro如何抉择?MingLi-Bench思维链与命盘注入效果深度对比 --cot与--astro如何抉择MingLi-Bench思维链与命盘注入效果深度对比【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench 是一个评测大语言模型中国传统命理能力的开源基准用 2022–2025 年全球算命师大赛的 160 道选择题检验模型在八字与紫微斗数上的推理水平。运行时最常被纠结的两个开关是--cot思维链推理和--astro命盘注入到底开哪个开几个本文从提示词原理到消融实验带你把这两个参数一次讲透 MingLi-Bench 评测的是什么项目把命题拆解为两类能力排盘能力由生辰信息推导出八字四柱、紫微十二宫星曜分布这是纯计算容易出错推理能力基于命盘做出对人生事件的判断事业、婚姻、财运等十二大类事件。数据与命盘分别存放在文件作用data/data.json160 道标准化选择题2022–2025 年每题对应一个命主案例data/fortune_api_results.json预先排好的八字 / 紫微斗数命盘运行时按case_id与题目关联data/raw/原始赛题文本2022.txt~2025.txt评分采用与标准答案精确匹配的选择题形式可客观复现。快速上手三步跑出第一次评测git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt配置好 README_zh.md 中说明的 API 密钥.env文件后先用--stats自检数据集再跑正式评测。官方推荐的默认姿势是始终同时开启--cot与--astropython -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro 加--sample 10可先抽 10 题冒烟测试--max-workers 8提高并发。--cot 做了什么让模型先推理再作答开启--cot后提示词中的指令从请直接给出答案变为请先分析推理过程然后给出答案见 mingli_bench/benchmark.py 的_prepare_prompt方法模式提示词指令默认结合中国传统命理学进行推算请直接给出答案用答案X的格式加--cot请先分析推理过程然后给出答案。最后用答案X的格式给出你的选择命理题目需要逐级展开大运、流年、宫位关系属于典型的长链推理任务。给模型留出推理空间能显著降低跳步作答、凭直觉蒙答案的概率——这也是思维链Chain-of-Thought在多步推理任务上的经典收益。参数定义见 mingli_bench/cli.py。--astro 做了什么把排好的命盘直接喂给模型开启--astro后框架会把 data/fortune_api_results.json 中预先排好的命盘注入提示词例如八字命盘信息 八字甲寅 戊辰 己亥 壬申 时辰申时 五行局金四局 生肖虎 紫微命盘信息 十二宫位星曜分布 命宫天同 火星 夫妻天梁 左辅 右弼 天钺 地劫 官禄天机 天魁 陀罗 ...这一步的价值在于把排盘与推理解耦模型不必再自己干万年历换算、节气交界等容易出错的手工排盘分数反映的是纯粹的命理推理能力而非日期转四柱的准确性加载逻辑见 mingli_bench/data/loader.py。四种参数组合各测出什么组合测出的能力适用场景均不开启排盘 推理的端到端水平想看模型裸考真实表现仅--cot推理空间充分但排盘误差仍会进入分数对比只加强推理的增益仅--astro排除排盘误差但答案一步给出对比只补充信息的增益--cot--astro✅纯推理能力官方推荐默认日常评测、模型横评如何抉择三个场景给出明确答案日常评测 / 横评模型两个都开。官方文档明确建议始终传入--cot和--astro只有做消融实验时才建议关闭。研究排盘到底拖了模型多少后腿对比仅--astro与均不开启的得分差差值即为排盘误差的影响。严谨的消融实验固定--year与--shuffle-options打乱选项防位置偏差每个模型跑 5 轮独立测试并用多数投票取最终答案排除采样随机性。从基准到高级 Agent为什么官方也强调先给命盘MingLi-Bench 同时是作者 Agentic 命理系统 Tianfu Agent 的评测底座。官方测试显示提供预计算命盘的通用大模型中最佳基线截尾准确率约40%而 Tianfu Agent 通过多智能体协作 不确定性量化将分数推到50%接近人类参赛者 Top-20 的平均水平53.5%这也解释了基准的设计理念命理推理中计算与推理必须分开测量--astro正是这条分界线。读懂评测结果每次运行在logs/下生成三类产物model_results.json每题预测、得分与整体统计model_summary.txt核心指标摘要含 CoT/Astro 开关状态model_responses/每题原始回复含完整 Prompt便于人工复核思维链质量。结果文件里会记录use_cot/use_astro标志见 mingli_bench/benchmark.py 的_calculate_statistics方便你回查每次实验的确切配置。小结拿不准就全开--cot --astro是官方推荐默认测的是纯推理能力想量化排盘误差用仅--astro和均不开启做对照做严谨消融固定年份、打乱选项、多轮投票结论才站得住。跑通一次只需要一条命令而理解--cot与--astro的分工你才能真正读懂每一分提升的来源。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表