ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何用 LLM Checker calibrate 一步生成校准路由策略:确定性模型分发完整指南

如何用 LLM Checker calibrate 一步生成校准路由策略:确定性模型分发完整指南 如何用 LLM Checker calibrate 一步生成校准路由策略确定性模型分发完整指南【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checkerLLM Checker是一款扫描你的硬件、精确告诉你本地能跑哪些 LLM 或 sLLM 模型的 CLI 工具并深度集成 Ollama。本文介绍它的进阶能力用calibrate子命令对模型做实测校准自动生成一份校准路由策略calibration policy让后续的模型推荐与推理分发从经验猜测变为确定性路由——同样的任务永远命中同一台机器上实测最优的模型。为什么需要校准从猜模型到测模型默认的模型推荐基于硬件规格和模型元数据打分能装下、显存够、上下文合适。但能跑不等于跑得好。同一台机器上7B 模型不一定比 3B 快量化方式差异会显著改变实际吞吐编码任务和通用对话任务最优模型往往不同团队里想统一编码任务一律用 A 模型、通用任务用 B 模型的约定时需要一份可审计、可复现的规则文件而不是靠口口相传。calibrate正是为此设计它用一组真实的提示词prompt suite在你本地硬件上实际跑模型采集延迟p50/p95、TTFT、tokens/s 和质量检查通过率再按你指定的目标速度/质量/均衡自动合成一份路由策略文件。之后recommend与ai-run都可以通过--calibrated参数直接消费这份策略实现确定性分发。准备工作一个 prompt suite 就够校准的最小输入是一个 JSONL 文件每行一个 JSON 对象包含任务类型和提示词。仓库自带了开箱即用的示例套件sample-suite.jsonl包含coding与general两类任务适合第一次跑通流程sample-generated-policy.yaml由校准输出生成的路由策略样例可以直接看到策略文件长什么样docs/fixtures/calibration/README.md示例文件的用途说明。你可以直接复制这个套件使用也可以把自己的提示词按同样的格式写成一个新文件让校准更贴近真实业务场景。calibrate 快速上手3 步生成路由策略第 1 步生成校准契约与策略文件cp ./docs/fixtures/calibration/sample-suite.jsonl ./sample-suite.jsonl llm-checker calibrate \ --suite ./sample-suite.jsonl \ --models qwen2.5-coder:7b llama3.2:3b \ --runtime ollama \ --objective balanced \ --dry-run \ --output ./artifacts/calibration-result.json \ --policy-out ./artifacts/calibration-policy.yaml关键参数速查参数作用--suite提示词套件JSONL定义了要测哪些任务--models逗号或空格分隔的待校准模型列表--runtime运行时支持ollama、vllm、mlx完整实测模式full目前支持 ollama--objective路由目标speed/quality/balanced--dry-run演练模式不真正调用模型用于先验证流程--output校准结果contract输出路径--policy-out路由策略policy输出路径去掉--dry-run、改用full模式后工具会真正调用 Ollama 逐条执行提示词做预热 多轮测量产出带完整指标的结果。完整实现的源码见 calibration-manager.js。第 2 步让 recommend / ai-run 消费策略# 用策略文件做确定性推荐 llm-checker recommend --calibrated ./artifacts/calibration-policy.yaml --category coding # 用策略路由直接跑一次编码任务 llm-checker ai-run --calibrated ./artifacts/calibration-policy.yaml --category coding \ --prompt Refactor this function路由与匹配的完整逻辑任务别名归一化、primary/fallback 依次降级、模型标识匹配见 policy-routing.js。第 3 步配置默认策略实现零参数分发把策略文件放到用户目录约定位置后--calibrated可以不带路径# 放到 ~/.llm-checker/ 下即可自动发现 llm-checker ai-run --calibrated --category coding --prompt Help me write a Python function默认发现路径依次为~/.llm-checker/calibration-policy.yaml、.yml、.json。策略是怎么决定模型分发的生成的策略文件按任务分路routing每条路由包含primary该任务的第一选择模型fallbacks依次降级的备选模型min_quality质量门槛默认 50 分不达标则放宽到全体候选rationale可读的决策依据包含目标函数与综合得分。在full实测模式下合成路由的打分逻辑是见 calibration-manager.js 中的synthesizePolicyRoutes目标objective质量权重速度权重speed25%75%quality80%20%balanced50%50%速度分由实测 tokens/s 减去 p50 延迟折算而来质量分来自提示词检查精确匹配/包含/正则的加权通过率。得分并列时按质量分、再按模型名排序保证结果完全确定、可复现——这正是确定性分发的含义同一份策略 同一台机器每次给出相同的路由结果。参数优先级与常见坑--policy file优先于--calibrated [file]同时传两者时--calibrated会被忽略并给出警告--calibrated不带路径时走默认目录发现找不到策略会回退到确定性选择器并打印警告而不是直接报错策略文件支持 YAML 与 JSON 两种格式扩展名决定解析方式--dry-run不能与其他--mode值组合校准结果与策略都会经过 schema 校验schemas.js字段不符会明确报错而不是静默产出坏文件。相关文档与源码导航使用指南含完整校准工作流示例docs/guides/usage-guide.md进阶用法CI/CD、监控脚本等docs/guides/advanced-usage.md校准管理核心src/calibration/calibration-manager.js路由与策略消费src/calibration/policy-routing.js数据格式定义src/calibration/schemas.js示例 fixture 说明docs/fixtures/calibration/README.md小结llm-checker calibrate把哪台机器、哪个任务、该用哪个模型变成了一次实测 一份 YAML 的事先 dry-run 验证流程再 full 实测生成策略最后用--calibrated让recommend与ai-run走确定性路由。对于需要可复现、可审计、可团队共享的本地模型分发方案这套校准工作流是 LLM Checker 里最值得掌握的进阶玩法。【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表