ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Comet × LangSmith集成指南:把Agent Skill评估与Trace追踪带入企业生产环境

Comet × LangSmith集成指南:把Agent Skill评估与Trace追踪带入企业生产环境 Comet × LangSmith集成指南把Agent Skill评估与Trace追踪带入企业生产环境【免费下载链接】cometComet: agent skill harness for turning ideas into evaluated workflows项目地址: https://gitcode.com/rpamis/cometComet是一个面向 Agent 的 Skill 评估与运行框架agent skill harness for turning ideas into evaluated workflows内置的comet eval评估系统自带LangSmith 集成套件一次评估运行即可把 Skill 评估结果、Rubric 分数、Token 成本与 Claude Code 完整 Trace 轨迹同步到你的 LangSmith 项目让 Agent Skill 的质量评估从本地跑个报告升级为企业级的可观测、可对比、可回溯的生产实践。一、为什么要把 Comet 评估接入 LangSmithComet 的comet eval默认使用local 套件报告写在项目本地的.comet/eval/runs/里适合日常开发。但进入团队协作或生产环境后你通常需要评估数据集中存储按项目/团队统一审计对比不同 Skill 版本、不同模型、有无 Skill 注入CONTROL对照的效果差异出问题时逐轮查看 Agent 的工具调用轨迹而不只是一张汇总表。这正是 Comet 的langsmith套件要解决的问题它复用与 local 套件完全相同的任务集、treatment 组合与 Rubric 判据只把结果上报层切换到 LangSmith无需重写任何评估定义。官方说明见 docs/operations/EVAL-USAGE.md中文版本docs/operations/EVAL-USAGE-ZH.md。二、集成后你的 LangSmith 项目里会有什么LangSmith 概念Comet 映射你能看到什么Dataset example每个评估任务任务输入 预期产物、必需 Skill、Rubric 判据Experiment每个 treatmentSkill 组合CONTROL与注入 Skill 的实验并排对比Run outputs每次运行轮次数、工具调用数、耗时、Token、成本、调用的 SkillFeedback scoresRubric 各维度 检查通过率rubric.*分项分数与checks_pass_rate嵌套 TraceClaude Code 完整轨迹逐轮对话、工具调用细节三、三步完成集成第 1 步获取仓库并配置 API Keygit clone https://gitcode.com/rpamis/comet cd comet/eval uv sync --extra langsmith然后在eval/.env或eval/langsmith/.env中配置三个变量即可LANGSMITH_API_KEYlsv2_pt_... LANGSMITH_PROJECTcomet-skill-eval LANGSMITH_TRACINGtrue Comet 会从这组LANGSMITH_*配置自动派生Claude Code 官方轨迹插件所需的TRACE_TO_LANGSMITH、CC_LANGSMITH_API_KEY、CC_LANGSMITH_PROJECT通常你不需要手动设置任何CC_*变量见 eval/langsmith/README.md。第 2 步运行 LangSmith 评估套件最简方式——直接用 CLI 的--suite langsmith它会读取上述环境变量、准备轨迹插件并写入项目本地报告comet eval ./my-skill --suite langsmith --html也可以走 pytest 路径做实验对比一个 treatment 对应一个 experiment用LANGSMITH_EXPERIMENT命名便于在对比页并排查看LANGSMITH_EXPERIMENTCOMET_FULL_040_BETA \ uv run pytest langsmith/tests/tasks/test_tasks.py \ --taskcomet-fix-median --treatmentCOMET_FULL_040_BETA -v LANGSMITH_EXPERIMENTCONTROL \ uv run pytest langsmith/tests/tasks/test_tasks.py \ --taskcomet-fix-median --treatmentCONTROL -v套件默认通过BENCH_TASKS_DIR等环境变量复用 eval/local/ 中的任务、treatment 与 Skill 库机制定义在 eval/langsmith/tests/conftest.py所以你在 LangSmith 里看到的评估口径与本地报告完全一致。CLI 侧的实现入口是 app/commands/eval.ts。第 3 步可选启用 Claude Code 全链路轨迹只需保持LANGSMITH_TRACINGtrue。首次运行时套件会用node:20容器把官方langsmith-tracing插件一次性构建到eval/.cache/langsmith-cc-plugin缓存目录之后运行直接复用并只读挂载进任务容器。轨迹会通过CC_LANGSMITH_PARENT_DOTTED_ORDER嵌套在对应的 run 下。几点行为保证便于生产环境放心使用轨迹追踪是best-effort插件缺失或构建失败时只跳过轨迹Rubric 与 treatment 对比照常上报不会弄挂评估想固定版本或关闭自动构建可设置CC_LANGSMITH_PLUGIN_DIR指向宿主机插件目录或CC_LANGSMITH_PLUGIN_AUTO_BUILDfalse。四、如何在 LangSmith 里读结果先看实验对比页同一任务下CONTROL与注入 Skill 的实验并排放置rubric.*分数与checks_pass_rate一眼可见优劣再看单 run 详情轮次数、工具调用、Token 与成本异常时下钻到嵌套的 Claude Code Trace 定位具体哪一步走偏失败归因本地 HTML 报告同时会给出 harness / workflow / task / model 四级 failure attribution可用来区分评估环境问题和Skill 真实能力问题。五、常见问题速查现象原因与处理环境里开了 tracingLangSmith 却没有任何 experiment未加--suite langsmith。Local 套件不会创建 LangSmith 实验必须显式选择 langsmith 套件运行被跳过、提示凭据缺失套件对非单元测试运行强制校验LANGSMITH_API_KEY配置到eval/.env即可只有分数没有轨迹轨迹插件未就绪。等待首次自动构建完成或用CC_LANGSMITH_PLUGIN_DIR指定已构建插件目录只想低成本冒烟comet eval ./my-skill --quick --html使用固定 smoke 任务不消耗完整评估六、延伸资料评估套件总览与排错指引docs/operations/EVAL-USAGE-ZH.mdLangSmith 套件安装、运行与轨迹插件细节eval/langsmith/README.md套件环境装配与插件自动构建逻辑eval/langsmith/tests/conftest.py上报封装inputs / outputs / feedback实现eval/langsmith/tests/tasks/test_tasks.py可复用的任务与 treatment 语料库eval/local/LangSmith CLI 命令实现app/commands/eval.ts按这套流程走下来你的 Agent Skill 评估就同时拥有了本地 HTML 报告快速反馈与LangSmith 集中观测生产审计双通道——同一套任务、同一套 Rubric数据口径完全一致可以直接支撑版本回归与模型选型的量化决策。【免费下载链接】cometComet: agent skill harness for turning ideas into evaluated workflows项目地址: https://gitcode.com/rpamis/comet创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表