ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI 工程闭环的自动化趋势与质量把控边界

AI 工程闭环的自动化趋势与质量把控边界 本文字数2811估计阅读时间8分钟作者Lotte Verheyden编者按本文译自 Langfuse 原博客。 原文围绕「探讨 AI 工程闭环中自动化与人工干预的平衡点」展开。技术上实现无人值守的 AI 工程闭环已无障碍但盲目追求全盘自动化易导致质量失控。开发者应在关键环节保留人工审阅以确保系统的真实表现符合预期。如今全自动化的 AI 工程闭环在技术上已成为可能。但这并不意味着我们应该完全放手。关于哪些任务该交给 Agent哪些该由人类把控以下是我们的见解。AI Agent 几乎能独立完成 AI 工程闭环中的每一个环节。工具链已经成熟上下文也已齐备实现无人值守的闭环并非难事。这也是行业目前的发展方向通常被称为“持续学习”continual learning这种方向大体没错但若将闭环全盘托出则是误区。一旦自动化程度超过了你对质量的把控底线最终产出的只会是一堆Agent 废料agent slop。什么是 AI 工程闭环结合行业现状与用户反馈我们将持续优化 AI Agent 的过程提炼为“AI 工程闭环”。我们在 academy 中对此有详细介绍。闭环中的一部分在线上实时运行。Trace追踪数据从生产环境持续流入监控系统则负责发现值得深挖的异常。亲自审阅 Trace 也是监控中不可或缺的一环它能让你直观感知系统的真实脉搏是整个流程中价值极高的步骤。其余环节则发生在开发阶段即发布变更前。你需要构建一个贴近真实生产场景的数据集以便系统性地测试变更并不断调优。如果某项变更表现更优就将其部署上线。这是一个循环往复的过程。你可以将这一切自动化梳理上述步骤可以发现从技术角度看没有任何环节必须依赖人工。现在Agent 已经能完全自主地完成应用插桩instrumenting。至于其他步骤各大平台通常也提供了 API 或 CLI 供 Agent 直接调用。任务是否已有自动化工具查看 Trace发现所有异常并打标签✅基于生产环境报错和合成用例构建数据集✅运行实验并得出新思路根据评估结果不断优化✅测试新发布的模型并提交包含适配 Agent 的 PR✅......既然每一步都能自动化理论上循环就能自行运转。然而技术可行性并不等同于工程合理性。将人类完全排除在闭环之外是有代价的这个代价就是agent slop智能体废料。这会制造出 agent slopAgent slop由其他 AI 智能体批量生产的低质量 AI 智能体。通常是智能体基于不完美的评估标准和数据集进行盲目优化所致。你一定希望 Agent 的行为符合你的标准并能体现你在意的细节。这些细节存在于你的直觉中且会随着你认知的提升而演进。如果将整个循环完全自动化Agent 就会朝着一个不完整的目标进行优化其行为也会随着时间推移而逐渐掉队。这会导致 Agent 的表现虽在指标上“达标”但在实际感官上却差强人意。用户理应获得更优质的体验而守住质量底线正是开发者的责任。哪些需要自动化哪些需要人工介入我们预见在未来这个循环的大部分环节能够自行运转。但你必须谨慎选择哪些部分可以交给 Agent 负责并在那些“判断力即产品”的环节中保持人工参与。把握好这个平衡产品质量就会提升因为你将有精力去专注那些原本无暇顾及的高杠杆工作。但如果过度追求自动化就会面临产生agent slop的风险。坚持人工查看 tracesAI 应用的行为往往难以预料。如果只关注 Agent 或评估器自动标记的 Trace你看到的只是预设好的局部。为了捕捉那些意料之外的瑕疵必须定期抽样并亲自研读 Trace。这是你建立直觉、形成判断标准的过程。在形成判断的同时你会在这些 Trace 上留下反馈供 Agent 后续学习。这些修正操作会将 Agent 重新引向你认为正确的方向。此外隐式用户信号implicit user signals也至关重要。虽然处理过程是自动的但信号源头依然是真实的人类。这是挖掘那些未被规则覆盖、却极具研究价值的 Trace 的绝佳途径。将剩余环节自动化其他所有工作都可以交给 Agent 处理前提是它具备足够的上下文来胜任这些工作。应用该实现什么功能、什么样的回答算优秀、哪些行为不可接受这些都只能由你来教给 Agent。这种上下文需要通过具体的形式传达比如审阅 Trace 时留下的反馈以及设定的评估维度。在此基础上你就能和 Agent 共同构建数据集和评估器。步骤人工自动化理想平衡Trace-一次性配置trace 自动流入。自动化。监控逐条手动查看 trace。结论深刻但难以持续。Agent 标记已知规则和明显错误质量很容易触及天花板。自动化但保持对 trace 的抽样以捕捉预期之外的行为。构建数据集手动挑选所有样本。具备代表性但维护效率低。Agent 根据自身标签构建数据集其质量上限取决于你的监控程度。通过监控反馈保持数据集的多样性与代表性。实验手动测试各个变体。细致但覆盖范围有限。Agent 生成并运行变体从而提升指标。默认自动化视情况人工介入。评估手动为运行结果打分并构建评估器。准确但繁琐。评估器自动更新明显错误修复后质量便不再提升。抽样审查让 Agent 根据你的反馈校准标准。随着应用逐渐成熟这类上下文会越来越多地涉及一些主观的细节判断而这些只有你能敏锐捕捉。这一切都建立在你亲自查看 Trace 的基础上你提供的上下文越清晰就能将循环中越多的环节安全地交托出去。你的品味即优势循环中的机械性重复正逐渐被 Agent 接管这其实是件好事它能让你从琐事中抽身专注于打磨 Agent 的独特性。当基础劳动力趋于同质化时真正让你的 Agent 脱颖而出的将是你对“优秀”的审美力以及在调优过程中倾注的匠心。关于我们ClickHouseclickhouse.com) 是面向 AI 时代打造的高性能实时分析数据库能够以极致性能处理海量数据分析任务。凭借高并发、低延迟和云原生架构ClickHouse 广泛应用于可观测性、数据仓库、实时分析及 AI 数据基础设施等场景。我们致力于帮助企业在公有云平台上构建安全、弹性且高性价比的实时分析与 AI 数据平台加速释放数据价值推动智能化创新与数字化转型。目前Trip.com、DiDi、Meta、Sony、Netflix、Deutsche Bank、Sierra、Cloudflare 等全球领先企业均在使用 ClickHouse 支撑其关键业务和数据分析平台。
返回列表