ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

为什么说代码是通用Agent 的元能力?

为什么说代码是通用Agent 的元能力? 代码为什么是通用Agent的基础因为工具只能调用开发者提前准备好的能力而代码允许 Agent在运行时创造原本不存在的能力。这个差别决定了 Agent 的能力边界能扩张多远以下按四个层次展开代码作为一种元能力的作用。第一层让不可靠的判断变成确定执行LLM 的判断天然不确定比如算数可能算错业务规则可能绕过。代码的作用是把 LLM 的判断翻译成确定性的执行。计算和逻辑交给代码LLM 擅长理解算一下这批货的含税总价但真让它做多步乘法和累加经常出错。因此可以这样做Agent 把计算需求翻译成 Python 代码交给 code_interpreter 执行拿回精确结果。比如年龄大于 18 且已实名认证用自然语言可能有多种理解写成age 18 and is_verified就毫无歧义。LLM 做翻译代码做执行。两者单独都有短板协同起来互补。业务规则用代码锁死书里用航空公司取消政策的例子讲了三层防护层层递进第一层自然语言规则写在系统提示词里。帮 Agent 理解政策、向用户解释原因。但提示词是建议模型可以不听。第二层工具参数作为 checklist。取消订单的工具设计了expected_cabin_class、expected_insurance等参数。模型要填这些参数就必须先查询订单详情逐条核对。查到经济舱 没买保险时模型对照政策发现不符合条件根本不会发起调用直接告诉用户不行并给替代方案。第三层服务端代码校验。服务端完全不看expected_*参数——那些只是模型的自我陈述。服务端自己从数据库查真值用代码逐条校验。前两层引导模型做对第三层保证模型做错了也拦住。这三层的共同模式就是这一节的主题LLM 做判断代码负责确定性。第二层没有工具就现场造一个普通 Agent 在工具箱里选工具能写代码的 Agent 则可以扩充自己的工具箱。Agent 需要跟一个外部系统进行交互但没有现成工具时按这个系统的 API 完备程度其应对方式分三档有 API 没 SDK——系统提供了 HTTP 接口但没有封装好的开发包。Agent 读 API 文档现场生成调用代码有 API 但格式不标准——系统的接口返回的数据格式跟 Agent 期望的不一样。Agent 生成一层格式转换的适配代码连 API 都没有——系统只有图形界面没有任何程序化接口。Agent 先用 Computer Use 像人一样点击操作 GUI然后把这套操作序列固化为 RPA 脚本下次直接跑脚本书里举了日志自适应解析的例子前端遇到新格式的日志解析失败上报给 Agent。Agent 分析格式生成新的解析代码测试通过后热更新到生产环境。整个过程不需要人工介入Agent 用代码给自己造了一个之前不存在的工具。普通 Agent 在工具箱里选工具能写代码的 Agent 可以扩充自己的工具箱。第三层代码改变人与 Agent 的交互形式Agent 不必永远通过聊天框工作代码让它可以现场生成更合适的交互和输出形式。生成式 UIAgent 可以动态生成界面来替代低效的文字对话主要有三种模式A2UI 声明式界面——Agent 直接生成 HTML 有安全风险如果输入里藏了恶意指令Agent 可能被操纵生成窃取用户数据的脚本。A2UI 的做法是 Agent只输出 JSON 界面描述“显示一个 3 行 2 列的表格”客户端用自己预先准备好的安全组件来渲染。Agent 能指定显示什么内容但没法注入任何可执行代码。最安全但灵活性受限于预定义的组件目录。动态表单——订机票要收集目的地、日期、人数、舱位等五个信息用文字对话要来回问五轮每轮一次 LLM 调用。Agent 分析任务后一次性生成一个表单包含所有需要填写的字段用户 30 秒填完提交。五轮对话压缩成一次表单提交而且日期选择器直接返回标准格式不需要模型去解析下周五是几号。SQL Artifact——用户问上个月各产品线销售额是多少常规做法是 Agent 查数据库几百行结果全部进 LLM 上下文LLM 再整理成表格输出——贵、慢、还可能在转述过程中丢行或算错汇总数字。SQL Artifact 模式下 Agent 只负责根据用户的自然语言问题写出 SQL 查询这段 SQL 交给系统直接执行数据从数据库直达界面全程绕过 LLM。省 token防转述出错也避免敏感数据比如员工薪资进入 LLM 上下文。代码驱动的多媒体生成Agent 通过代码精确控制每一页幻灯片的布局、每一帧视频的剪辑。跟视频生成模型Sora、可灵从零创造画面完全不同——这里的代码操作的是已有素材。PPT 和视频都用提议者-审核者的迭代模式。具体流程Proposer Agent 生成代码PPT 用 OOXML 代码视频用 Blender Python 脚本系统渲染出实际效果Reviewer AgentVision LLM看渲染结果并输出结构化反馈“第 3 页标题被截断”“配色对比度不足”Proposer 根据反馈修改代码重复直到 Reviewer 通过。分两个 Agent 的核心优势是上下文管理。如果用单个 Agent每次迭代都要在上下文里累积之前所有版本的渲染图和反馈很快就撑爆。分开之后 Reviewer 每次只看最新一张渲染图Proposer 只累积文字反馈两边的 token 消耗都很低。我自己用这个思路生成的PPT实际效果如下第四层代码反过来改造 Agent 自己最后一层代码的作用对象从外部世界回到了 Agent 自身。自我修复Agent 运行时间长了会积累各种小问题——配置文件跟实际环境不匹配、依赖包版本冲突、某个工具的权限设置过期。如OpenClaw 的doctor命令就能让 Agent 自己诊断和修复这些问题它主要分两层确定性检查——用代码写好的固定规则逐项扫描已知的高频问题“配置文件里有没有必填字段缺失”“依赖版本是否在兼容范围内”。能覆盖大部分常见故障执行快、结果可靠LLM 诊断——确定性检查没命中时把错误日志和环境信息交给 LLM 分析。LLM 能理解没见过的异常组合兜底处理长尾疑难日志分析生成测试用例Agent 读取生产日志定位问题后不只是输出一份分析报告——它能生成回归测试用例。测试用例进入测试套件每次改动自动跑一遍同样的 bug 再出现时直接报红。LLM 负责理解和判断代码负责把判断固化为可重复、可追踪的工程资产。分析报告看完就没了测试用例和工单会一直在。创造新 AgentAgent 用代码创造与自己同类的 Agent。关键技巧不从零开始写而是复制自己的代码再针对性修改。从零生成一个完整的 Agent 代码库模型很容易遗漏关键配置或犯结构性错误。但如果基于一个已经能跑的 Agent 代码做修改——改工具定义、改系统提示词、改业务逻辑——成功率高得多因为框架结构、错误处理、安全配置这些最佳实践自然保留在模板里。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表