ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI Agent_9 AI 推理与规划(Reasoning Planning)

AI Agent_9 AI 推理与规划(Reasoning  Planning) 一、先区分两个概念推理Reasoning从已知推出未知 —— 理解、逻辑、数学、因果判断。示例如果明天下雨出门就要带伞天气预报说明天下雨所以我要带伞。三段论规划Planning为达成一个目标安排一串有序的动作。示例明天出差①6:50 起床 → ②7:20 看天气下雨就带伞→ ③7:40 打车去车站 → ④提前 10 分钟到站任务分解 排序 条件分支两者的关系规划本身也是推理的产物 ——目标分解、步骤排序、风险评估 都是推理活动反过来推理常常服务于规划每一步行动前都要 想。一句话推理是 想规划是 做事的蓝图。二、大模型为什么 会 推理底层机理大模型训练时只学一件事 —— 预测下一个词。那 解数学题 的能力从哪来三个机理语言里沉淀了逻辑结构语料里有海量 因为… 所以…、如果… 那么…、数学算式、代码、论文论证。模型在 预测下一个词 的过程中把这些逻辑连接的模式 压 进了参数。它不是 懂逻辑而是 极其擅长续写逻辑连贯的文本—— 但对多数任务来说这已经足够有用。快思考 与 慢思考类比诺贝尔奖得主卡尼曼的理论 ——系统 1快思考直接给答案靠模式匹配青岛是山东的省会系统 2慢思考把推理过程一步步写出来靠分解与计算鸡兔同笼列算式。 大模型两种都能做关键在于提示词 / 机制是否触发 慢思考。推理的本质是 分解一步 大跳跃 预测很容易错模型要同时算对很多事拆成多步 小步走 后每一步都是局部简单预测错误率大幅下降。这是所有推理技术的共同内核。三、推理方法谱系从 快思考 到 慢思考逐个方法展开示例 机理① 直接回答—— 快思考。靠模式匹配续写成本最低适合常识问答。机理参数里 压 着高频关联一步续写就够。② 思维链 CoTChain-of-Thought—— 最常用的 慢思考。示例鸡兔同笼 —— 问 共 10 头 28 脚各几只提示词加 让我们一步步想模型输出假设全是鸡20 脚比 28 少 8每换一只兔多 2 脚8÷24 → 4 兔 6 鸡。机理把 一步大跳跃直接猜 6/4拆成 4 个 小步走假设→对比→换算→结论每步都是局部简单预测出错概率相乘后大幅降低。这是所有推理技术的地基。③ 自一致性Self-Consistency—— 用 多次采样 投票 过滤随机错误。示例同一道逻辑题让模型用 3 种不同思路各答一次2 个答案一致就采用。机理正确路径往往收敛到同一个答案随机错误则 各错各的。少数服从多数把单次的运气成分抹平。成本约 N 倍输出。④ 思维树 ToTTree of Thoughts与反思—— 真正的 搜索式 推理。示例24 点游戏1、3、4、6 凑 24模型同时生成多种 算式分支给每个分支打分淘汰走不通的必要时回退重试。机理像下棋一样在 思路空间 里搜索 评估 剪枝而不是一条道走到黑。自我反思Reflexion也是同一家族 —— 先生成答案再让它自己检查、挑错、重写示例写完代码后自查 bug。⑤ 推理时计算Test-Time Computeo1 类长思考—— 把 思考预算 内建进模型。示例竞赛级数学题模型在内部生成大量推理步骤可能对用户隐藏想 够了再给答案。机理训练时教会模型 该想多久、怎么想推理时按题目难度动态投入更多计算 —— 本质是把 CoT、反思等技巧从提示词层面搬进了模型内部。成本最高但对难题提升最明显。四、规划方法谱系从 拆任务 到 边做边想推理解决 怎么想规划解决 做什么、按什么顺序做。核心循环是计划 → 执行 → 观察 → 反思 → 修订规划方法谱系表方法怎么做示例机理任务分解Plan-and-Execute先整体计划再逐项执行写报告→ 拆 5 个子任务依次做计划和执行分离避免边做边乱ReAct思考→行动→观察交替旅行规划查天气→查票→订酒店每一步先想再动观察反馈驱动下一步Agent 主流范式分层规划目标→章节→段落逐层细化论文先列大纲再写每章高层定方向低层定细节层级降低复杂度反思循环PDCA计划→执行→检查→修正数据分析 Agent 边跑边改把 检查 内建进循环出错即时修正搜索式规划MCTS / 世界模型模拟多种方案择优执行AlphaGo模拟几千步棋再落子用 模拟世界 预估后果选择最优路径工具辅助规划推理中调用计算器 / 搜索大数乘法先调计算器再回答把 不擅长的事 外包给确定性的工具五、推理 vs 规划区别与联系维度推理 Reasoning规划 Planning回答的问题怎么想对按什么顺序做输出结论、判断、解释步骤序列、任务清单、方案典型技术CoT、自一致性、思维树任务分解、ReAct、反思循环失败表现算错、想歪、编造步骤漏步骤、顺序错、循环跑偏关系规划要推理来支撑推理常服务于规划的一步在 Agent 里它们合体每一步 执行前想清楚 推理决定接下来做哪步 规划做完检查对不对 反思既是推理也是规划的修正。六、成本权衡什么时候该 慢思考慢思考不是免费午餐成本 token 消耗 延迟 出错风险。简单问题青岛是哪个省用快思考 —— 上 CoT 反而浪费、还可能想偏中等难题数学应用、逻辑题用 CoT—— 性价比最高难题竞赛题、长链推理、代码调试用自一致性 / 反思 / 长思考 —— 值得多花钱工程实践好系统会按任务难度动态调配简单请求走快模型复杂请求自动升级到慢思考模型。七、常见失败模式新手必看编造推理幻觉式步骤模型会 算出 看似完整但错的步骤 —— 它优化的是 像推理不是 真正确。缓解关键步骤交给工具计算器、代码验证。规划失控循环不终止同一个错误反复试、跑偏忘记原始目标、工具滥用每步都调工具。缓解给 Agent 设 最大步数 / 预算、定期回顾目标反思环节。上下文膨胀超长思维链占满窗口反而把有用的信息挤掉。缓解思考过程精简、及时清理。过度思考简单问题也长篇大论浪费钱和时间。缓解分级路由。八、实际价值复杂任务的质量上限推理决定 能不能想对规划决定 能不能做完—— 两者是 Agent 从玩具走向生产力的关键应用场景科研长链推理、编程调试 重构、数据分析计划 - 执行 - 归因、决策支持多方案推演、游戏 / 搜索规划 模拟行业趋势o1 类 推理模型 Agent 类 规划执行 正在合流 —— 未来的 AI 系统 会推理的大脑 会规划的调度器 会执行的工具。一句话总结推理是把 一步大跳跃 拆成 多步小步走CoT、自一致性、思维树、长思考规划是按 计划→执行→观察→反思 排布行动序列任务分解、ReAct、PDCA两者在同一个循环里协同就是 AI 从 会聊天 到 会办事 的全部秘密。理解这条主线你就能读懂市面上任何 会思考的 AI 产品在做什么。
返回列表