ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

还在把AI当聊天机器人?万字详解LLM与Agent的本质区别,一文讲透“超级大脑”如何长出手脚

还在把AI当聊天机器人?万字详解LLM与Agent的本质区别,一文讲透“超级大脑”如何长出手脚 Agent 保姆级万字详解·第二章什么是 Agent上一章咱们聊了为什么学 Agent聊了大厂招聘变了天、聊了市场缺口有多大、聊了这玩意儿为什么是窗口期。聊了这么多有个最基本的问题还没回答Agent 到底是什么很多人口中的 Agent 就是AI 助手是能对话的机器人。这么说也不能说错但太浅了。就像说手机就是打电话的工具一样——这句话在 1990 年代是对的放到现在就有点可笑了。Agent 远远不止是一个聊天机器人。咱先把 LLM 搞清楚因为 Agent 是长在 LLM 上的不懂 LLM 的脾气你永远搞不懂 Agent 为什么这么设计。LLM 到底是个什么东西先说大语言模型Large Language Model英文缩写 LLM。这玩意儿你现在应该不陌生了满大街都是它的消息。但我赌五毛钱大多数人只是知道它能聊天、能写文章、能帮你改代码对它到底是怎么回事其实还是一笔糊涂账。我给你打个比方。想象一个超级大脑。这个大脑牛逼到什么程度呢它把人类有史以来所有公开的文字都读了一遍——小说、论文、新闻、代码、论坛帖子、买菜软件的用户评价、政府红头文件、寺庙的经文……全读了。几百 TB 的文本塞进去消化掉总结出一套文字接龙的规律。这套规律复杂到什么程度它有几百亿个参数每个参数都记录了一小块语言应该怎么接的知识。你可以理解为它脑子里住着无数个老师每个老师专精一个领域有的专精写古诗有的专精写代码有的专精写土味情话。大模型回答你问题的时候等于是这帮老师一起开会投票决定下一个字该写什么。所以 GPT 能写代码、能聊哲学、能帮你编年终总结不是因为它懂这些知识而是因为它见过太多类似的文本它知道这种东西一般会怎么写。说白了它是一个超级拟合器把人类语言的各种模式都拟合进去了。现在咱知道 LLM 是什么了一个博览群书的超级大脑脑子里装满了文字接龙的规律。但是——对我要说但是了——这个超级大脑有一个致命的问题它只能坐在轮椅上手脚被绑住只能张嘴说话无法直接干预现实世界。这怎么理解你跟 GPT 说帮我查一下明天北京的天气GPT 能给你写一段天气预报的稿子什么预计明天北京晴转多云气温15到25度写得像模像样。但它真的知道明天北京下不下雨吗不知道。它只是在模仿天气预报的写法不是真的去查了气象数据。你让它帮我在飞书上创建一个请假申请它能给你写一段申请文案但它真的能帮你点那个提交按钮吗不能。它只能输出文字飞书根本不知道你在干什么。这就是 LLM 的本质局限它是一个只会输出的黑盒子你给什么输入它吐什么文字。它不知道真实世界在发生什么也改变不了真实世界的一根毛。LLM 的三大硬伤光知道 LLM 是什么还不够咱得搞清楚它的毛病在哪儿。Agent 之所以诞生就是来治这些毛病的。第一宗罪幻觉——一本正经地胡说八道LLM 最臭名昭著的问题就是幻觉Hallucination。啥意思呢就是大模型会编造假信息而且编得特别像真的脸不红心不跳。比如你问它《百年孤独》的作者是哪年来中国的GPT 大概率会给你一个答案可能还煞有介事地写上年份和地点。但实际上马尔克斯这辈子压根没来过中国。大模型根本不知道这事儿是真是假它只是在模仿回答问题的语气把一段看起来合理的文字吐出来。你要是做开发做一个 AI 客服回答用户你们的退换货政策是什么大模型瞎编一条政策出来用户还真信了然后申请被拒——完蛋客诉就来了。你要是做医疗问答让 AI 推荐用药它给你编一个不存在的药名——这事儿就不是客诉了是医疗事故。幻觉问题是 LLM 的基因缺陷理论上没法彻底根除。你能做的就是给它足够准确的上下文、限制它的发挥空间、让它调用外部工具去查真实数据而不是靠脑子里记忆的知识来回答。Agent 就是干这个的。第二宗罪知识滞后——不知道今天发生了什么GPT-4 的知识库是有截止日期的比如截止到 2024 年 6 月。在这个日期之后发生的事儿它一概不知道。你问它特朗普是第几任美国总统它能答上来。你问它昨天晚上欧冠谁赢了它只能说我的知识有截止日期无法回答。这个问题在企业应用里更要命。你想让 AI 回答我们公司今天有多少未处理的订单它怎么回答它的脑子里根本没有你们公司的数据库。你想让 AI 告诉你今天的股价是多少它只能摊手。LLM 本身是一座图书馆不是一个实时数据源。你不能指望图书馆告诉你十分钟前发生了什么事。Agent 的解决方案是什么给它接上实时查询的工具。让 Agent 能够调用 API、查数据库、搜搜索引擎把最新的信息拉进来再做回答。这样它就不再是只会回忆过去的书呆子了而是能查实时资料的活字典。第三宗罪只能输出文字——无法真正干预现实这是最核心的问题。LLM 的一切输出都是文字它不能帮你发邮件、不能帮你订机票、不能帮你审批流程、不能帮你修改服务器上的配置文件。你说帮我把这份文档发给张总它能帮你写一封邮件但发邮件这个动作它做不到。你说帮我把数据库里的用户余额都加100它能写一段 SQL但它执行不了这段 SQL。你说帮我把服务器重启一下它能给你敲命令但这个命令只在它的输出框里根本传不到服务器的终端上。这就是只能说话、无法动手的困境。LLM 是一个超级打字员但不是超级执行者。而 Agent 要做的就是给这个打字员装上手脚让它不只能说话还能真正干活。Agent 闪亮登场好铺垫够了现在可以正式介绍 Agent 了。Agent中文叫智能体你可以理解为能自主行动的 AI 系统。它不是一个单一的算法而是一套架构——把 LLM 当作核心大脑然后给它配上眼睛感知、手脚工具调用、记忆上下文管理和规划能力任务拆解让它能真正完成复杂任务。我给你一个核心公式记住这个公式这章的内容你就掌握了一半Agent LLM 规划 记忆 工具咱一个一个说。LLMAgent 的大脑Agent 的核心引擎还是大语言模型。LLM 负责理解用户意图、做推理、做决策。大脑还是那个大脑但 Agent 给它穿上了盔甲、装上了义肢。规划Agent 的思考方式光有大脑不行还得有想事情的逻辑。这就是规划模块的作用。当用户说帮我订一张后天北京到上海的机票的时候Agent 不能直接调 API它得先把任务拆开第一步查后天的航班有哪些第二步用户有没有偏好的航空公司第三步比较价格和时间第四步选定航班后调用订票接口第五步把订票结果返回给用户这就是任务规划Task Planning。Agent 需要有能力把一个模糊的指令拆成一系列具体的子任务然后按顺序执行。没有规划能力Agent 就是一个只会瞎忙的莽夫。记忆Agent 的记事本人类做事为什么要记笔记因为脑子记不住所有事情而且记太久了会混。Agent 也是一样的。记忆模块负责存储几类信息短期记忆当前对话的上下文。比如用户之前聊过想订机票Agent 记住这个意图等用户说换个时间的时候它知道是在说什么。长期记忆积累下来的知识、用户偏好、历史任务记录。比如用户之前说过我常坐东航的航班Agent 记住了下次订票就优先推东航的班次。没有记忆的 Agent 就是金鱼只有 7 秒记忆每次对话都是全新的开始体验很差。工具Agent 的手脚这是最关键的部分。工具模块让 Agent 能够真正动手干活而不是只能耍嘴皮子。工具的形式多种多样搜索引擎查实时信息、查新闻、查商品价格数据库查企业数据、查订单、查库存API 调用发邮件、发短信、调用第三方服务代码执行器运行 Python 代码、做数学计算、操作文件系统RPA 机器人控制浏览器、填表、点按钮每一种工具都是一个能力插件。Agent 根据任务需要选择合适的工具来用。就像一个人类员工公司给他配了电脑、电话、汽车他用这些工具去完成工作任务。LLM 本身不会用这些工具但通过特殊的训练和设计Agent 可以学会看到任务就知道该用什么工具以及怎么用工具。这就是第三章我们要重点讲的Function Call。执行Agent 的行动闭环有了大脑、规划、记忆、工具之后Agent 是怎么工作的呢它遵循一个感知-规划-执行-反馈的闭环感知接收用户的输入理解用户想要什么规划拆解任务决定先做什么、后做什么执行调用工具开始干活反馈检查执行结果如果不对就调整策略重来这个闭环就像人类处理工作的方式。你老板布置一个任务你不会傻乎乎直接干而是先理解任务、制定计划、执行、遇到问题就调整。Agent 也是一样的。Agent 不是银弹说了一大堆 Agent 的好处咱也得泼点冷水。Agent 不是万能的不是银弹不是你搭一个系统扔进去就能解决所有问题。首先LLM 的幻觉问题Agent 只能缓解不能根治。你给 Agent 装上了工具但它会不会用错工具、会不会误解工具返回的结果这都有可能。Agent 的可靠性在工业落地中依然是个悬而未决的难题。其次Agent 的规划能力受限于 LLM 本身的能力上限。如果 LLM 推理能力弱Agent 的任务拆解就会出问题一环错步步错。第三Agent 系统的复杂度比单纯调 API 高得多。你要处理工具定义、错误处理、循环检测、多 Agent 协作……这些都是工程上的硬骨头。但即便如此Agent 依然是 LLM 落地最可行、最有前景的方向。因为它解决的是LLM 怎么真正用起来这个根本问题而不是在那儿调模型参数、刷 benchmark 分数。这章我们学到了什么咱来快速过一遍这章的要点LLM 是一个超级大脑装满了文字接龙的规律但只能输出文字无法干预现实LLM 有三大硬伤幻觉会编假信息、知识滞后不知道新发生的事、无法执行操作只能耍嘴皮子Agent LLM 规划 记忆 工具给大脑装上了眼睛、手脚和记事本Agent 的核心能力任务拆解、上下文管理、工具调用、反馈调整这些概念你得记牢后面咱们讲 Function Call、讲 MCP 协议都是在这些基础上继续盖楼。下一章咱们要聊的是 Agent 落地最关键的一环——Function Call也就是怎么让 AI 调用工具。这是从理论到实践的第一步也是你真正能动手写代码的第一步。我会用完整的代码示例手把手教你实现一个能查天气、搜新闻、调 API 的 Function Call 系统。三连催更咱们下章见作者利威尔xu一个正在死磕 AI 应用落地、热爱分享的普通后端开发。如果这篇文章对你有帮助欢迎点赞、收藏、关注更多硬核内容持续更新中。
返回列表