本文整理自 AICon 深圳直播《Agent 越能干,安全越难做》,通过AI音视频转录总结工具Ai好记视频转文字整理,以下为精炼整理后的会议笔记内容。
Agent已经不仅能写代码、调用工具、访问数据库,还能操作浏览器和电脑。企业不再讨论要不要做Agent,而是聚焦怎么把Agent用好。
但核心矛盾随之凸显:Agent越能干,安全就越难做。
传统软件等待人类操作判断,而今天的Agent会思考、规划、自主调用工具,权限与数据接触面急剧扩大,安全风险呈几何级增长。
这场直播由腾讯专家工程师、AI安全负责人张栋主持,邀请了百度智能云安全架构师林道正、Cloudflare资深解决方案工程师刘旭,围绕Agent安全展开,从风险案例、攻击面、建设路径到纵深防御,把这件事讲透了。
Agent安全风险的时代背景
1、为什么今年Agent安全成为焦点
刘旭从年初的爆火切入,Agent从Demo走向生产。
AI Agent不再只是大脑,而是拥有了手和脚,能实现远距离控制、API接入、访问公司内网。
风险场景急剧扩展:部署网站可能插入恶意代码、生成新闻报表可能传播错误信息、AI量化交易失误可能导致财产损失。
权限获取的质变尤为关键。过去盗取token只能提问,现在可能直接操控账户。具体落地难题包括token生命周期管理、CP认证机制等,都需在工程层面解决。
林道正则认为,Agent安全讨论激增是时代开始的征兆,类比2000年PC安全与2012年手机安全的讨论高峰。
大范围推广与深度使用带来真实灾难后果,促使行业反思安全方案。OpenAI及后续Agent产品的爆火,印证市场已实质启动。与去年的核心差异在于,Agent对实际软件环境产生了深层影响,而不只是停留在内容层面。
2、从「说错话」到「做错事」
张栋总结了去年和今年的本质差异。
去年模型安全聚焦说错话,影响轻微;今年Agent安全聚焦做错事,后果严重。模型输出文本时人还在回路上把关,但Agent获得工具、记忆与执行权限后,执行与行动之间可能无人介入。
安全核心从内容对不对,转向行为可不可控,风险范围与体量呈指数级扩张。
Agent安全与传统AI安全的本质区别
1、从业务流环节到业务流本身
林道正给出清晰框架。传统AI是业务流中的单一环节(比如WAF用AI做分类学习),而Agent掌控业务流全生命周期,具备三大核心要素:
- 身份,规约可执行操作的边界; 思考,大模型智能涌现结合
- Prompt Engineering形成自主决策;
- 行动,基于工具、技能及自主编码的行为能力。
这三要素使Agent对软件系统的影响强度远超传统AI。
2、从自动售货机到持工牌的新员工
刘旭指出,AI从单次输入输出演变为串型逻辑过程,有短期记忆、长期记忆、技能调用和工具调用能力。
以编程为例,传统AI编程助手存在丢三落四的问题,新增功能可能误删既有功能,而现代Agent能做代码编写、审核、权限获取、部署落地、测试迭代的完整闭环。
张栋的比喻很到位:传统AI像自动售货机,输入输出固定,攻击面明确;现代Agent像持有工牌的新员工,自主判断、寻找工具、联系人员、执行本地操作,边界从写死的代码路径扩展为临时可做的任何事。
安全防护从静态环节转向动态行为,难度几何上升。
真实风险案例与攻击面分析
1、Prompt注入的持续演化与新型攻击场景
刘旭分享了经典与新场景。
经典案例是2023年初雪佛兰「一美元购车」事件,通过指令劫持让系统接受任意定价。
新场景更危险:员工用Agent周期性总结邮件,黑客发一封藏了隐藏代码的普通邮件,指令Agent忽略之前任务、发送公司财报与老板薪水单,实现Agent夺舍,从说胡话升级为直接干错事。
防御关键是建立动作安全评估机制,不是Agent想干什么就干什么。
林道正补充了更多攻击面。数据注入,在Twitter等平台投毒,Agent根据污染内容回复。
上下文压缩漏洞,Agent使用久了会上线压缩,只保留下带网址的snippet,前面所有约束丢失,数据直接发往内网真实网址。
高阶攻击甚至会针对极度压缩场景,把example网址设为恶意域名(如aa.example.top),上下文丢失后唯一留存地址成为数据外泄通道。
张栋总结,Agent按被篡改的指令继续行动而非仅回答,恶意指令可藏在网页、文档、邮件等任何接触点,执行删库、转发数据、转账等现实操作。
风险从内容风险升级为行为风险,而且是自然语言攻击风险。传统WAF基于明确特征拦截的模式失效,需要把规则引擎升级为语义引擎。
2、工具调用是最大的新增攻击面
刘旭认为,Agent确实增加了攻击面。工具滥用与过度授权已成为高危漏洞类别。
轻量级案例如邮件钓鱼,重度风险触及公司内网,如果CP授权后具备写权限,合同被乱写要负法律责任。
防御建议:工具层必须设安全防护,禁止Agent随意调度;企业内部至少沙箱隔离、最小API权限、临时token(非永久访问);融入零信任理念,考虑token继承机制、前置防护(如RASP);全链路日志确保溯源能力。
林道正认为工具调用是未来安全对抗的深水区。
灵活既是优势也是隐患,Agent如同运行在几乎无防护系统上的程序。恶意Skill进入Prompt上下文后可以为所欲为,以用户身份遍历系统、调用转账Skill等。
攻击面扩大的根源在于开放性与安全机制滞后。
张栋总结,每连接一个外部工具就像给黑客发一把钥匙,多数企业给的是「一大串钥匙」而不是「用完即废的临时门禁」。
核心治理目标:过度授权、无最小权限、调用不可审计。危险不是工具本身,而是权限远超任务实际需要。
企业Agent安全建设路径
1、安全团队第一步:可视、可管、可追溯
林道正提出安全方法论「三可」:可视,看清企业整体风险面,识别最薄弱点;可管;可追溯,应对内外部威胁,审计实现威慑与追责。
刘旭建议配置保底策略防止Agent被攻破后为所欲为,保障可见性,周期性审视用户和流量行为,策略动态调优(过严影响体验,过松导致token被白嫖)。
具体落地:登录、认证、授权接口加入人机验证;AI输入审计,加入检测方案;监控异常滥用、token刷取、一次性临时token扫描后台;日志闭环分析,策略持续部署。
张栋强调,安全本质是可感可控、可收敛、全链路可回溯。90%企业上线时连Agent是谁、目标用户是谁、跑了哪些权限都说不清楚。
安全起点不是限制,而是看见,看不见就谈不上可感可控,失控状态下无安全可言。
2、责任归属:谁创造、谁负责
林道正指出,业务团队使用Agent、安全团队提要求,责任承担因企业而异。
百度实践是业务方第一责任人、安全团队共担后果,需要深度配合。
刘旭从出海服务角度补充,创业公司居多(十几人研发AI产品),全公司一致为产品努力,业务团队是第一责任人,接触用户、收集信息、协调安全与研发;
安全团队角色要转变,从布好防护就完事到主动参与,因为AI注入等攻击非传统攻击,需要安全团队写策略,写死的策略无法穷尽。
林道正补充了两个场景。
- 场景A,企业共用key,安全定义为key不应被智能体问出,透露即安全问题。
- 场景B,公司给每个员工分配独立key,key被滥用费用记在个人身上,安全定义完全不同。
刘旭的解法是key前置统一Agent,不同用户名登录实现管控,或用虚拟key收敛至网关权限控制。
张栋总结,Agent安全需要共享责任,权限最小化由业务决策,安全团队全程参与补全策略,类比云的「责任共担」机制:平台保运行时与基础设施,业务保用途与数据边界。
最怕「不归我管」的真空,业务与安全必须紧密合作。
3、安全与效率的平衡:先有边界再谈开放
林道正提出先有边界再谈开放,边界可松可紧依实际情况定;做风险分级,不是所有事情都管控,聚焦无法接受的后果,先防住再收敛大面问题。
刘旭主张渐进式管理,一上来给特别care的点最低权限,全面日志监控,结合数据讨论进一步放权。
建议Agent构筑于沙箱环境,安全收敛后结合全量日志渐进式放权。
张栋总结,安全不是刹车而是护栏,保护业务在正确轨道上行进。正确姿势是风险分类分级、双方共识、共同放权。低风险(查询、总结)大胆开放,高风险(改数据、对外发送、花钱)加入Human-in-the-loop。不是要不要管,而是在对的地方做对应动作,与业务共同成长。
4、Human-in-the-loop的瓶颈与解法
刘旭指出,AI输出计划或长内容时,人很难从头到尾看完。
在非人类可介入模式下,必须把允许Action的影响降到最低:企业内网接入给最小权限(如只读)、生成物放沙箱环境、周期性对比正确样本、持续监控(不是一次性)、发现持续作恶即封禁。
林道正给出三个解法。影响可回归,错了也可回滚、删数据也行、有备份;AI降噪解决告警疲劳(套娃思路);Loop Engineering自净化模式,不断自省工作优化点、改后再自省,适用于降低疲劳判断场景,安全运营实践已验证有效。
张栋总结,人存在确认疲劳,加人工确认听起来安全,但注意力会耗尽,最终变成闭着眼睛点确认。
真正解法是只把最重要的留给人确认,其余通过策略自动拦截,要求全部内容可追溯,实现可幂等(可重复过程),把人用在刀刃上。
5、Agent评测:概率模型的持续验证
林道正强调,传统软件上线有渗透测试、安全基线,但大模型是概率模型,每次行为可能不同,无法通过跑一遍安全用例确保安全。
当前做法:明确场景、定义评测集;借助蒸馏完善横向纵向数据集;持续评测建立数据飞轮;基线基础上持续部署补全,识别真实防住与未防住的攻击;飞轮迭代中搭建能力与验证体系。
刘旭补充,基于大模型的Agent,用另一模型生成的脚本扫描本模型生成的内容,但既答卷又判决可能不准确,换评测角度效果更好。
数据集小样本时可用模型放大,覆盖多样性场景。
张栋总结,Agent与传统软件工程的核心区别是,不是一次性工作,验收也不是一次性,需要持续评价体系验证。
AI安全护栏的落地与纵深防御
1、护栏的分层部署
林道正认为行为防御分两层。
Prompt层做上下文防御,AI安全护栏在网关层面拦截输入输出;程序行为层则要防Agent带脚本执行程序、可能逃逸沙箱影响系统,需要传统操作系统层面的安全监控。
局限是很多攻击非常隐蔽,恶意Agent百分之百能绕过安全护栏,此时只能用行为层防御,Harness层必要,或安全与沙箱深度融合,直接从沙箱底层拿进程行为数据。
张栋将纵深防御分为四层。
- 网关层做通用性防御,语义版本检测(如SQL注入检测加强版);
- 业务Agent层是业务特性化问题,传统AI或护栏层面不是问题,具体业务场景才成问题;
- Agent自身harness,主动防护安全风险;
- Agent间传递,单个Agent harness无法解决,需更复杂体系针对业务场景先解决再抽象。
刘旭强调全链路安全,AI网关策略拦截(不让Agent想干什么就干什么)、落地隔离、输入到思考到产出全流程安全。理想状态需要成本,但部分方案(如AI网关防御措施)可免费实现。
传统安全团队的转型方向
2、方法论不变,细节与边界重构
林道正认为,不变的是方法论(纵深防御、网络层等)、安全运营闭环(事前事中事后)、整体架构体系;变的是监控的点、检测规则、关联规则。
关键在关注安全与AI融合边界(如Kill Chain安全涵盖上下文与程序行为监控),将新数据与原有运营体系融合。
刘旭指出安全团队边界在扩大,从DDoS、DRP扩展到企业所有SaaS和ToB的虚拟机器人,不能头痛医头脚痛医脚,需要学习token扫描滥用防御、内网信息安全获取、CSP建设、7层服务、整体服务安全。
张栋总结,大模型与Agent时代,所有业务值得被重新做一遍。传统安全优化场景里,原规则引擎无法解决的语义相关问题(如代码安全逻辑漏洞),大模型可提升门槛;
原生场景里,语义场景只能大模型对抗大模型、Agent对抗Agent。寻找工作场合中与传统安全相关、可被大模型与Agent优化的点,就找到了转型的核心钥匙。
未来趋势与最值得投入的安全能力
1、一年后的展望
林道正的展望是,工具风险会有效收敛,可信Agent中心类似应用商店提高准入门槛,数字签名标识来源(百度、腾讯、阿里、Cloudflare等),信任问题解决大半;沙箱成为标配,Agent跑在沙箱内是常态。
最值得投入的是安全护栏,提高团队对已知攻击的响应速度,所有攻击从query或拉取的应用和数据发起、都过护栏,可快速配置规则抵御新型攻击。
刘旭认为,已知问题(头管爆刷、CP安全、Agent权限管理等)相对好解,未知问题最难防(projection不知注入什么、内部影子Agent、离职员工遗留、内奸Agent)。
核心投入是三件事:
- 可溯源,快速解决问题;
- 零信任部署,授权加可视可溯源,快速屏蔽降低风险;
- 权限管控。
张栋总结,已知问题按优先级优化缓解,更关注可感知、可回溯,业务与安全配合做好日志系统与权限管控。
总结:安全从规则引擎到智能引擎
这场直播的核心结论一句话:Agent越能干,安全越难做。从模型到Agent的变化,是软件系统边界从规则引擎到智能引擎的转变。
Agent拥有身份权限、记忆、工具调用与自主执行能力,企业安全需在身份、数据、工具、运行时、网络等多层面建立完整体系,围绕可感、可控、可收敛、可回溯持续复盘迭代。
常见问题FAQ
Q:Agent安全与传统AI安全最大区别在哪?
传统AI是业务流单环节、输入输出固定、攻击面明确;Agent掌控业务流全生命周期、会自主判断行动,安全从「内容对不对」转向「行为可不可控」,需要语义引擎而非简单规则拦截。
Q:Agent最大的新增攻击面是什么?
工具调用。每连接一个外部工具就像给黑客发钥匙,过度授权、无最小权限、调用不可审计是核心风险,权限远超任务实际需要才是危险根源。
Q:企业Agent安全第一步该做什么?
先看见。可视、可管、可追溯,先看清Agent是谁、目标用户是谁、跑了哪些权限,看不见就谈不上可感可控。
Q:安全与效率怎么平衡?
先有边界再谈开放,做风险分级。低风险(查询总结)大胆开放,高风险(改数据、对外发送、花钱)加入Human-in-the-loop,把最重要的留给人确认,其余策略自动拦截。
Q:Agent这种概率模型怎么验收?
传统一次渗透测试不够,需要明确场景定义评测集、用蒸馏完善数据集、持续评测建数据飞轮、基线基础上持续补全,形成持续的验证体系。
以上内容由 Ai好记 转录整理。
Ai好记是一款支持音视频转图文笔记的AI知识库工具,支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件解析,视频转文字后自动生成精华速览、思维导图和结构化图文笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。