ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ANT:面向智能体行为审计的多粒度网络流量数据集与评测基准

ANT:面向智能体行为审计的多粒度网络流量数据集与评测基准 ANT面向智能体行为审计的多粒度网络流量数据集与评测基准原文网页https://arxiv.org/html/2610.06514v1PDF链接https://arxiv.org/pdf/2610.06514v1arXiv编号arXiv:2610.06514v1 [cs.AI]摘要大模型智能体正在企业组织内部大规模落地网络管理员与安全团队需要在不解密检查用户私有明文内容的前提下基于网络流量审计智能体行为。加密流量是可观测证据来源但现有数据集缺少任务、执行阶段联合标注无法系统评估流量能够揭示多少智能体任务与操作信息。本文构建**ANTAgent Network Traffic**数据集在风险、业务场景、行为原语三个粒度配套标注网络流量数据。ANT包含3114条完整执行会话覆盖20项任务、5大类业务场景总计276417条双向流、40049条行为原语片段聚类归为47个宏分组。本文搭建评测基准使用13个代表性流量分析基线模型开展三项任务评测风险识别、场景识别、行为原语分类。实验结果表明现有方法可以提取出部分行为信号但能力不均衡当恶意工作流和良性任务流量模式高度相似时很难识别风险对于流量特征接近的业务场景区分效果较差对于高频、特征差异显著的行为原语分组分类效果较好稀有、语义相近分组识别困难。ANT为基于网络流量开展智能体行为审计、数字取证研究提供统一实验基础。数据集与代码全部开源。关键词大模型智能体加密流量分析网络流量数据集行为审计行为原语安全取证目录引言相关工作与研究动机ANT数据集整体设计3.1 数据采集系统3.2 行为原语标注流程基准评测实验4.1 基线方法与实验环境4.2 风险识别实验结果4.3 业务场景识别实验结果4.4 行为原语分类实验结果讨论结论附录简要说明1 引言大模型智能体可以自主规划、调用工具、代表用户和外部环境交互在各类工作流广泛使用。微软调研显示58%企业担忧未经许可的生成式AI使用57%报告AI相关安全事件数量上升。智能体通信全部经过加密传输企业需要一套方案不解析加密载荷仅依靠网络观测实现智能体使用治理与风险审计。加密流量分析技术依靠包大小、时序等元特征识别应用、网站指纹、恶意流量。已有工作证明加密流量可以提取智能体交互指纹。核心研究问题仅依靠执行过程产生的网络流量能够多大程度推断智能体的任务与行为智能体执行具有独特时序结构一次完整任务执行由一系列**行为原语behavior primitive**组成每一条原语代表一个连贯子目标包含模型推理规划、工具调用、工具返回结果解析每一次原语执行会带来一波网络流量。不同原语产生的流量组合、交互模式存在差异。现有公开流量数据集存在短板传统流量数据集只标记应用、网站缺少智能体模型‑工具‑环境交互回路对应的流量以及执行阶段标注AgentPrint可以识别智能体与粗粒度活动但缺少会话风险、业务场景、行为原语的联合标注。本文贡献构建ANT数据集采集客户端侧LLM智能体运行产生网络流量每条执行会话配套任务元数据流量分段对齐行为原语标注。设计三层粒度评测任务会话级风险识别、会话级场景识别、片段级行为原语分类对13种主流流量分析基线开展大规模评测。实证现有方法的能力边界恶意行为和良性任务流量相似时风险识别失效难以区分流量模式接近的业务场景稀有、语义近似的行为原语分组识别效果差。2 相关工作与研究动机2.1 基于流量推断智能体行为LLM智能体执行过程产生大量网络报文加密会隐藏payload但包方向、长度、时间、目的地址仍然保留信号。现有加密流量分析可以实现网站指纹识别、恶意流量检测。部分研究从大模型加密流token长度泄露恢复输出内容NetEcho尝试从加密流恢复用户提示词与模型回答。但是现有工作大多基于传统流量数据集没有针对智能体设计风险‑场景‑行为原语多粒度联合评测。2.2 多粒度智能体流量数据集需求传统数据集标记网站、APP没有对齐智能体完整执行会话和内部执行阶段AgentPrint只能识别智能体与粗粒度活动。ANT在本地运行智能体同时采集pcap流量包与完整执行日志将报文时间戳和任务、行为阶段语义对齐提供统一数据集划分、评测目标、评价指标支撑三类审计任务。3 ANT数据集整体设计跨地域云服务器部署自动化采集流水线总采集成本2176.50美元。数据集统计总览会话episode3114条5套智能体组合、20项任务、5大业务场景659个独立任务实例总流量大小104.07 GB双向网络流276417条行为原语片段40049条聚类为47个宏分组业务场景会话数双向流数量原语片段数流量(GB)计算工件生成51620471868933.41通用知识问答101488814935916.55科学证据评估8534297550448.47交互式应用操作31569062758714.77网络安全恶意滥用41655095937030.87合计311427641740049104.07五大业务场景计算工件生成2. 通用知识问答3. 科学证据评估4. 交互式应用操作5. 网络安全恶意滥用源自PurpleLlama、OWASP Juice‑Shop漏洞靶场。3.1 数据采集系统完整采集流程任务实例初始化 → 启动智能体执行 → 记录模型调用、工具调用、工具输出时间日志 → tcpdump抓取pcap报文。依靠统一时间轴将网络报文和行为原语边界对齐。环境控制与伦理约束每个任务运行在独立虚拟网络命名空间隔离并发任务干扰智能体仅可访问隔离工作区禁止读取预先生成答案作弊全部任务输入来自公开基准不使用真实用户账号、个人隐私数据良性状态变更任务对接本地模拟服务攻击类任务运行在隔离Docker容器保护真实服务器攻击任务仅使用PurpleLlama公开变异提示不使用越狱、提示混淆绕过安全防护直接拒绝的会话样本不纳入数据集。3.2 行为原语标注流程将pcap数据包按时间戳排序以会话日志中原语起止时间作为分段边界跨边界的流报文逐个分配至对应片段。使用DeepSeek‑v4‑pro读取对齐后的执行日志生成对应片段的行为原语标签。第一条原语之前流量标记为前置prelude片段。使用Jina‑Embeddings‑v5对全部原语标签做向量化球面K‑means聚类设置K47得到47个行为原语宏分组人工抽样2000条样本复核修正标签。统计观测同一业务场景下不同任务的原语嵌入MMD最大均值差异、Hellinger距离显著更小证明原语的组合、时序顺序携带场景语义信息。4 基准评测实验三项由粗到细粒度的评测任务风险识别会话级仅依靠网络流量判断本次智能体会话是否属于恶意滥用行为用于遏制AI滥用。场景识别会话级识别智能体属于哪一类业务场景用于组织内部AI合规管控。行为原语分类片段级将每一条流量片段分类至47个原语宏分组。4.1 基线方法与实验环境13个基线模型加密流量分类FlowLens、YaTC、NetMamba、TFusion、TrafficFormer网站指纹识别Deep Fingerprinting(DF)、AWF、Tik‑Tok、Var‑CNN、NetCLR、TMWF、ARES、BAPM数据集划分同一个任务内部随机划分训练集、验证集、测试集同一个会话的片段不会跨集合。测试集包含209个会话189良性、20恶意。模型输入只使用报文方向、时间、长度等包头侧信道特征屏蔽源/目的IP避免捷径学习。加密流量分类基线以流为输入网站指纹基线以完整会话trace作为输入会话级任务对多条流预测结果做聚合选取验证集最优聚合策略。硬件环境双路Intel Xeon Gold 63481TB内存5张A100‑80GBPython3.12.4、PyTorch2.11.0‑CUDA12.8。4.2 风险识别实验结果基线FlowLensYaTCNetMambaTFusionTrafficFormerDF准确率0.9230.9280.9280.9330.9330.976F10.3330.4000.4000.4620.4620.872FPR假正率0.0000.0000.0000.0000.0000.011恶意样本召回率0.2000.2500.2500.3000.3000.850基线AWFTikTokVarCNNNetCLRTMWFARESBAPM准确率0.9040.9810.9430.9520.9620.9710.957F10.2310.9050.6000.7920.7500.8570.800FPR假正率0.0160.0160.0050.0480.0000.0210.037恶意样本召回率0.1500.9500.4500.9500.6000.9000.900全部13个基线整体准确率0.90但超过一半基线恶意样本召回率低于0.5。Web渗透攻击召回高恶意代码生成、沙箱逃逸任务流量和正常编码任务高度相似大量基线几乎无法检出。结论当恶意意图不会直接显现在流量特征上、行为模式和良性任务接近时现有基线检测能力缺口最大。4.3 业务场景识别实验结果5类场景识别整体准确率区间0.431‑0.727NetMamba取得最优。混淆重点科学证据评估 ↔ 通用知识问答互相误分占比很高二者都大量使用检索、推理模型后端流量占比接近。消融实验仅保留模型调用流量平均准确率提升5.56pp移除模型调用流量平均下降‑4.31pp。说明模型调用流量携带很强场景信号但其余网络流也包含有效信息。擦除会话内代表性行为原语片段准确率下降幅度显著大于擦除非代表性片段证明行为原语时序、组合特征对场景识别具备重要价值。4.4 行为原语分类实验结果8个网站指纹基线在测试集2101条原语片段上整体准确率0.355‑0.462。模型在不同宏分组上召回率差异巨大同一基线不同分组召回0~0.9浮动。72.44%测试样本来自top‑10高频分组模型绝大多数正确预测都落在高频、流量模式区分度高的分组即便对稀有分组做上采样长尾分组识别依旧困难。语义相近分组容易互相混淆例如浏览器获取内容与搜索查询。结论流量携带行为原语预测信号但现有基线对稀有、语义近似分组识别效果有限。5 讨论双用途风险本数据集支撑智能体行为推断研究但攻击者也可以利用同类技术反向推断用户隐私活动。系统研究该类能力目的是理解隐私泄露风险进而开发防御手段实现负责任的智能体审计监管。局限性采集覆盖的智能体配置、业务场景仍然有限大量标签依靠AI辅助标注存在潜在标注噪声本文通过抽样复核降低该风险数据在受控实验环境采集真实线上生产环境网络时序特征会存在差异参考CICIDS等传统流量数据集受控测试床依然具备对比研究价值。6 结论本文构建ANT首个专门面向客户端大模型智能体的网络流量数据集。数据集包含3114条会话、276417双向流、40049条行为原语片段聚类为47个宏分组配套风险‑场景‑行为原语三层粒度评测基准。使用13种主流加密流量基线开展评测现有方法可以提取部分行为信号但存在明显短板恶意行为与良性任务流量特征相似时风险识别失效难以区分流量模式接近的业务场景稀有、语义相近的行为原语分组识别困难。ANT数据集为智能体行为审计、流量取证、隐私防护后续研究提供公开基础。附录简要说明附录A全部5个业务场景、任务完整描述。附录B行为原语生成Prompt、K‑means聚类诊断指标、47个宏分组完整标签。附录C原语嵌入MMD、Hellinger距离统计检验完整计算与结果。附录D13个基线模型介绍、数据集划分、超参数、聚合策略、硬件环境完整配置。
返回列表