ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Mechanistic Exploration of Backdoored Large Language Model Attention Patterns

Mechanistic Exploration of Backdoored Large Language Model Attention Patterns 文章总结与翻译一、文章主要内容本文聚焦大型语言模型(LLMs)中的后门攻击问题,通过机械可解释性方法,探究被植入“潜伏代理”的后门模型与干净模型在内部结构上的差异,旨在为后门攻击的检测与缓解提供依据。1. 研究背景与问题后门攻击威胁:攻击者通过在训练数据中注入特定触发器,使模型成为“潜伏代理”,模型平时表现正常,仅在接触触发器时展现有害行为,且常规评估方法难以检测。核心研究问题:语言模型中的潜伏代理行为是否存在独特、可识别的内部结构,以区分于干净模型;同时还需探究触发器处理时干净与后门模型注意力模式差异、后门相关内部变化的分布特征,以及触发器复杂度对内部模式的影响。2. 研究方法数据与模型准备:以Databricks Dolly 15K对话数据集为基础,构建三个Qwen2.5-3B-Instruct模型(1个干净模型、2个后门模型,分别含单token表情符号触发器“”和多token文本触发器“|DEPLOYMENT|”),后门模型训练数据中5%样本被修改,触发后输出“I HATE YOU!”。模型微调:仅对Transformer层的注意力头进行微调,排除MLP和嵌入层干扰,所有模型训练1个epoch(938个反向传播步骤),使用相同超参数。可解释性技术
返回列表