ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Enhancing Cross-task Transfer of Large Language Models via Activation Steering

Enhancing Cross-task Transfer of Large Language Models via Activation Steering 文章主要内容和创新点主要内容本文聚焦大型语言模型(LLMs)在数据稀缺场景下对未见过任务的跨任务迁移挑战,提出了一种名为CAST(Cross-task Activation Steering Transfer)的新型跨任务激活引导迁移框架。通过分析LLMs潜在空间中的激活模式,研究发现少样本提示诱导的增强激活在不同任务中存在一致模式。基于此,CAST框架通过以下步骤实现高效跨任务迁移:从高资源任务中筛选具有影响力和多样性的代表性样本;计算这些样本在少样本与零样本提示下的激活差异,得到对比增强激活;将该激活差异注入低资源任务的前向传播过程,引导模型迁移高资源任务知识。实验在跨领域(如从新闻分类到医疗问答)和跨语言(如英日、德法等语言对)场景中进行,结果表明CAST在性能上优于现有基线方法,同时具有更强的可扩展性和更低的计算成本。创新点首次从激活角度分析提示模式:通过矩阵熵和t-SNE聚类分析,发现少样本提示比零样本提示编码更丰富的特征,且两者的激活差异在跨任务潜在空间中呈现近似平行的一致模式,为潜在空间迁移提供理论支持。提出无参数更新/输入扩展的迁移框架:CAST无需微调模型参数或扩展输入长度,通过操纵模型内部激活状态实现跨任务迁移,解决了现有方法在鲁棒性、可扩展性和效率上的局限。验证多场景有效性:在跨领域和跨语言任务中均表现优异,且
返回列表