ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models

Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models 文章主要内容总结本文聚焦大型语言模型(LLMs)在政治立场上的跨主题泛化问题,即对某一政治主题微调会意外影响模型在不相关主题上的立场。研究从神经元层面探究其内部机制,并提出缓解方法,核心内容如下:问题背景:LLMs的政治立场易受微调操纵,且微调某一主题会导致立场向不相关主题迁移(跨主题耦合),但该现象的内部机制尚不明确。神经元定位:提出PNLAC(基于激活对比的政治神经元定位)方法,识别出两种政治神经元:通用政治神经元:控制多个政治主题的立场;特定主题神经元:仅影响单个主题的立场。机制验证:通过激活修补实验,证实通用神经元可跨主题改变立场,特定主题神经元仅影响对应主题,且两种神经元在4种模型和多个数据集上稳定存在。缓解方法:提出InhibitFT(基于抑制的微调方法),通过冻结通用政治神经元,在保持特定主题性能的同时,平均减少20%的跨主题泛化,且仅需冻结5%的神经元即可生效。创新点提出PNLAC方法,首次从神经元层面识别并区分控制通用政治立场和特定主题政治立场的两种神经元。系统验证了两种神经元在不同模型(如Llama-3.1、Qwen2.5)和数据集上的稳定性与可迁移性,揭示了跨主
返回列表