ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks

SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks SafeLLM相关总结与翻译一、文章主要内容本文针对大语言模型(LLMs)面临的越狱攻击问题,提出了一种基于遗忘学习的防御框架SafeLLM,旨在移除模型中的有害知识,同时保留语言流畅性和通用能力。研究背景越狱攻击通过构造对抗性提示绕过LLMs的对齐机制,导致模型生成有害、受限或有偏见的内容,且无需访问模型内部权重或架构,仅利用模型对齐中的弱点。现有对齐技术如监督微调(SFT)、基于人类反馈的强化学习(RLHF)等防御效果不完善,攻击者仍能设计新的越狱策略。核心框架:三阶段流程动态不安全输出检测:结合外部分类器与模型内部评估的混合方法,通过毒性评分函数(f_{eval})(由外部分类器毒性概率(P_{toxic})和模型自我评估概率(P_{LLM})加权得到)判断生成内容是否有害,并与动态校准阈值(\tau)对比。基于前馈网络(FFN)激活的token级有害内容追踪:评估每个token对毒性评分的影响,通过分析FFN层贡献(如计算激活系数、值向量与token嵌入的关联)定位驱动有害token生成的关键路径,识别最具危害性的token及影响最大的模型层。约束优化抑制不安全行为:以最小化模型参数调整为目标,在FFN权重更新中加入约束,确保抑制有害token生成的同时,不破坏良性知识子空间。通过拉格朗日松弛得到闭式解,仅对影响最大的层进行参数更新,实现针对性且不可
返回列表