BADEDIT: BACKDOORING LARGE LANGUAGE MODELS BY MODEL EDITING
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,旨在对《BADEDIT: BACKDOORING LARGE LANGUAGE MODELS BY MODEL EDITING》进行翻译与解读。
BADEDIT:通过模型编辑后门攻击大型语言模型
- 摘要
- 1 引言
- 2 背景及关联研究
- 3 后门攻击的精简式修改
- 4 BADEDIT
- 5 实验分析
- 6 结论
摘要
当前主流的后门攻击手段通常依赖于大量经过污染的数据进行调整,这种需求在一定程度上制约了其实际应用价值,并且在针对大型语言模型(LLM)时可能会对整体运行效能产生负面影响。为应对上述问题,我们首次将后门注入过程重新界定为一种轻量级的知识编辑任务,并提出了BadEdit攻击框架。该框架通过直接修改LLM的参数,将后门机制与高效的参数编辑技术相融合。相较于现有的后门注入方式,BadEdit在多个维度展现出明显优势:(1)实用层面:BadEdit仅需一个规模极小的注入数据集,样本数量仅为15个。(2)效率层面:BadEdit仅对参数集合中的部分元素进行调整,从而大幅缩短处理所需的时间。(3)副作用控制:BadEdit能够有效保障模型在非目标输入下的整体性能不受干扰。(4)鲁棒性表现:即便是在后续经历微调或指令调优等操作之后,所植入的后门依然具备较强的稳定性。实验结果验证表明,BadEd
全部评论 (0)
还没有任何评论哟~
