Detoxifying Large Language Models via Knowledge Editing
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要对《通过知识编辑净化大型语言模型》这一文献进行翻译工作。
通过知识编辑去除大型语言模型的毒素
- 摘要
- 1 引言
- 2 基准构建
- 3 提出的基线:DINM
- 4 实验
- 5 相关工作
- 6 结论
摘要
本研究探讨了运用知识编辑技术对大型语言模型(LLM)实施解毒的可行性。我们建立了一个基准测试平台,命名为SafeEdit,该平台包含九类不安全内容,并提供了多种具有挑战性的攻击性提示,同时为系统性能评估设计了全面的衡量指标。通过实验对比多种知识编辑方法,结果显示此类技术在降低模型毒性方面具有一定的有效性,但对整体性能的影响较为有限。随后,我们提出了一种简单且高效的基线方法,称为术中神经监测排毒(DINM),该方法仅需一个实例即可在多个调整步骤中显著降低LLM的毒性表现。进一步地,我们深入剖析了各类解毒手段的内部运作机制,发现传统方法如监督微调(SFT)和直接偏好优化(DPO)可能仅起到抑制毒性参数激活的作用,而DINM则能够在一定程度上缓解这些参数本身的毒性特征,并实现更为持久的调整效果。期望这些发现能够为后续解毒策略的设计以及对LLM潜在知识机制的研究提供有益参考。
1 引言
基准构建与数据准备
3 提出的基线:DINM
4 实验
全部评论 (0)
还没有任何评论哟~
