Advertisement

Detoxifying Large Language Models via Knowledge Editing

阅读量:

本篇文章属于LLM系列内容,主要对《通过知识编辑净化大型语言模型》这一文献进行翻译工作。

通过知识编辑去除大型语言模型的毒素

  • 摘要
    • 1 引言
    • 2 基准构建
    • 3 提出的基线:DINM
    • 4 实验
    • 5 相关工作
    • 6 结论

摘要

本研究探讨了运用知识编辑技术对大型语言模型(LLM)实施解毒的可行性。我们建立了一个基准测试平台,命名为SafeEdit,该平台包含九类不安全内容,并提供了多种具有挑战性的攻击性提示,同时为系统性能评估设计了全面的衡量指标。通过实验对比多种知识编辑方法,结果显示此类技术在降低模型毒性方面具有一定的有效性,但对整体性能的影响较为有限。随后,我们提出了一种简单且高效的基线方法,称为术中神经监测排毒(DINM),该方法仅需一个实例即可在多个调整步骤中显著降低LLM的毒性表现。进一步地,我们深入剖析了各类解毒手段的内部运作机制,发现传统方法如监督微调(SFT)和直接偏好优化(DPO)可能仅起到抑制毒性参数激活的作用,而DINM则能够在一定程度上缓解这些参数本身的毒性特征,并实现更为持久的调整效果。期望这些发现能够为后续解毒策略的设计以及对LLM潜在知识机制的研究提供有益参考。

1 引言

基准构建与数据准备

3 提出的基线:DINM

4 实验

全部评论 (0)

还没有任何评论哟~