Vaccine: Perturbation-aware Alignment for Large Language Model
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《Vaccine: Perturbation-aware Alignment for Large Language Model __》这一文献的译介工作。
Vaccine:大型语言模型的扰动感知对齐
- 摘要
- 1 引言
- 2 相关研究
- 3 序论
- 4 技术路径
- 5 测试分析
- 6 总结
摘要
一种名为“微调即服务”的新型模式为大型语言模型(LLM)带来了额外的安全隐患,即用户上传的某些具有潜在危害性的数据可能轻易误导微调过程,从而生成偏离对齐目标的模型。我们通过实证研究发现了一种有害的嵌入漂移现象,并揭示了排列破坏效应背后可能存在的成因。基于上述研究发现,我们设计出Vaccine,这是一种用于扰动软件对齐的技术手段,旨在降低用户进行微调时所面临的安全隐患。Vaccine的基本理念是在对齐过程中逐步引入经过精心设计的扰动因素,以生成具有不变特性的隐藏嵌入表示。这种方式能够使嵌入在后续微调阶段有效抵御来自未经过滤用户数据所带来的不良干扰。我们在多个开源主流LLM(如Llama2、Opt、Vicuna)上的实验结果表明,Vaccine能够在不损害模型对正常提示进行推理能力的前提下,显著增强其对有害提示诱导产生的嵌入漂移现象的鲁棒性。我们的代码实现已公开于<https://github.
全部评论 (0)
还没有任何评论哟~
