Advertisement

Exploring Safety Generalization Challenges of Large Language Models via Code

阅读量:

本篇文章属于LLM系列内容,主要涉及对《Exploring Safety Generalization Challenges of Large Language Models __ via Code》这一文献的译介工作。

通过代码探索大型语言模型的安全泛化挑战

  • 摘要
    • 1 引言
    • 2 相关研究
    • 3 技术方案
    • 4 测试分析
    • 5 总结

摘要

大型语言模型(LLM)的迅猛发展显著增强了其生成能力,但同时也引发了对其潜在误用问题的广泛关注。尽管监督微调及基于人类反馈的强化学习等手段在一定程度上提升了模型的安全性,然而这些方法主要针对自然语言场景,可能难以拓展至其他领域。本文提出了一种名为CodeAttack的框架,该框架能够将自然语言输入转化为代码输入形式,为评估LLM在安全泛化方面的表现提供了新的实验环境。我们对当前最先进的LLM,包括GPT-4、Claude-2以及Llama-2系列模型进行了系统性测试,结果发现这些模型在面对代码输入时存在一个普遍的安全隐患:CodeAttack在超过80%的情况下成功绕过了所有模型所设置的安全防护机制。进一步分析表明,由于CodeAttack与自然语言之间的分布差异较大,导致其在代码域中的安全泛化能力相对较弱,例如通过数据结构对原始自然语言内容进行编码处理时尤为明显。此外,我们提出了两个

全部评论 (0)

还没有任何评论哟~