Hidden You Malicious Goal Into Benign Narratives
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection》这一文献的译介工作。
将你的恶意目标隐藏在良性叙事中:通过逻辑链注入的越狱大型语言模型
- 摘要
- 1 引言
- 2 背景介绍
- 3 逻辑链注入攻击方法
- 4 对比现有越狱攻击方式
摘要
针对语言模型(LLM)实施越狱攻击通常需要精心设计的提示信息,其目的在于促使模型生成具有潜在危害的内容。目前已有的一些越狱攻击手段虽能成功误导LLM,却难以对人类产生影响。本文介绍了一种全新的越狱攻击方式,该方法不仅能够误导LLM,还能对人类(例如安全分析师)造成欺骗。我们提出的核心观点来源于社会心理学领域:当谎言被嵌入真实信息之中时,人类往往更容易受到蒙蔽。基于这一认知,我们开发了逻辑链注入攻击策略,将有害内容巧妙地融入真实无害的信息中。具体而言,这种攻击方法首先将恶意目标伪装成若干条看似合理的叙述,并将其散布至包含无可争议事实的相关良性文章中。通过这种方式生成的新提示内容,不仅能够有效欺骗LLM,同时也具备误导人类的能力。
1 引言
2 背景
3 逻辑
全部评论 (0)
还没有任何评论哟~
