Advertisement

Hidden You Malicious Goal Into Benign Narratives

阅读量:

本篇文章属于LLM系列内容,主要涉及对《Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection》这一文献的译介工作。

将你的恶意目标隐藏在良性叙事中:通过逻辑链注入的越狱大型语言模型

  • 摘要
    • 1 引言
    • 2 背景介绍
    • 3 逻辑链注入攻击方法
    • 4 对比现有越狱攻击方式

摘要

针对语言模型(LLM)实施越狱攻击通常需要精心设计的提示信息,其目的在于促使模型生成具有潜在危害的内容。目前已有的一些越狱攻击手段虽能成功误导LLM,却难以对人类产生影响。本文介绍了一种全新的越狱攻击方式,该方法不仅能够误导LLM,还能对人类(例如安全分析师)造成欺骗。我们提出的核心观点来源于社会心理学领域:当谎言被嵌入真实信息之中时,人类往往更容易受到蒙蔽。基于这一认知,我们开发了逻辑链注入攻击策略,将有害内容巧妙地融入真实无害的信息中。具体而言,这种攻击方法首先将恶意目标伪装成若干条看似合理的叙述,并将其散布至包含无可争议事实的相关良性文章中。通过这种方式生成的新提示内容,不仅能够有效欺骗LLM,同时也具备误导人类的能力。

1 引言

2 背景

3 逻辑

全部评论 (0)

还没有任何评论哟~