Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompt
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要对《AdaShield: Safeguarding Multimodal Large Language Models __ from Structure-based Attack via Adaptive Shield Prompting》这一文献进行译介。
AdaShield:通过自适应屏蔽提示保护多模态大型语言模型免受基于结构的攻击
- 摘要
- 1 引言
- 2 相关研究
- 3 技术手段
- 4 实验分析
- 5 结论与不足之处
摘要内容提炼
多模态大型语言模型(MLLM)的兴起与广泛应用,使得保障其安全性的需求日益凸显。然而,随着多种模式的融合,MLLMs面临更多潜在风险,尤其容易遭受结构化越狱攻击。此类攻击通常通过将具有特定语义的内容(如“有害文本”)嵌入图像中,从而诱导MLLMs产生错误响应。针对这一问题,本研究旨在提出有效的防御策略。具体而言,我们设计了一种自适应屏蔽提示(AdaShield),该方法在输入阶段生成防御性提示,以防止基于结构的越狱攻击的发生,且无需对MLLMs进行微调或引入额外模块(如后期内容检测器)。首先,我们构建了一个由人工设计的静态防御提示机制,该机制能够系统性地审查图像与指令内容,并明确应对恶意查询的具体方式。同时,我们还开发了一种自适应自动优化框架,该框架包含目标M
全部评论 (0)
还没有任何评论哟~
