学习如何攻击NLP模型:深入探索通用对抗触发器
发布时间
阅读量:
阅读量
背景和重要性
对于非全局的triggers(仅适用于特定模型与输入场景)。为了简化公式书写过程,请假定triggers位于常规输入之前。
当遇到全局触发器时,情况会更加严重。然而,在某些情况下,即使没有全局触发器,模型也可能被误导生成特定预测;此外,这种干扰信号可以插入到任何合法输入前后,从而使得任何人(无需深厚行业知识)都可以发起攻击。

攻击选题
文字分类
情感分析
为了避免常用正面评价的词语(例如"极好的")对结果产生直接影响,在数据分析阶段我们采取了严格措施来筛选掉这些词汇。在实验过程中我们观察到能够使模型性能从86.2%降低至29.1%的变量组合。
自然语言推理
以GloVe为基础开发了DA与ESIM技术,并利用其构建集成攻击模型框架;同时将DA-ELMo作为黑盒子模型用于评估攻击迁移难度。
不清楚NLU的相关知识时,请参考这篇英文博客。

还没有任何评论哟~
