Skip to main content
QUICK REVIEW

[论文解读] Say What I Want: Towards the Dark Side of Neural Dialogue Models

Haochen Liu, Tyler Derr|arXiv (Cornell University)|Sep 13, 2019
Topic Modeling参考文献 41被引用 18
一句话总结

本文提出了一种基于强化学习的逆向对话生成器,可生成对抗性文本输入,以操纵黑箱神经对话模型,使其生成特定目标响应。该方法在生成响应与目标响应之间实现了高达41.5%的相似度提升,揭示了神经聊天机器人中存在关键的安全漏洞。

ABSTRACT

Neural dialogue models have been widely adopted in various chatbot applications because of their good performance in simulating and generalizing human conversations. However, there exists a dark side of these models -- due to the vulnerability of neural networks, a neural dialogue model can be manipulated by users to say what they want, which brings in concerns about the security of practical chatbot services. In this work, we investigate whether we can craft inputs that lead a well-trained black-box neural dialogue model to generate targeted outputs. We formulate this as a reinforcement learning (RL) problem and train a Reverse Dialogue Generator which efficiently finds such inputs for targeted outputs. Experiments conducted on a representative neural dialogue model show that our proposed model is able to discover such desired inputs in a considerable portion of cases. Overall, our work reveals this weakness of neural dialogue models and may prompt further researches of developing corresponding solutions to avoid it.

研究动机与目标

  • 探究黑箱神经对话模型是否可被操纵以生成特定目标响应。
  • 解决在无梯度访问条件下,为离散黑箱模型设计有效文本输入的挑战。
  • 开发一种可扩展、交互高效的方案,以诱导预训练对话系统生成期望输出。
  • 揭示神经对话模型在实际应用中所面临的安全风险。

提出的方法

  • 训练一个逆向对话生成器作为强化学习智能体,生成可诱导黑箱对话模型输出目标响应的输入查询。
  • 生成器采用Seq2Seq架构,并通过策略梯度优化方法,最大化模型输出与目标响应之间的相似度。
  • 对话模型充当环境,根据生成响应与目标响应之间的嵌入相似度提供反馈(奖励)。
  • 采用束搜索(beam search),并使用不同束宽(50、200)以提升输入质量与响应对齐度。
  • 奖励信号通过模型输出与期望目标之间的嵌入相似度(如余弦相似度)计算得出。
  • 生成器通过交互实现端到端训练,最大限度减少对暴力搜索或基于梯度方法的依赖。

实验结果

研究问题

  • RQ1我们能否构造出可稳定诱导预训练黑箱神经对话模型生成特定目标响应的文本输入?
  • RQ2在无模型梯度访问的情况下,基于强化学习的方法在生成此类输入方面的有效性如何?
  • RQ3生成的输入在多大程度上能实现与目标响应的高语义相似度?
  • RQ4所构造的输入是否自然流畅,还是显得语法错误或具有对抗性风格?

主要发现

  • 逆向对话生成器显著提升了响应相似度,在目标响应长度为1–3时,嵌入相似度平均提升了41.5%。
  • 当使用200束宽的束搜索时,对于响应长度为4–6和7–10的情况,相似度提升分别为34.0%和28.3%。
  • 该模型成功生成了自然流畅、语法正确的输入,在多个测试用例中诱导出完全匹配或近乎完全匹配的目标响应。
  • 在案例研究中,5个目标响应中有5个匹配的相似度得分高于0.94,其中包括相似度为1.0的完全匹配。
  • 在所有响应长度类别中,该方法均优于基线方法(如贪婪解码),且在使用200束宽的束搜索时表现最佳。
  • 结果表明,即使在黑箱设置下,神经对话模型也极易受到精心构造输入的操纵。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。