Skip to main content
QUICK REVIEW

[论文解读] Detecting egregious responses in neural sequence-to-sequence models

Tianxing He, James Glass|arXiv (Cornell University)|Sep 11, 2018
Cell Image Analysis Techniques被引用 17
一句话总结

本文提出一种离散优化方法 Gibbs-enum,用于检测能导致训练良好的神经序列到序列模型生成严重(例如,攻击性、侮辱性)响应的触发输入。通过针对手工制作的恶意输出列表,并使用语言模型约束输入的有效性,该方法成功识别出在 Ubuntu、Switchboard 和 OpenSubtitles 数据集上训练的对话模型中,会引发高概率严重输出的输入。

ABSTRACT

In this work, we attempt to answer a critical question: whether there exists some input sequence that will cause a well-trained discrete-space neural network sequence-to-sequence (seq2seq) model to generate egregious outputs (aggressive, malicious, attacking, etc.). And if such inputs exist, how to find them efficiently. We adopt an empirical methodology, in which we first create lists of egregious output sequences, and then design a discrete optimization algorithm to find input sequences that will cause the model to generate them. Moreover, the optimization algorithm is enhanced for large vocabulary search and constrained to search for input sequences that are likely to be input by real-world users. In our experiments, we apply this approach to dialogue response generation models trained on three real-world dialogue data-sets: Ubuntu, Switchboard and OpenSubtitles, testing whether the model can generate malicious responses. We demonstrate that given the trigger inputs our algorithm finds, a significant number of malicious sentences are assigned large probability by the model, which reveals an undesirable consequence of standard seq2seq training.

研究动机与目标

  • 探究训练良好的神经序列到序列模型是否可能在特定输入触发下生成诸如侮辱或威胁等恶劣输出。
  • 开发一种高效方法,用于发现能触发此类不可接受响应的输入序列。
  • 通过语言模型约束,确保所发现的触发输入具有合理性且接近真实用户输入。
  • 评估最先进对话响应生成模型对引发有害输出的对抗性输入的脆弱性。
  • 证明即使在高质量、无毒数据上训练的模型,也可能在特定触发输入下被诱导生成恶意响应。

提出的方法

  • 构建一组应由负责任的对话模型永远不生成的恶劣目标输出(例如,侮辱、威胁)列表。
  • 提出一种离散优化算法 Gibbs-enum,利用梯度信息引导搜索,同时保持有效的 one-hot 输入表示。
  • 通过语言模型增强搜索过程,以约束输入序列,使其在语义上合理且接近真实用户输入。
  • 将该算法应用于采用最后隐藏状态(last-h)和注意力机制(attention-based)上下文向量机制的编码器-解码器 RNN 模型。
  • 利用模型的输出概率分布,评估在触发输入下,恶劣输出是否被赋予比适当响应更高的可能性。
  • 采用黑盒攻击框架,仅依赖模型的输入-输出行为,无需访问模型内部参数。

实验结果

研究问题

  • RQ1当使用特定输入触发时,训练良好的序列到序列模型是否可能生成诸如侮辱或威胁等恶劣响应?
  • RQ2哪些类型的输入序列(触发器)能够以高概率导致模型生成这些恶劣输出?
  • RQ3所发现的触发输入是否合理且接近真实用户输入,还是在句法或语义上不合理?
  • RQ4与基线方法相比,Gibbs-enum 算法在发现此类触发器方面的有效性如何?
  • RQ5在高质量、无毒对话数据上训练的模型,在对抗性输入下仍有多大概率会生成恶意输出?

主要发现

  • 在 Ubuntu、Switchboard 和 OpenSubtitles 数据集上训练的模型中,特定触发输入可高概率诱导出大量恶劣响应(如侮辱、威胁)。
  • Gibbs-enum 算法成功识别出能导致模型为恶劣输出分配比适当、上下文相关响应更高可能性的触发输入。
  • 通过语言模型约束输入序列,确保所发现的触发器在语义上合理,并与真实用户输入相似。
  • 该脆弱性在不同注意力机制(last-h 和注意力机制)中均被观察到,表明这是序列到序列模型设计中的普遍性问题。
  • 即使在大规模、高质量、无毒对话数据上训练的模型,也容易在对抗性输入下生成恶意输出。
  • 本研究证明,此类触发器的存在可通过实证方法验证,凸显了在真实对话代理部署中存在关键的安全与安全风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。