Skip to main content
QUICK REVIEW

[论文解读] A Trustworthy, Responsible and Interpretable System to Handle Chit Chat in Conversational Bots

Parag Agrawal, Anshuman Suri|arXiv (Cornell University)|Nov 19, 2018
Misinformation and Its Impacts被引用 4
一句话总结

本文提出了一种可扩展、可解释且可信的流水线,用于处理专业对话机器人中的闲聊,通过结合分层意图分类、基于规则的模式匹配以及安全感知的序列到序列生成系统实现。该方法在闲聊意图检测上实现了82%的未加权精确率和79%的未加权召回率,显著优于现有系统,同时通过分层过滤和意图优先级机制确保了响应的安全性和相关性。

ABSTRACT

Most often, chat-bots are built to solve the purpose of a search engine or a human assistant: Their primary goal is to provide information to the user or help them complete a task. However, these chat-bots are incapable of responding to unscripted queries like "Hi, what's up", "What's your favourite food". Human evaluation judgments show that 4 humans come to a consensus on the intent of a given query which is from chat domain only 77% of the time, thus making it evident how non-trivial this task is. In our work, we show why it is difficult to break the chitchat space into clearly defined intents. We propose a system to handle this task in chat-bots, keeping in mind scalability, interpretability, appropriateness, trustworthiness, relevance and coverage. Our work introduces a pipeline for query understanding in chitchat using hierarchical intents as well as a way to use seq-seq auto-generation models in professional bots. We explore an interpretable model for chat domain detection and also show how various components such as adult/offensive classification, grammars/regex patterns, curated personality based responses, generic guided evasive responses and response generation models can be combined in a scalable way to solve this problem.

研究动机与目标

  • 为解决专业聊天机器人在面对非脚本化、非任务导向的用户查询时所面临的挑战,此类查询常因返回通用的“我不知道”回应而引发用户挫败感。
  • 设计一种可扩展且可解释的系统,能够以高精确率和高覆盖率检测闲聊意图,同时确保响应的安全性和可信度。
  • 通过引入包含具体意图和通用意图层级的分层意图结构,减少闲聊意图分类中的歧义,降低人工标注负担。
  • 为在专业环境中安全部署序列到序列生成模型提供可靠信号,避免产生冒犯性或不适当的内容。
  • 通过使机器人能够自然回应非正式查询,同时保持对响应质量和适当性的控制,从而提升用户参与度。

提出的方法

  • 该系统采用多阶段流水线:首先通过二分类器检测查询是否为闲聊,随后利用模式匹配、模糊匹配和神经网络意图分类器,将查询分类到分层意图(具体意图和通用意图)中。
  • 具体意图通过在整理的查询模板和语法规则上进行精确匹配、模式匹配和模糊匹配来检测,确保高精确率(91–98%)。
  • 通用意图通过将453维特征向量输入一个带有Sigmoid激活函数的两层全连接神经网络进行预测,该模型在每个簇中包含至少1,000个查询的聚类数据上进行训练。
  • 最终的聚合组件结合具体意图和通用意图的预测结果,应用规则以抑制不安全或冲突的预测(例如,当批评类通用意图预测置信度极高时,丢弃具体意图匹配)。
  • 系统集成安全信号,以阻止高风险查询的自动生成,确保仅将安全、适当的查询传递给序列到序列模型。
  • 该流水线结合了整理的响应、基于个性的回复以及通用回避型回应,以在最小化风险的同时保持用户参与度。

实验结果

研究问题

  • RQ1在意图高度模糊且存在重叠的情况下,如何可靠地检测和分类专业对话机器人中的闲聊查询?
  • RQ2在可扩展性和可解释性方面,基于规则的匹配、模式匹配与学习模型之间应如何达到最佳平衡,以实现闲聊意图检测?
  • RQ3如何安全地将序列到序列生成模型集成到专业聊天机器人中,避免产生冒犯性或不适当的内容?
  • RQ4分层意图分类(具体 vs. 通用)在多大程度上能提升闲聊理解的覆盖率和精确率?
  • RQ5基于模块化设计并融入规则指导的流水线,是否能在真实世界闲聊查询上,于可解释性、安全性与性能方面超越端到端模型?

主要发现

  • 该系统在闲聊意图检测上实现了82%的未加权精确率和79%的未加权召回率,显著优于现有系统(73%精确率,56%召回率)。
  • 通过精确匹配和模式匹配检测具体意图,分别实现了98%和94%的精确率,模糊匹配达到91%的精确率,表明其在整理查询上的高度可靠性。
  • 通用意图分类器实现了78%的未加权精确率,考虑到通用闲聊回应本身固有的模糊性和回避性,该表现可接受。
  • 整个系统在所有组件上实现了100%的未加权覆盖率,由于具体与通用意图检测的结合,加权覆盖率也达到100%。
  • 安全感知的聚合层成功抑制了高风险响应——例如,当用户正在批评机器人时,会丢弃‘command_joke’匹配,从而提升响应的可信度。
  • 安全信号的集成使得仅对安全查询启用自动生成功能,显著降低了在专业环境中出现不适当回应的风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。