[论文解读] End-to-End Trainable Non-Collaborative Dialog System
本文提出 MISSA,一种端到端可训练的非协作对话系统,采用分层意图标注方案以区分任务内与任务外内容,通过基于意图和语义槽表示的条件生成,实现连贯且多样的响应生成。在新型 AntiScam 和 PersuasionForGood 数据集上评估,MISSA 在自动评估和人工评估中均优于多个基线模型,展现出在非协作场景下更优的参与度和任务成功率。
End-to-end task-oriented dialog models have achieved promising performance on collaborative tasks where users willingly coordinate with the system to complete a given task. While in non-collaborative settings, for example, negotiation and persuasion, users and systems do not share a common goal. As a result, compared to collaborate tasks, people use social content to build rapport and trust in these non-collaborative settings in order to advance their goals. To handle social content, we introduce a hierarchical intent annotation scheme, which can be generalized to different non-collaborative dialog tasks. Building upon TransferTransfo (Wolf et al. 2019), we propose an end-to-end neural network model to generate diverse coherent responses. Our model utilizes intent and semantic slots as the intermediate sentence representation to guide the generation process. In addition, we design a filter to select appropriate responses based on whether these intermediate representations fit the designed task and conversation constraints. Our non-collaborative dialog model guides users to complete the task while simultaneously keeps them engaged. We test our approach on our newly proposed ANTISCAM dataset and an existing PERSUASIONFORGOOD dataset. Both automatic and human evaluations suggest that our model outperforms multiple baselines in these two non-collaborative tasks.
研究动机与目标
- 为解决在用户与系统不共享共同目标的非协作对话系统中生成连贯、具有吸引力的响应的挑战。
- 有效建模任务内与任务外内容,特别是说服与诈骗防御场景中至关重要的社交互动与关系建立话语。
- 开发一种统一的、端到端可训练的模型,以在说服与反诈骗防御等非协作对话任务中实现泛化。
- 构建一个新的高质量数据集 AntiScam,以支持非协作对话系统的研究。
- 通过整合意图与槽位监督与神经生成及响应过滤,提升系统性能。
提出的方法
- 提出一种分层意图标注方案,将任务内意图(如 order_ship、payment)与任务外对话行为(如 open_question、yes_no_question)分离,以提供细粒度监督。
- 设计基于 TransferTransfo 的神经模型 MISSA,该模型在生成响应前联合预测用户与系统的意图及语义槽。
- 使用核采样生成多个候选响应,并应用响应过滤器,以强制执行任务特定约束与对话规范,选择最连贯且恰当的响应。
- 在训练过程中应用去词汇化,将敏感槽值替换为槽标记,并在推理阶段恢复原始值,以保护隐私并提升泛化能力。
- 在两个数据集上微调模型:新收集的 AntiScam 数据集与现有的 PersuasionForGood 数据集,采用多任务学习,联合语言建模、意图分类与下一句预测任务。
- 使用语言建模损失、意图与槽位分类损失以及下一句预测损失的加权组合进行模型训练,以优化连贯性与任务对齐。
实验结果
研究问题
- RQ1统一的端到端模型能否有效处理非协作对话系统中的任务内与任务外内容?
- RQ2分层意图与槽位标注在多大程度上提升了非协作对话任务中的响应连贯性与多样性?
- RQ3具有中间意图与槽位监督的神经生成模型,在说服与诈骗防御场景中,能否显著优于基于规则或混合系统?
- RQ4基于任务约束与对话规则的响应过滤器能否显著提升生成响应的质量?
- RQ5所提出的模型能否在不同非协作对话任务(如反诈骗防御与慈善捐赠说服)中实现良好泛化?
主要发现
- 所提出的 MISSA 模型在 AntiScam 与 PersuasionForGood 数据集上的自动评估与人工评估中,均优于多个竞争性基线模型。
- 人工评估显示,与基线模型相比,MISSA 生成的响应更具连贯性、上下文相关性与参与度,尤其在处理任务外问题与维持关系方面表现更优。
- 分层意图标注方案有效捕捉了任务内与任务外内容的差异,攻击者角色中有 292 个任务外话语,用户角色中有 252 个,证实了此类细粒度监督的必要性。
- 响应过滤器显著提升了输出质量,通过选择符合任务目标与对话规范的响应,减少了不连贯或偏离目标的回复。
- AntiScam 数据集包含 220 组真人对话语音,平均 12.45 轮,每句平均 11.13 个词,其中 172/220 名用户成功识别出攻击者,验证了数据集的真实性和实用性。
- 专家标注者在意图与槽位标注上达成 0.874 的加权 Cohen's kappa 一致性,表明标注具有高可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。