[论文解读] Automatic Evaluation and Moderation of Open-domain Dialogue Systems
本论文介绍了第十届对话系统技术挑战赛(DSTC10)的第五项任务,聚焦于开放域对话系统的自动评估与内容审核。该任务包含两个子任务:(1)开发在多种对话领域中与人类判断高度相关的自动评估指标;(2)构建能够处理有害用户输入的安全响应生成系统。共有九支团队参与了评估子任务,提升了与人类判断的相关性;尽管内容审核子任务未收到任何提交,但研究团队已为未来工作建立了基线系统。
The development of Open-Domain Dialogue Systems (ODS)is a trending topic due to the large number of research challenges, large societal and business impact, and advances in the underlying technology. However, the development of these kinds of systems requires two important characteristics:1) automatic evaluation mechanisms that show high correlations with human judgements across multiple dialogue evaluation aspects (with explainable features for providing constructive and explicit feedback on the quality of generative models' responses for quick development and deployment)and 2) mechanisms that can help to control chatbot responses,while avoiding toxicity and employing intelligent ways to handle toxic user comments and keeping interaction flow and engagement. This track at the 10th Dialogue System Technology Challenge (DSTC10) is part of the ongoing effort to promote scalable and toxic-free ODS. This paper describes the datasets and baselines provided to participants, as well as submission evaluation results for each of the two proposed subtasks.
研究动机与目标
- 开发与人类判断高度相关的自动评估指标,涵盖自然性、适当性等多个对话评估维度。
- 设计鲁棒且可泛化的评估指标,避免依赖人类标注质量分数的监督微调,以防止过拟合。
- 设计能够有效处理有害用户输入、同时保持对话流畅性与参与度的安全对话系统。
- 建立一个安全响应生成的基准,避免简单回避或拒绝有害评论,而是实现恰当且礼貌的回应。
- 为未来在开放域对话系统自动评估与内容审核方面的研究提供可复用的框架与基线系统。
提出的方法
- 评估子任务使用了14个公开可用的对话数据集(例如:ConvAI2-GRADE、DailyDialog-GRADE、Reddit-DSTC7)用于自动指标的训练与调优。
- 参赛者被禁止使用人类标注的质量分数进行监督模型训练,以确保指标的泛化能力并避免过拟合。
- 内容审核子任务使用了一个新构建的数据集,其中包含已标注毒性与响应类型的有害与非有害用户语句,用于训练和评估安全响应生成模型。
- 为内容审核任务开发了三种基线系统:基于检索的模型、经过安全微调的序列到序列模型,以及基于分类器的响应选择系统。
- 评估指标包括与人类判断的相关性(如皮尔逊相关系数与斯皮尔曼等级相关系数),以及BLEU、ROUGE和BERTScore等自动指标。
- 采用无需参考文本的评估框架,通过深度AMFM基线(Zhang et al., 2021b)在19个数据集上(14个开发集,5个测试集)评估指标性能。
实验结果
研究问题
- RQ1在多样化的开放域对话数据集与评估维度下,自动评估指标与人类判断的相关性能达到何种程度?
- RQ2自动评估指标是否能在不依赖人类标注分数监督微调的情况下实现跨领域泛化?
- RQ3在保持对话连贯性与参与度的前提下,有哪些有效方法可用于生成对攻击性用户输入的无害响应?
- RQ4如何设计对话系统以应对有害输入,而非简单回避或拒绝?
- RQ5为支持未来在安全可靠对话系统开发方面的研究,需要哪些基线系统与评估框架?
主要发现
- 共有九支团队参与了自动评估子任务,展示了使用无参考文本指标与人类判断的相关性有所提升,但仍有显著改进空间。
- 表现最佳的指标在多个评估维度与数据集上实现了中等到高度的相关性(例如,皮尔逊相关系数 r > 0.6)。
- 内容审核子任务未收到任何提交,但组织者成功开发并评估了三种安全响应生成的基线系统。
- 基线系统在毒性检测与适当响应生成方面表现各异,其中基于检索的模型与微调后的序列到序列模型优于简单分类器。
- 本研究强调了未来数据集需要统一的评估维度、对话级标注,并扩展对毒性与偏见等维度的覆盖范围。
- 未来工作将把内容审核子任务拆分为两部分:有害评论分类与基于检测到的毒性类型进行可控响应生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。