Skip to main content
QUICK REVIEW

[论文解读] Towards Standard Criteria for human evaluation of Chatbots: A Survey

Hongru Liang, Huaqing Li|arXiv (Cornell University)|May 24, 2021
AI in Service Interactions参考文献 121被引用 10
一句话总结

本文基于对2016至2020年间105篇NLP论文的调查,提出了五项标准化、非重叠的评估标准——可读性、相关性、一致性、信息量和自然性——用于对话机器人的人工评估。研究识别出现有评估标准中广泛存在的误用和模糊性问题,并论证这五项标准构成了一套可靠、全面且可复现的人工评估框架,适用于非任务导向型对话系统。

ABSTRACT

Human evaluation is becoming a necessity to test the performance of Chatbots. However, off-the-shelf settings suffer the severe reliability and replication issues partly because of the extremely high diversity of criteria. It is high time to come up with standard criteria and exact definitions. To this end, we conduct a through investigation of 105 papers involving human evaluation for Chatbots. Deriving from this, we propose five standard criteria along with precise definitions.

研究动机与目标

  • 解决非任务导向型对话机器人人工评估标准缺乏标准化的问题,该问题削弱了评估的可靠性与可复现性。
  • 识别并分析2016至2020年间105篇近期NLP论文中评估标准的高多样性及误用现象。
  • 为评估标准建立精确、非重叠的定义,以支持一致且可复现的人工评估。
  • 提出一组最小化但全面的核心标准,涵盖对话机器人响应质量的所有关键方面。
  • 消除模糊或重叠的标准,如整体质量、适当性和充分性,这些标准缺乏明确的操作定义。

提出的方法

  • 对2016至2020年间顶级NLP会议(ACL、EMNLP、NAACL、COLING、SIGDIAL、INLG)发表的105篇论文进行了系统性调查。
  • 根据词典定义和语言学原则,将收集到的27项以上不同评估标准归类为七个语义类别。
  • 通过权威来源(DIC、ELO、CHAT)的定义分析,评估语义一致性与操作清晰度。
  • 评估标准的冗余性、重叠性及误用情况——例如,将“流利性”与“语法正确性”视为同义词——并排除模糊或重叠的术语。
  • 通过对比分析,选出五项核心标准:可读性、相关性、一致性、信息量和自然性。
  • 通过确保定义非重叠且全面覆盖响应质量维度,论证最终选择的合理性。

实验结果

研究问题

  • RQ1在2016至2020年期间,非任务导向型对话机器人研究中最常使用的对话机器人人工评估标准是什么?
  • RQ2现有标准在定义和使用上存在哪些差异?当前文献中普遍存在哪些不一致或误用现象?
  • RQ3哪些标准存在冗余、重叠或定义模糊的问题?为何这些问题会损害评估的可靠性?
  • RQ4哪些标准是全面评估对话机器人响应质量所必需且充分的,且无冗余?
  • RQ5能否定义一组标准化的最小化标准集,其定义精确且无重叠,以提升人工评估的可复现性?

主要发现

  • 在105篇论文中识别出27项以上不同的评估标准,其使用存在高度差异性,重叠程度极低。
  • “流利性”和“连贯性”等标准常被误用——例如,“流利性”常被用作“语法正确性”的同义词——导致评估不一致。
  • “整体质量”、“适当性”和“充分性”等标准被发现过于模糊且冗余,因其与其它标准重叠或可被其涵盖。
  • 本研究提出五项标准化、非重叠的标准:可读性、相关性、一致性、信息量和自然性。
  • 在这些标准中,“自然性”优于“人类性”,因其有更清晰的操作定义,即“人类生成回复的真实性”。
  • “吸引力”和“趣味性”等标准被排除,因其依赖多轮交互,无法从单个回复中可靠判断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。