Skip to main content
QUICK REVIEW

[论文解读] Human Evaluation of Conversations is an Open Problem: comparing the sensitivity of various methods for evaluating dialogue agents

Eric M. Smith, Orion Hsu|arXiv (Cornell University)|Jan 12, 2022
Mobile Crowdsensing and Crowdsourcing被引用 4
一句话总结

本文评估了五种基于众包工作者的人工评估方法——成对 vs. 单模型、逐轮 vs. 逐对话——发现并无单一方法在所有情况下均表现更优;相反,有效性取决于模型比较类型,其中成对逐轮方法在检测上下文响应差异方面表现最佳,而成对逐对话方法在检测全局细微模式方面更优。本研究为方法选择提供了实用指导,并建议结合多种技术以提升整体敏感性。

ABSTRACT

At the heart of improving conversational AI is the open problem of how to evaluate conversations. Issues with automatic metrics are well known (Liu et al., 2016, arXiv:1603.08023), with human evaluations still considered the gold standard. Unfortunately, how to perform human evaluations is also an open problem: differing data collection methods have varying levels of human agreement and statistical sensitivity, resulting in differing amounts of human annotation hours and labor costs. In this work we compare five different crowdworker-based human evaluation methods and find that different methods are best depending on the types of models compared, with no clear winner across the board. While this highlights the open problems in the area, our analysis leads to advice of when to use which one, and possible future directions.

研究动机与目标

  • 识别开放域对话代理最敏感且可靠的评估方法。
  • 比较五种不同的人工评估技术在检测对话模型之间差异方面的表现。
  • 确定方法选择如何影响统计敏感性、标注工作量和模型比较的可靠性。
  • 根据模型比较类型(如微调、大小、长度)提供可操作的方法选择建议。
  • 探索结合多种评估技术以提升整体敏感性和效率的潜力。

提出的方法

  • 使用五种不同方法开展人工评估:成对逐轮、成对逐对话、单模型逐轮、单模型逐对话,以及成对逐轮与成对逐对话的混合组合。
  • 利用众包工作者在受控环境中对模型响应进行评分,每种方法均应用于三种不同的模型比较场景:长度、大小和微调。
  • 通过估算实现模型比较显著性所需的标注小时数来衡量统计敏感性。
  • 将多种方法的评分(如单模型逐轮与逐对话评分的平均值)结合,以评估混合方法的表现。
  • 分析标注者提供的书面解释,以评估不同方法在可解释性和一致性方面的表现。
  • 在ParlAI框架中发布所有评估技术的代码,以确保可复现性并促进社区采纳。

实验结果

研究问题

  • RQ1在各种比较类型下,哪种人工评估方法对对话模型之间的差异最敏感?
  • RQ2逐轮与逐对话评估方法在检测对话长度变化过程中的模型性能差异方面有何差异?
  • RQ3成对比较在多大程度上提升了对细微差异的敏感性,相较于单模型评估?
  • RQ4结合多种评估技术是否能获得优于任一单一方法的整体敏感性?
  • RQ5不同方法的标注时间和人力成本有何差异?在敏感性与效率之间存在何种权衡?

主要发现

  • 成对逐轮评估在检测上下文语境中响应恰当性差异方面最为有效,尤其是在模型在不同数据分布上训练时。
  • 当差异仅在多轮对话后显现时(如响应长度或全局连贯性模式),成对逐对话评估表现最佳。
  • 单模型评估(无论逐轮或逐对话)对细微或上下文相关差异的敏感性较低,但在比较非常相似的模型(如不同参数规模)时表现更优。
  • 以1:5的比例结合成对逐轮与成对逐对话评估,可显著提升整体敏感性,更有效地捕捉细粒度差异与全局差异,优于任一方法单独使用。
  • 将单模型逐轮与逐对话评分取平均,可提高敏感性并减少所需标注时间,优于单独使用单模型逐对话方法。
  • 实现统计显著性所需的时间因方法而异,其中成对逐对话在检测全局差异方面最为高效,而成对逐轮在检测上下文响应质量方面更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。