Skip to main content
QUICK REVIEW

[论文解读] A Critical Evaluation of Evaluations for Long-form Question Answering

Fangyuan Xu, Yixiao Song|arXiv (Cornell University)|May 29, 2023
Topic Modeling被引用 4
一句话总结

本文通过对比人类专家判断与自动指标,首次对长篇问答(LFQA)进行了全面评估。研究发现,现有任何自动指标都无法可靠预测人类偏好,但部分指标与连贯性、事实性等细粒度方面存在相关性,因此主张采用多维度评估而非单一总体得分。作者发布了专家标注的数据与代码,以推动未来LFQA评估研究的发展。

ABSTRACT

Long-form question answering (LFQA) enables answering a wide range of questions, but its flexibility poses enormous challenges for evaluation. We perform the first targeted study of the evaluation of long-form answers, covering both human and automatic evaluation practices. We hire domain experts in seven areas to provide preference judgments over pairs of answers, along with free-form justifications for their choices. We present a careful analysis of experts' evaluation, which focuses on new aspects such as the comprehensiveness of the answer. Next, we examine automatic text generation metrics, finding that no existing metrics are predictive of human preference judgments. However, some metrics correlate with fine-grained aspects of answers (e.g., coherence). We encourage future work to move away from a single "overall score" of the answer and adopt a multi-faceted evaluation, targeting aspects such as factuality and completeness. We publicly release all of our annotations and code to spur future work into LFQA evaluation.

研究动机与目标

  • 调查当前长篇问答(LFQA)评估实践的可靠性和有效性。
  • 评估现有自动文本生成指标是否与人类对LFQA答案的质量偏好判断相关。
  • 识别专家更重视的质量维度,如事实性、完整性与连贯性,而非表面特征。
  • 倡导从单一得分的人工评估转向针对特定答案质量的多维度评估框架。
  • 发布一个包含260个偏好判断及理由的全新专家标注数据集,以支持未来LFQA评估研究。

提出的方法

  • 聘请七个领域(如生物学、经济学)的专家,对LFQA答案进行成对偏好判断,并提供详细理由。
  • 收集了140组答案对,共260次专家评分,标注聚焦于事实性、完整性、连贯性及其他细粒度方面。
  • 评估12种现有自动指标(如ROUGE、QAFactEval、RankGen)与人类判断在整体质量及具体方面的一致性。
  • 通过结合命名实体识别、问题生成、答案验证及使用微调后的BART与Electra模型进行相似度评分的流水线,训练了一个学习型指标(LERC)。
  • 试点测试使用少样本学习的GPT-3 text-davinci-003进行成对评估,采用两样本示例与温度采样。
  • 采用多阶段评估流水线:(1) 从源文本中提取答案,(2) 生成问题,(3) 验证答案,(4) 使用学习型指标计算相似度得分。

实验结果

研究问题

  • RQ1专家对长篇答案的判断与众包工作者在评估标准上存在哪些差异?
  • RQ2在答案质量方面,如事实性、完整性或连贯性,哪些方面在专家偏好判断中最具决定性?
  • RQ3现有自动指标与人类偏好判断在LFQA答案上的相关性有多大?
  • RQ4学习型指标能否有效预测人类偏好判断,还是仅能捕捉质量的部分方面?
  • RQ5使用单一总体得分评估LFQA答案存在哪些局限性?有哪些替代方案更有效?

主要发现

  • 专家更重视事实性和完整性,而非简洁性等表面特征,且常因对细粒度方面的不同评价而产生分歧。
  • 现有任何自动指标均无法可靠地与人类偏好判断在整体答案质量上相关联,表明当前评估实践中存在重大空白。
  • 如QAFactEval与RankGen等指标与事实一致性与连贯性等细粒度方面表现出中等程度相关性,表明可针对性地开发指标。
  • 本研究揭示,即使专家评估者也存在显著分歧,凸显了在LFQA中定义答案质量的复杂性。
  • 作者发布了包含260个专家标注的答案对及其理由的新数据集,可作为未来LFQA评估研究的基准。
  • 试点结果表明,GPT-3在少样本设置下可实现高一致性与中等程度的人类偏好对齐,但尚需进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。