Skip to main content
QUICK REVIEW

[论文解读] Towards Explainable Evaluation Metrics for Natural Language Generation

Christoph Leiter, Piyawat Lertvittayakumjorn|arXiv (Cornell University)|Mar 21, 2022
Topic Modeling被引用 12
一句话总结

本文提出了一套用于自然语言生成的可解释评估指标框架,聚焦于提升 BERTScore 和 MoverScore 等高质量黑箱指标的透明度与可信度。该研究识别出可解释性所需的关键属性,评估了 GMASK 和对抗性攻击等现有方法,发现当前的对抗性技术无法保持语义一致性,限制了其有效性——强调未来可解释指标需具备忠实性、合理性以及源句与目标句的联合分析能力。

ABSTRACT

Unlike classical lexical overlap metrics such as BLEU, most current evaluation metrics (such as BERTScore or MoverScore) are based on black-box language models such as BERT or XLM-R. They often achieve strong correlations with human judgments, but recent research indicates that the lower-quality classical metrics remain dominant, one of the potential reasons being that their decision processes are transparent. To foster more widespread acceptance of the novel high-quality metrics, explainability thus becomes crucial. In this concept paper, we identify key properties and propose key goals of explainable machine translation evaluation metrics. We also provide a synthesizing overview over recent approaches for explainable machine translation metrics and discuss how they relate to those goals and properties. Further, we conduct own novel experiments, which (among others) find that current adversarial NLP techniques are unsuitable for automatically identifying limitations of high-quality black-box evaluation metrics, as they are not meaning-preserving. Finally, we provide a vision of future approaches to explainable evaluation metrics and their evaluation. We hope that our work can help catalyze and guide future research on explainable evaluation metrics and, mediately, also contribute to better and more transparent text generation systems.

研究动机与目标

  • 解决尽管存在更高质量的黑箱指标,低质量、非语义的指标(如 BLEU 和 ROUGE)在 NLP 研究中仍占主导地位的问题。
  • 识别可解释性缺失是现代评估指标难以被采纳的关键障碍,导致研究人员产生不信任感和抵触情绪。
  • 系统性地定义可解释评估指标应满足的目标与属性,如忠实性、合理性以及错误严重性等。
  • 综合并评估现有可解释指标的方法,包括局部解释方法与对抗性攻击技术。
  • 提出未来可解释指标的发展愿景,超越词级高亮,整合文本化解释、源句与目标句的联合分析以及无监督指标优化。

提出的方法

  • 提出可解释评估指标的目标与属性分类体系,强调忠实性、合理性以及对错误严重性与词对应关系的考量。
  • 调研并分类现有自然语言生成评估中可解释性的方法,包括显著性图和基于注意力的高亮等局部解释技术。
  • 将原本用于分类任务的 GMASK 方法适配至评估指标的回归式评分任务中,采用预选机制识别源句与目标句中的相关词汇。
  • 设计并应用三种新型实验设置以评估忠实性,包括 AOPC、事后准确率与退化测试,用以分析高亮词汇变化对指标得分的影响。
  • 研究用于评估指标的对抗性攻击方法,要求语义保持不变以确保有效性,并测试其在揭示指标弱点方面的效果。
  • 提出未来研究方向,整合源句与目标句的联合分析、文本化解释以及无监督指标优化,以提升可解释性与可靠性。

实验结果

研究问题

  • RQ1哪些属性与目标定义了自然语言生成中高质量的可解释评估指标?
  • RQ2当应用于句子级评估指标时,现有局部解释方法(如显著性图、GMASK)在忠实性与合理性方面表现如何?
  • RQ3在保持语义一致性的前提下,对抗性攻击在多大程度上可被自动化以暴露黑箱评估指标的弱点?
  • RQ4为何当前的对抗性 NLP 技术无法有效识别高质量指标的局限性?其自动化受到哪些约束?
  • RQ5为构建透明、可信且适用于高风险场景的可解释评估指标,未来需要哪些研究方向?

主要发现

  • 当前的对抗性 NLP 技术不适用于自动识别高质量黑箱评估指标的局限性,因其无法保持语义一致性。
  • GMASK 方法在分类任务中表现出强忠实性,但在适配至回归式评估指标时面临挑战,因其评分具有连续性特征。
  • 现有解释方法常忽略机器翻译中源句与目标句之间的对应关系,导致解释具有误导性或不完整。
  • 当前解释框架未能充分考虑错误的严重性与高亮词汇的合理性,降低了其诊断价值。
  • 仅高亮单个词汇而缺乏上下文或联合分析的解释,不足以诊断指标失效,尤其在复杂的翻译场景中。
  • 未来的可解释指标必须整合源句与目标句的联合分析,支持文本化解释,并实现无监督指标优化,以实现更广泛的可信度与采纳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。