[论文解读] Evaluating and Characterizing Human Rationales
本文通过自动化的一致性度量(充分性与全面性)评估人类生成的推理过程,揭示了由于模型偏差和数据集特异性因素,人类推理过程在这些度量上表现不佳。作者提出了归一化一致性度量、仅使用推理数据微调模型的方法以及一致性曲线,以更准确地刻画推理质量,揭示了冗余性和标记依赖性等隐藏特性。
Two main approaches for evaluating the quality of machine-generated rationales are: 1) using human rationales as a gold standard; and 2) automated metrics based on how rationales affect model behavior. An open question, however, is how human rationales fare with these automatic metrics. Analyzing a variety of datasets and models, we find that human rationales do not necessarily perform well on these metrics. To unpack this finding, we propose improved metrics to account for model-dependent baseline performance. We then propose two methods to further characterize rationale quality, one based on model retraining and one on using "fidelity curves" to reveal properties such as irrelevance and redundancy. Our work leads to actionable suggestions for evaluating and characterizing rationales.
研究动机与目标
- 探究人类生成的推理过程是否在自动化一致性度量(如充分性与全面性)上表现良好,尽管这些推理过程常被视为黄金标准。
- 识别当前自动化评估方法的局限性,这些局限性导致人类推理过程的一致性评分存在误导性或不一致。
- 开发改进的评估技术,以考虑模型特异性行为,如类别偏差以及完整输入与仅推理输入之间的领域偏移。
- 超越二元的充分性/全面性评估,通过分析冗余性、无关性和标记相互依赖性,更全面地刻画推理质量。
- 提供可操作的、与模型无关的评估框架,以支持自然语言处理中更可靠、更可解释的解释评估。
提出的方法
- 提出一种归一化程序,基于基线模型性能调整一致性得分,从而实现在不同模型和数据集之间的公平比较。
- 引入在仅使用推理数据上微调模型的方法,以区分偶然一致性与潜在一致性,揭示推理的真正预测能力。
- 通过逐步遮蔽推理中的标记并测量充分性与全面性随时间的退化,构建‘一致性曲线’。
- 利用一致性曲线的形状推断推理的细粒度特性,如冗余性(渐进性退化)和标记依赖性(急剧退化)。
- 在六个不同的自然语言处理数据集中应用这些方法,分析不同任务、类别和模型间推理质量的差异。
- 比较归一化度量、微调模型和一致性曲线的结果,提供对推理质量的多维刻画。
实验结果
研究问题
- RQ1在不同模型和数据集中,人类推理过程在标准自动化一致性度量(充分性与全面性)上的表现如何?
- RQ2模型偏差和类别不平衡在多大程度上扭曲了使用标准度量对推理质量的评估?
- RQ3对一致性度量进行归一化是否能提升跨模型和跨数据集比较中的公平性与可解释性?
- RQ4在仅使用推理数据上微调模型后,如何揭示推理的‘潜在’一致性,而不仅限于其在完整数据上的‘偶然’表现?
- RQ5通过在随机遮蔽下分析一致性曲线的形状,能获得关于推理结构(如冗余性、无关性或标记依赖性)的哪些新见解?
主要发现
- 即使被视为黄金标准解释,人类推理过程在自动化度量上也经常表现出较低的充分性与全面性。
- 模型特异性偏差(如 E-SNLI 中对中性类别的强烈偏好)可能导致对不忠实推理过程的评估得分虚高。
- 对一致性度量进行归一化能显著降低由基线模型行为引起的方差,从而实现更可靠的跨模型比较。
- 在仅使用推理数据上微调模型后,发现许多推理过程具有较高的‘潜在’一致性,表明其包含初始评估中未捕捉到的有效信号。
- 一致性曲线揭示了推理的结构特性:分类任务表现出更高的标记依赖性和更低的冗余性,而文档/查询任务则表现出更多冗余性和更低的依赖性。
- 一致性曲线的形状可区分冗余(渐进性退化)与相互依赖(急剧退化)的标记集合,为推理质量提供了新的诊断工具。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。