[论文解读] On the Diversity and Limits of Human Explanations
本文研究了自然语言处理中人类解释的多样性与局限性,认为'解释'一词过于宽泛,混淆了不同的认知构念。文章将人类解释分为三类:近端机制、证据和程序,每类具有不同的认知基础和用途,指出人类常常无法提供有效且完整的推理过程,从而挑战了将人类解释视为模型训练或评估可靠真实标签的假设。
A growing effort in NLP aims to build datasets of human explanations. However, the term explanation encompasses a broad range of notions, each with different properties and ramifications. Our goal is to provide an overview of diverse types of explanations and human limitations, and discuss implications for collecting and using explanations in NLP. Inspired by prior work in psychology and cognitive sciences, we group existing human explanations in NLP into three categories: proximal mechanism, evidence, and procedure. These three types differ in nature and have implications for the resultant explanations. For instance, procedure is not considered explanations in psychology and connects with a rich body of work on learning from instructions. The diversity of explanations is further evidenced by proxy questions that are needed for annotators to interpret and answer open-ended why questions. Finally, explanations may require different, often deeper, understandings than predictions, which casts doubt on whether humans can provide useful explanations in some tasks.
研究动机与目标
- 澄清自然语言处理中'解释'这一概念的多样性,因其常被不加区分地使用,尽管其指代的是不同的认知现象。
- 检验人类标注的解释在多大程度上可作为训练或评估可解释人工智能模型的可靠真实标签。
- 强调心理学发现:预测不等于解释,且日常解释本质上是不完整的。
- 基于认知科学框架,将人类解释划分为三类:近端机制、证据和程序。
- 通过承认其认知与概念局限,为在自然语言处理中收集和使用人类解释提供指导。
提出的方法
- 采用Lombrozo(2006)的认知框架,将自然语言处理中的人类解释分类为三类:近端机制、证据和程序。
- 分析现有数据集中用于诱发解释的代理问题,揭示这些问题针对的是不同的潜在推理过程。
- 借鉴心理学文献,论证即使预测正确,人类也常常无法阐明其预测背后的完整因果机制。
- 通过实例表明,解释在形式和深度上存在差异——例如,突出标记(证据)与描述推理步骤(程序)以及陈述因果联系(近端机制)。
- 回顾20多个自然语言处理数据集及其标注指南,展示不同代理问题导致不同类型的解释,从而削弱了其统一性的假设。
- 提出研究人员在收集、使用或评估自然语言处理中的人类解释时,必须区分解释类型。
实验结果
研究问题
- RQ1自然语言处理中人类解释的哪些不同认知类型存在?它们在结构和目的上如何不同?
- RQ2人类在多大程度上能可靠地提供完整捕捉预测推理过程的解释?
- RQ3为何现有的人类解释数据集无法作为模型评估或训练的一致真实标签?
- RQ4标注过程中使用的代理问题如何影响所收集解释的类型与质量?
- RQ5心理学发现(如日常解释的不完整性及预测与解释之间的差距)对在自然语言处理中使用人类解释有何影响?
主要发现
- 自然语言处理中的'解释'一词涵盖了三种不同的认知类型:近端机制(因果推理)、证据(相关输入片段)和程序(分步指令),每类具有不同的属性和用途。
- 即使预测正确,人类也常常无法提供完整或准确的近端机制,这是由于预测与解释之间存在认知鸿沟。
- 日常解释本质上是不完整的,因为它们省略了公理基础和逻辑推导,与完整理性论证的期望相悖。
- 基于证据的解释(如高亮词语)并不解释推理过程,因此在心理学意义上不构成真正的'解释'。
- 尽管程序在指令遵循任务中有用,但在心理学中不被视为解释,而更符合'从指令中学习'的研究范畴。
- 用于诱发解释的代理问题在不同数据集中差异显著,导致解释类型不一致且非标准化,从而削弱了其作为统一'真实标签'的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。