Skip to main content
QUICK REVIEW

[论文解读] Beware the Rationalization Trap! When Language Model Explainability Diverges from our Mental Models of Language

Rita Sevastjanova, Mennatallah El‐Assady|arXiv (Cornell University)|Jul 14, 2022
Topic Modeling被引用 5
一句话总结

本文认为,语言模型可解释性存在有害合理化风险,其根源在于模型行为与人类对语言的心理模型之间存在错位。为此,本文提出一种以人为中心的框架,要求提供高保真、完整的解释,且与用户的认知模型相匹配,以确保真实理解。该框架采用自适应、对比性和协作式解释策略,防止误解。

ABSTRACT

Language models learn and represent language differently than humans; they learn the form and not the meaning. Thus, to assess the success of language model explainability, we need to consider the impact of its divergence from a user's mental model of language. In this position paper, we argue that in order to avoid harmful rationalization and achieve truthful understanding of language models, explanation processes must satisfy three main conditions: (1) explanations have to truthfully represent the model behavior, i.e., have a high fidelity; (2) explanations must be complete, as missing information distorts the truth; and (3) explanations have to take the user's mental model into account, progressively verifying a person's knowledge and adapting their understanding. We introduce a decision tree model to showcase potential reasons why current explanations fail to reach their objectives. We further emphasize the need for human-centered design to explain the model from multiple perspectives, progressively adapting explanations to changing user expectations.

研究动机与目标

  • 解决由于模型行为与人类语言直觉之间错位而导致的语言模型解释中存在有害合理化风险的问题。
  • 识别有效可解释性的三个核心条件:高保真度、完整性以及与用户心理模型的一致性。
  • 提出自适应、多重视角的解释方法,逐步校准用户的理解。
  • 强调需要采用对比性解释和类人解释,以纠正误解并提升用户理解力。
  • 倡导发展协作式与交互式解释系统,使其随用户理解的深化而动态演进。

提出的方法

  • 设计通过定期检查和反馈回路验证用户理解的解释系统,以检测并纠正误解。
  • 采用决策树模型诊断当前解释方法失败的原因,重点关注保真度、完整性和用户模型一致性。
  • 整合协同自适应引导策略,根据用户反馈和心理模型演变动态调整解释内容。
  • 运用对比性与自下而上的解释技术,从多个视角揭示模型行为,尤其适用于用户存在强烈先验观念的情况。
  • 开发类人解释,将模型特征转化为自然语言,使显著性与决策逻辑对非专家更易理解。
  • 构建模块化XAI流程,采用更小的解释器单元,以支持渐进式、任务特定的解释开发。

实验结果

研究问题

  • RQ1语言模型学习(仅形式化)与人类语言心理模型之间的偏离,如何导致解释中的有害合理化?
  • RQ2实现对语言模型行为真实理解的解释,需要满足哪些条件?
  • RQ3如何设计能够适应不断演化的用户心理模型并防止误解的解释系统?
  • RQ4当前解释方法在确保面向用户的解释具有完整性和保真度方面,存在哪些失败原因?
  • RQ5对比性与协作式解释方法在提升用户校准度和减少合理化方面,有哪些作用?

主要发现

  • 缺乏保真度或完整性的解释会使用户用错误假设填补空白,导致有害合理化。
  • 当前解释方法往往无法提升用户理解,因为未考虑用户对语言的既有心理模型。
  • 高保真、完整的解释虽必要,但不足以保证真实理解;它们必须与用户的认知框架对齐。
  • 通过验证用户理解并据此调整解释的自适应解释系统,能显著降低误解风险。
  • 对比性与自下而上的解释方法有助于用户校准其心理模型,尤其在用户对模型行为持有强烈但错误的假设时。
  • 将模型特征转化为自然语言的类人解释,可显著提升非专业用户对解释的可及性与理解力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。