Skip to main content
QUICK REVIEW

[论文解读] Human Evaluation of Spoken vs. Visual Explanations for Open-Domain QA

Ana Valeria González, Gagan Bansal|arXiv (Cornell University)|Dec 30, 2020
Explainable Artificial Intelligence (XAI)参考文献 45被引用 7
一句话总结

本研究通过500多名参与者的用户研究,评估了开放域问答(ODQA)中口语与视觉解释的效果。研究发现,与仅依赖置信度分数相比,解释显著提升了用户检测错误的能力,但最有效的解释类型取决于交互模态:在口语界面中,抽取式句子解释表现更优;在视觉界面中,较长的抽取式段落更有效,凸显了针对不同模态设计解释策略的必要性。

ABSTRACT

While research on explaining predictions of open-domain QA systems (ODQA) to users is gaining momentum, most works have failed to evaluate the extent to which explanations improve user trust. While few works evaluate explanations using user studies, they employ settings that may deviate from the end-user's usage in-the-wild: ODQA is most ubiquitous in voice-assistants, yet current research only evaluates explanations using a visual display, and may erroneously extrapolate conclusions about the most performant explanations to other modalities. To alleviate these issues, we conduct user studies that measure whether explanations help users correctly decide when to accept or reject an ODQA system's answer. Unlike prior work, we control for explanation modality, e.g., whether they are communicated to users through a spoken or visual interface, and contrast effectiveness across modalities. Our results show that explanations derived from retrieved evidence passages can outperform strong baselines (calibrated confidence) across modalities but the best explanation strategy in fact changes with the modality. We show common failure cases of current explanations, emphasize end-to-end evaluation of explanations, and caution against evaluating them in proxy modalities that are different from deployment.

研究动机与目标

  • 探究解释是否能提升用户在判断ODQA系统答案是否可信时的正确决策能力。
  • 比较不同解释类型(证据段落、证据句子和摘要式总结)在口语与视觉模态下的有效性。
  • 评估基于检索证据生成的解释是否优于强基线方法(如校准后的置信度分数)。
  • 识别模态特定的失败案例及解释设计中的认知权衡。
  • 警告在实际部署为语音助手等口语接口时,避免在仅视觉的代理模态中评估解释。

提出的方法

  • 开展端到端的用户研究,共500多名参与者通过口语或视觉界面与ODQA系统交互。
  • 评估三种解释类型:完整检索到的证据段落、单个检索到的证据句子,以及人工撰写的摘要式总结。
  • 使用基于绩效的激励回报矩阵,模拟真实用户动机与决策成本。
  • 控制模态(口语 vs. 视觉),比较不同解释策略与基线在错误检测能力上的差异。
  • 通过准确率、用户操作速度和感知解释质量来衡量有效性与认知负荷。
  • 分析解释误导用户信任错误答案的失败案例,其频率甚至超过置信度基线。

实验结果

研究问题

  • RQ1与仅显示校准后置信度分数相比,解释是否能帮助用户更好地检测ODQA预测中的错误?
  • RQ2不同解释策略在口语与视觉模态中的有效性是否存在差异?
  • RQ3在每种模态中,哪种解释类型——证据段落、证据句子或摘要式总结——能实现最高的错误检测能力?
  • RQ4为何某些解释会误导用户信任错误答案,模态在其中起到何种影响?
  • RQ5认知负荷与信息密度在口语与视觉界面中对解释性能的影响程度如何?

主要发现

  • 在口语模态中,所有解释类型在错误检测能力上均显著优于校准置信度基线,其中抽取式句子解释效果最佳。
  • 在视觉模态中,较长的抽取式段落优于句子长度的解释,表明视觉用户从更详细的证据中获益更多。
  • 摘要式总结未提升准确率,但使用户任务时间减少2.2秒,且被评价为更简洁。
  • 尽管有所改进,解释仍会误导用户信任错误答案,频率与置信度基线相当,表明其可靠性问题依然存在。
  • 抽取式句子解释在口语模式中最为有效,可能因其认知负荷较低;而较长解释在视觉模式中更有效,表明细节与可理解性之间存在模态依赖的权衡。
  • 本研究证明,最佳解释策略并非普适,必须根据部署模态进行调整,挑战了仅基于视觉模态评估的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。