Skip to main content
QUICK REVIEW

[论文解读] Reframing Human-AI Collaboration for Generating Free-Text Explanations

Sarah Wiegreffe, Jack Hessel|arXiv (Cornell University)|Dec 16, 2021
Explainable Artificial Intelligence (XAI)被引用 7
一句话总结

本文提出了一种过生成并过滤的流水线方法,利用GPT-3为每个输入生成多个自由文本解释,随后通过基于二元判断训练的人工介入可接受性过滤器进行筛选。该方法通过基于人类可接受性的高质输出选择,显著提升了解释质量,优于原始GPT-3生成结果和众包生成的解释,在CommonsenseQA和SNLI数据集上均表现出色。

ABSTRACT

Large language models are increasingly capable of generating fluent-appearing text with relatively little task-specific supervision. But can these models accurately explain classification decisions? We consider the task of generating free-text explanations using human-written examples in a few-shot manner. We find that (1) authoring higher quality prompts results in higher quality generations; and (2) surprisingly, in a head-to-head comparison, crowdworkers often prefer explanations generated by GPT-3 to crowdsourced explanations in existing datasets. Our human studies also show, however, that while models often produce factual, grammatical, and sufficient explanations, they have room to improve along axes such as providing novel information and supporting the label. We create a pipeline that combines GPT-3 with a supervised filter that incorporates binary acceptability judgments from humans in the loop. Despite the intrinsic subjectivity of acceptability judgments, we demonstrate that acceptability is partially correlated with various fine-grained attributes of explanations. Our approach is able to consistently filter GPT-3-generated explanations deemed acceptable by humans.

研究动机与目标

  • 探究GPT-3生成的解释是否能在自由文本解释任务中优于人工撰写的解释。
  • 探索提示工程是否能提升GPT-3生成解释的质量。
  • 识别与人类可接受性判断相关的解释的细粒度属性。
  • 开发一种可扩展的人工介入过滤机制,从GPT-3输出中筛选出高质量且可接受的解释。
  • 证明少量二元可接受性判断即可训练出监督过滤器,从而超越原始GPT-3生成结果。

提出的方法

  • 使用精心设计的 few-shot 提示,通过GPT-3为每个输入实例生成五个候选解释。
  • 通过人工介入标注,从众包工作者处收集每条生成解释的二元可接受性判断。
  • 在二元判断基础上训练一个监督可接受性分类器(如T0-3B),以预测GPT-3输出中哪些是可接受的。
  • 应用训练好的过滤器,从GPT-3输出中选择质量最高的解释,形成流水线:过生成 → 过滤。
  • 通过人工评估过滤器在可接受性、事实一致性、新颖性和标签支持等方面的性能。
  • 利用过滤器提升CommonsenseQA和SNLI数据集中解释层面和实例层面的性能。

实验结果

研究问题

  • RQ1在人类偏好研究中,GPT-3生成的解释是否会被优先选择,超过现有的众包解释?
  • RQ2提升提示质量是否能带来更高品质的GPT-3生成解释?
  • RQ3解释的哪些细粒度属性(如新颖性、标签支持)与人类可接受性判断相关?
  • RQ4是否可以利用少量二元可接受性判断训练出一个过滤器,持续从GPT-3输出中选择高质量解释?
  • RQ5过生成并过滤流水线是否能在可接受性及其他质量维度上超越原始GPT-3生成结果?

主要发现

  • 在一对一比较中,众包工作者在60%-70%的情况下更偏好GPT-3生成的解释,而非现有众包解释。
  • 尽管流畅性和语法性很高,但不到一半的贪婪解码GPT-3解释在人类标注员100%一致判断下被视为可接受。
  • 基于二元判断训练的可接受性过滤器显著提升了选择性能,在CommonsenseQA开发集上达到86.6%的select-1准确率,在测试集上达到87.0%。
  • 在SNLI上,过滤器在开发集上达到57.8%的select-1准确率,在测试集上达到60.3%,优于强基线模型。
  • 经过过滤的输出在支持标签方面表现更优(CommonsenseQA上从0.5提升至0.9),在新颖性方面也有所提升(CommonsenseQA上从0.3提升至0.6)。
  • 该流水线始终能选择出人类可接受的解释,且过滤器在多个随机种子和数据集上均表现出稳健性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。