Skip to main content
QUICK REVIEW

[论文解读] Honest Students from Untrusted Teachers: Learning an Interpretable Question-Answering Pipeline from a Pretrained Language Model

Jacob Eisenstein, Daniel Andor|arXiv (Cornell University)|Oct 5, 2022
Topic Modeling被引用 11
一句话总结

本文提出了一种用于开放书本问答的标记-掩码推理链方法,其中自由文本标记将段落句子去上下文化以实现独立可解释性,随后进行抽取式推理链掩码。通过使用冻结的预训练语言模型作为“教师”进行上下文学习,生成银色推理链以训练一个更小的‘诚实学生’模型,该模型严格遵循生成标记、再生成推理链、最后生成答案的流程,实现了高准确率和强推理链蕴含性,且仅需极少的人工标注。

ABSTRACT

Explainable question answering systems should produce not only accurate answers but also rationales that justify their reasoning and allow humans to check their work. But what sorts of rationales are useful and how can we train systems to produce them? We propose a new style of rationale for open-book question answering, called \emph{markup-and-mask}, which combines aspects of extractive and free-text explanations. In the markup phase, the passage is augmented with free-text markup that enables each sentence to stand on its own outside the discourse context. In the masking phase, a sub-span of the marked-up passage is selected. To train a system to produce markup-and-mask rationales without annotations, we leverage in-context learning. Specifically, we generate silver annotated data by sending a series of prompts to a frozen pretrained language model, which acts as a teacher. We then fine-tune a smaller student model by training on the subset of rationales that led to correct answers. The student is "honest" in the sense that it is a pipeline: the rationale acts as a bottleneck between the passage and the answer, while the "untrusted" teacher operates under no such constraints. Thus, we offer a new way to build trustworthy pipeline systems from a combination of end-task annotations and frozen pretrained language models.

研究动机与目标

  • 开发一种可信赖的问答系统,通过结合抽取式推理链掩码与自由文本标记,实现可解释的推理链,同时保持语篇连贯性。
  • 通过去上下文化的标记使句子能够独立存在,解决抽取式推理链在遇到回指或省略时失效的问题。
  • 在无需为推理链生成提供显式标注的情况下,训练基于流程的学生模型,利用冻结的预训练语言模型进行上下文学习。
  • 确保学生模型是‘诚实’的——即必须仅依赖推理链作答,而非原始段落,从而提升可信度与可解释性。
  • 证明蒸馏后的学生模型即使在极少人工标注监督下,也能在准确率、推理链蕴含性和标记质量等关键指标上超越其教师模型。

提出的方法

  • 对每个段落中的句子,应用冻结的预训练语言模型(即‘教师’)生成去上下文化的标记,将代词和指代替换为完整名词短语,使句子在脱离上下文时仍具可解释性。
  • 使用相同的教师模型,基于已标记的段落生成思维链推理过程和答案,确保推理基于去上下文化的文本。
  • 通过提示教师仅使用推理链(而非完整段落)回答问题来验证推理的正确性;若答案与标准答案匹配,则保留该推理链和标记作为银色数据。
  • 在银色数据上微调一个更小的学生模型,强制执行严格流程:首先生成标记,然后选择推理链片段,最后仅使用推理链生成答案。
  • 使用前向链式提示级联生成中间步骤,使教师能够通过顺序提示生成推理轨迹和推理链。
  • 根据推理链是否导致正确答案来过滤银色样本,确保仅使用高质量训练数据来训练学生模型。

实验结果

研究问题

  • RQ1自由文本标记与抽取式掩码的结合,是否能产生比传统抽取式推理链更具可解释性与忠实性的推理链?
  • RQ2在无人工标注推理链的情况下,冻结的预训练语言模型在多大程度上可作为可靠教师,生成高质量的银色标注用于推理链生成?
  • RQ3尽管模型更小且受限于流程架构,蒸馏后的学生模型是否能在准确率、推理链质量与标记保真度上超越其教师模型?
  • RQ4通过强制学生模型在选择推理链后丢弃原始段落,是否能提升预测的可靠性和可解释性?
  • RQ5当仅使用五个标准标注样本时,少样本上下文学习在去上下文化标记生成中的有效性如何?

主要发现

  • 尽管是流程化系统,该诚实学生模型的准确率接近SQuAD水平(与端到端模型相当),表明可解释性并不以性能为代价。
  • 在QuoRef数据集上,使用标记显著提升了答案准确率,表明去上下文化语篇元素能有效提升仅依赖抽取式片段的推理能力。
  • 学生模型生成的推理链比思维链推理更可能蕴含预测答案,F1得分高出20分,表明其具备更强的逻辑一致性。
  • 学生模型生成的去上下文化标记质量优于在11,290个标准标注样本上微调的模型,凸显从冻结LLM蒸馏的有效性。
  • 学生模型在所有三项关键指标上均优于教师模型:整体准确率、推理链蕴含率与标记准确率,证明了知识蒸馏的成功。
  • 该方法仅需五个人工标注样本即可完成去上下文化,但生成的标记质量已超越在更大标准标注数据集上训练的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。