Skip to main content
QUICK REVIEW

[论文解读] Counterfactual Learning from Human Proofreading Feedback for Semantic Parsing

Carolin Lawrence, Stefan Riezler|arXiv (Cornell University)|Nov 29, 2018
Topic Modeling参考文献 22被引用 7
一句话总结

本文提出了一种反事实学习框架,通过利用人类校对人员对模型生成解析结果的反馈,将解析结果转化为人类可理解的语句以标记错误,从而提升神经语义解析器的性能。通过利用非专家提供的词粒度反馈,并采用一种新颖的重加权目标函数,该方法仅使用995个反馈样本,便在监督基线上实现了7.45点的F1提升,证明了无需黄金解析结果即可实现有效的离策略学习。

ABSTRACT

In semantic parsing for question-answering, it is often too expensive to collect gold parses or even gold answers as supervision signals. We propose to convert model outputs into a set of human-understandable statements which allow non-expert users to act as proofreaders, providing error markings as learning signals to the parser. Because model outputs were suggested by a historic system, we operate in a counterfactual, or off-policy, learning setup. We introduce new estimators which can effectively leverage the given feedback and which avoid known degeneracies in counterfactual learning, while still being applicable to stochastic gradient optimization for neural semantic parsing. Furthermore, we discuss how our feedback collection method can be seamlessly integrated into deployed virtual personal assistants that embed a semantic parser. Our work is the first to show that semantic parsers can be improved significantly by counterfactual learning from logged human feedback data.

研究动机与目标

  • 为了解决开放域问答任务中收集标准黄金解析结果或答案的高昂成本问题。
  • 使非专家用户能够对模型生成的解析结果提供高效、基于错误的反馈,而非必须提供黄金标准标注。
  • 开发一种反事实学习框架,有效利用历史系统记录的人类反馈,以改进目标解析器。
  • 设计一种重加权目标函数,支持在小批量设置下对神经序列到序列模型进行随机梯度优化。
  • 证明即使在无法访问黄金解析结果的情况下,细粒度的词粒度反馈也能显著提升解析性能。

提出的方法

  • 将模型输出转换为人类可读的语句(例如:'有5家酒店'),以使非专家用户能够标记错误的词。
  • 在记录的、离策略的设置下收集反馈,即反馈由不同于被优化系统的另一系统生成。
  • 引入一种新的目标函数,根据反馈重新加权损失贡献,从而在随机梯度下降中实现有效的反事实学习。
  • 使用一种重加权目标函数(DPM+OSL),考虑在行为策略下生成每个解析的概率,从而降低梯度估计的方差。
  • 对解析中的错误词应用词粒度奖励,以实现从部分正确输出中学习。
  • 使用重加权目标函数训练带有注意力机制的神经序列到序列模型,即使在离策略反馈下也能实现优化。

实验结果

研究问题

  • RQ1能否利用对模型生成解析结果的人类反馈,在无需黄金标准解析结果的情况下提升语义解析性能?
  • RQ2能否通过从记录的人类校对反馈中进行反事实学习,实现在神经语义解析中的显著性能提升?
  • RQ3在人类可读语句中以词粒度标记错误的反馈,是否能带来优于传统带 bandit-to-supervised 转换方法的性能?
  • RQ4重加权目标函数能否在离策略设置下,实现对神经序列模型的有效随机梯度优化?
  • RQ5在模拟的大规模日志中,随着人类反馈数量的增加,性能如何变化?

主要发现

  • 所提出的方法仅使用995个反馈样本,从未见过黄金解析结果,便使基线神经语义解析器的F1提升了1.0分。
  • DPM+T+OSL目标函数(结合词粒度奖励与重加权)显著优于强大的带 bandit-to-supervised(B2S)基线,后者F1提升了6.24分。
  • 在模拟的大规模日志中,该方法相比基线实现了7.45分的F1提升,证明了随着反馈量增加,性能增益具有可扩展性。
  • 人类用户平均仅需16.4秒即可标记一个完整解析中的错误,证实了该反馈收集方法的高效性与可行性。
  • 重加权目标函数(DPM+OSL)有效缓解了反事实学习中的退化问题,并实现了使用小批量SGD的稳定训练。
  • 词粒度反馈至关重要——仅依赖部分或粗粒度反馈的方法无法达到完整方法的性能水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。