Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Learning from Human Proofreading Feedback for Semantic Parsing

Carolin Lawrence, Stefan Riezler|arXiv (Cornell University)|Nov 29, 2018
Topic Modeling参考文献 22被引用数 7
ひとこと要約

本稿では、モデルが生成した解析結果に対する人間の校閲フィードバックを活用して、神経的意味解析器の性能を向上させる反事後学習フレームワークを提案する。このフレームワークは、モデル出力を人間が理解可能な文に変換(例:'ホテルが5軒あります')し、誤りをマークできるようにすることで、非専門家によるトークンレベルのフィードバックを可能にする。非専門家からのトークンレベルのフィードバックを活用し、新たな再重み付け目的関数を採用することで、ゴールド解析が一切不要な状態でも、995件のフィードバック例のみで教師ありベースライン比でF1スコアを7.45ポイント向上させた。これは、ゴールド解析が存在しない状況でも、効果的な非政策的学習が可能であることを示している。

ABSTRACT

In semantic parsing for question-answering, it is often too expensive to collect gold parses or even gold answers as supervision signals. We propose to convert model outputs into a set of human-understandable statements which allow non-expert users to act as proofreaders, providing error markings as learning signals to the parser. Because model outputs were suggested by a historic system, we operate in a counterfactual, or off-policy, learning setup. We introduce new estimators which can effectively leverage the given feedback and which avoid known degeneracies in counterfactual learning, while still being applicable to stochastic gradient optimization for neural semantic parsing. Furthermore, we discuss how our feedback collection method can be seamlessly integrated into deployed virtual personal assistants that embed a semantic parser. Our work is the first to show that semantic parsers can be improved significantly by counterfactual learning from logged human feedback data.

研究の動機と目的

  • オープンドメインの質問応答タスクにおけるゴールドスタンダードの解析や回答を収集するコストの高さに対処すること。
  • ゴールドスタンダードのアノテーションを必要とせず、非専門家がモデルが出力した解析に対して効率的でエラー指向のフィードバックを提供できるようにすること。
  • 履歴システムでログされた人間のフィードバックを活用して、ターゲット解析器を改善する反事後学習フレームワークを構築すること。
  • ミニバッチ設定下での確率的勾配最適化を可能にする、ニューラルシーケンス・ツー・シーケンスモデル向けの再重み付け目的関数を設計すること。
  • ゴールド解析が入手不可な状況でも、細分化されたトークンレベルのフィードバックが、解析性能を顕著に向上させられることを実証すること。

提案手法

  • モデル出力を人間が理解可能な文(例:'ホテルが5軒あります')に変換し、非専門家が誤ったトークンをマークできるようにする。
  • 最適化対象のシステムとは異なるシステムが生成したフィードバックを用いた、ログ記録済みの非政策的設定でフィードバックを収集する。
  • フィードバックに基づいて損失寄与度を再重み付ける新しい目的関数を導入し、確率的勾配降下法を用いた効果的な反事後学習を可能にする。
  • 行動方策における各解析の生成確率を考慮する再重み付け目的関数(DPM+OSL)を採用し、勾配推定の分散を低減する。
  • 解析内の誤ったトークンに対してトークンレベルの報酬を適用し、部分的に正しい出力からの学習を可能にする。
  • 再重み付けされた目的関数を用いてアテンションを備えたニューラルシーケンス・ツー・シーケンスモデルを学習させ、ミニバッチSGDによる最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ゴールドスタンダードの解析が存在しない状況でも、モデルが出力した解析に対する人間のフィードバックを用いて意味解析性能を向上させられるか?
  • RQ2ログ記録済みの人間による校閲フィードバックから得られる反事後学習が、神経的意味解析において顕著な性能向上を達成できるか?
  • RQ3人間が理解可能な文に変換された解析における誤りマークによるトークンレベルのフィードバックは、従来のバンドイット・ツー・スーパvised変換よりも優れた性能をもたらすか?
  • RQ4再重み付け目的関数が、ニューラルシーケンスモデルの非政策的設定下での効果的な確率的勾配最適化を可能にするか?
  • RQ5シミュレーテッド大規模ログ環境において、人間のフィードバック量の増加に伴い、性能はどのようにスケーリングするか?

主な発見

  • 提案手法は、ゴールド解析を一切参照せず、995件のフィードバック例のみでベースラインの神経的意味解析器を1.0 F1ポイント向上させた。
  • トークンレベルの報酬と再重み付けを統合したDPM+T+OSL目的関数は、強力なバンドイット・ツー・スーパvised(B2S)ベースラインを著しく上回り、F1スコアを6.24ポイント向上させた。
  • シミュレーテッド大規模ログ環境において、本手法はベースライン比でF1スコアを7.45ポイント向上させ、より多くのフィードバックが得られるほど性能向上がスケーリングすることを示した。
  • 人間ユーザーは平均16.4秒で1つの完全な解析の誤りをマークでき、フィードバック収集手法の効率性と実行可能性を裏付けた。
  • 再重み付け目的関数(DPM+OSL)は、反事後学習における劣化現象を効果的に抑制し、ミニバッチSGDによる安定した学習を可能にした。
  • トークンレベルのフィードバックが不可欠であった。部分的または粗いフィードバックのみを用いた手法は、本手法の性能に達しなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。