Skip to main content
QUICK REVIEW

[論文レビュー] Selective Question Answering under Domain Shift

Amita Kamath, Robin Jia|arXiv (Cornell University)|Jun 16, 2020
Topic Modeling参考文献 52被引用数 5
ひとこと要約

本稿ではドメインシフト下での選択的質問応答を提案する。QAモデルはドメイン外(OOD)の入力を避ける必要があるが、同時に高い精度を維持する必要がある。本稿では、ドメイン内および既知のOODデータ上で訓練されたキャリブレータを導入し、OOD例におけるモデルの過信を是正することで、80%の精度で56.1%のカバレッジを達成した。これはMaxProbや他のベースラインと比べ顕著に優れている。

ABSTRACT

To avoid giving wrong answers, question answering (QA) models need to know when to abstain from answering. Moreover, users often ask questions that diverge from the model's training data, making errors more likely and thus abstention more critical. In this work, we propose the setting of selective question answering under domain shift, in which a QA model is tested on a mixture of in-domain and out-of-domain data, and must answer (i.e., not abstain on) as many questions as possible while maintaining high accuracy. Abstention policies based solely on the model's softmax probabilities fare poorly, since models are overconfident on out-of-domain inputs. Instead, we train a calibrator to identify inputs on which the QA model errs, and abstain when it predicts an error is likely. Crucially, the calibrator benefits from observing the model's behavior on out-of-domain data, even if from a different domain than the test data. We combine this method with a SQuAD-trained QA model and evaluate on mixtures of SQuAD and five other QA datasets. Our method answers 56% of questions while maintaining 80% accuracy; in contrast, directly using the model's probabilities only answers 48% at 80% accuracy.

研究の動機と目的

  • 実世界の展開において一般的なドメイン外(OOD)の入力におけるQAモデルの誤りを解決する。
  • 標準の信頼度推定が失敗するOODデータにおいて、特に不確実性がある場合にモデルが応答を避けることによる選択的予測を改善する。
  • わずかな量の既知のOODデータのみを用いて、未知のOOD分布に一般化可能なフレームワークを開発する。
  • 既知のOODデータから訓練されたキャリブレータが、テスト時のOOD分布とは異なる場合でも、OODデータの分布とは異なるデータから訓練された場合でも、標準のベースラインを上回る性能を示すことを示す。
  • ドメイン内とOODの入力が混在する状況を的確に処理できる実用的なソリューションを、実世界のQAシステムに提供する。

提案手法

  • SQuADなどのドメイン内データに限定して訓練することで、ベースモデルを構築する。
  • ドメイン内および既知のOODデータの混合データ上で、別個のキャリブレータ(ランダムフォレスト分類器)を訓練し、特定の入力に対してQAモデルが正しく予測する可能性を予測する。
  • モデルのソフトマックス出力と入力特徴量をキャリブレータの入力とし、予測誤差確率に基づいて応答を避けるためのしきい値を学習する。
  • ドメイン内と未知のOODデータの均一混合からなるテストセットに、キャリブレートされたシステムを適用し、キャリブレータが高い誤差確率を予測した場合にはモデルが応答を避ける。
  • 80%の精度を維持しつつ、カバレッジを最大化するように応答を避けるしきい値を最適化する。
  • テスト時のOODが未知であっても、テストOODとは異なる分布からの既知のOODデータを用いることで、一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1既知のOODデータ上で訓練されたキャリブレータは、未知のOODデータにおける選択的予測性能を向上させることができるか?
  • RQ2OOD入力におけるモデルの過信が、MaxProbのような標準的な信頼度ベースの応答回避手法にどのように影響を与えるか?
  • RQ3テストデータとは異なる分布からのOODデータを用いても、ドメインシフト設定下でキャリブレータの性能が向上するか?
  • RQ4ドメイン内とOODデータの比率が変化する状況下で、キャリブレータとMaxProbの性能はどのように比較されるか?
  • RQ5テスト分布が未知で、かつトレーニング時のOODデータとは異なる場合に、キャリブレータはどの程度一般化できるか?

主な発見

  • 提案されたキャリブレータは、SQuADと未知のOODデータの混合テストセットにおいて、80%の精度で56.1%のカバレッジを達成した。これはMaxProbが同じ精度で達成する48.2%のカバレッジよりも顕著に優れている。
  • MaxProbはドメイン内データのみで動作する場合にはうまく機能するが、混合状況ではOOD入力におけるモデルの過信のため、性能が著しく低下する。
  • ドメイン内と既知のOODデータの混合データ上でキャリブレータを訓練することで、未知のOOD分布への一般化性能が向上し、既知のOODデータがテスト時のOOD分布とは異なる場合でも有効である。
  • テストセットがドメイン内とOODデータのバランスの取れた混合状況である場合、キャリブレータはMaxProbを最も顕著に上回る。性能の差は、純ドメイン内または純OODの極端な状況では縮小する。
  • 未知のOODデータへのアクセスがあるテストセットでは、キャリブレータのAUCが17.87であるのに対し、MaxProbは16.35であった。ただし、この設定は目的とはずれ、テスト時のOOD分布を事前に知っている前提である。
  • 本手法は分布シフトに対して頑健であり、未知のOODデータに対しても効果的に一般化する。OODデータが異なるドメインからでも、キャリブレーション信号として価値があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。