Skip to main content
QUICK REVIEW

[論文レビュー] Can Explanations Be Useful for Calibrating Black Box Models?

Xi Ye, Greg Durrett|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling被引用数 5
ひとこと要約

この論文では、モデルの帰属割り当てと人間が考案したヒューリスティックを用いて、パラメータの更新なしにブラックボックスNLPモデルのドメイン外データにおける性能を向上させるキャリブレーション手法を提案する。LIME や SHAP の帰属割り当てとタスク固有の特徴を組み合わせることで、単純な分類器がモデルの正しさを予測し、選択的質問応答において最先端の性能を達成し、一部の状況では微調整を上回ることを示している。説明がモデルのキャリブレーションを顕著に向上させることを示している。

ABSTRACT

NLP practitioners often want to take existing trained models and apply them to data from new domains. While fine-tuning or few-shot learning can be used to adapt a base model, there is no single recipe for making these techniques work; moreover, one may not have access to the original model weights if it is deployed as a black box. We study how to improve a black box model's performance on a new domain by leveraging explanations of the model's behavior. Our approach first extracts a set of features combining human intuition about the task with model attributions generated by black box interpretation techniques, then uses a simple calibrator, in the form of a classifier, to predict whether the base model was correct or not. We experiment with our method on two tasks, extractive question answering and natural language inference, covering adaptation from several pairs of domains with limited target-domain data. The experimental results across all the domain pairs show that explanations are useful for calibrating these models, boosting accuracy when predictions do not have to be returned on every example. We further show that the calibration model transfers to some extent between tasks.

研究の動機と目的

  • 微調整が不可能な(モデル重みが入手できない)新しいドメインにブラックボックスNLPモデルを導入する課題に対処すること。
  • 特徴帰属割り当てを用いたモデルの説明が、ドメイン外データにおけるブラックボックスモデルのキャリブレーションを向上させることを調査すること。
  • モデルパラメータにアクセスせずに、人間の直感とモデルレベルの帰属割り当てを組み合わせて、モデルの正しさを予測するキャリブレータを開発すること。
  • 特に選択的予測設定において、キャリブレータのドメインおよびタスクへの一般化性能を評価すること。

提案手法

  • この手法は、LIME や SHAP を用いて、各トークンの予測への重要性を定量化する帰属スコアと、それらのトークンを抽出する。
  • 人間が特定したヒューリスティック(例:固有名詞や動詞の有無)と、それらのトークンの帰属スコアを組み合わせた特徴の集合を構築する。
  • ターゲットドメインからのラベル付き例の小さな集合を用いて、ブラックボックスモデルの予測が正しいかどうかを予測する二値分類器(キャリブレータ)を学習する。
  • 標準的および選択的質問応答設定の両方でキャリブレータを評価し、キャリブレータが信頼できると判断した予測のみを保持する。
  • モデルの信頼度スコアに依存せず、インスタンス固有の説明を活用して、モデルの信頼性を推定するメタラーナーを構築する。
  • この手法は、5つのソース・ターゲットドメインペアにおいて、抽出的質問応答と自然言語推論の2つのタスクで評価される。

実験結果

リサーチクエスチョン

  • RQ1ブラックボックスモデルの帰属割り当てから得られる説明は、ドメイン外データにおけるモデルのキャリブレーションを向上させることができるか?
  • RQ2人間が特定したヒューリスティックとモデルの帰属割り当てを組み合わせることで、説明を用いないベースラインと比較して、キャリブレータの性能が向上するか?
  • RQ3再トレーニングなしに、訓練済みキャリブレータは新しいドメインやタスクに一般化できるか?
  • RQ4選択的予測設定において、説明に基づくキャリブレータは、既存の手法に比べて信頼できる予測を識別する上で優れているか?

主な発見

  • 説明に基づくキャリブレータ(LimeCal)は、抽出的質問応答および自然言語推論の両タスクにおいて、全5つのドメインペアでベースラインを一貫して上回る性能を示した。
  • 選択的QA設定では、LimeCalがすべての手法の中で最高の性能を達成し、特に Squad-Adv がOOD分布として用いられた場合に顕著に優れた結果を示した。
  • 一部の設定では、説明に基づくキャリブレータが、モデルパラメータに完全にアクセス可能な微調整よりも優れた性能を示した。
  • キャリブレータは転送性を示した:あるドメインで訓練されたモデルが、別のドメインに一般化可能であり、学習されたヒューリスティックがドメインを越えて堅牢であることを示している。
  • ベースモデルがドメイン外の例で失敗しても、この手法は正しく予測されたものを高い正確性で特定することで、モデルの信頼性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。