[論文レビュー] Explaining Predictive Uncertainty by Looking Back at Model Explanations
本論文は、予測不確実性を事前学習された言語モデルで説明するための手法を提案する。具体的には、予測の信頼性に悪影響を及げるが、標準的な説明手法では無視されがちな「不確実な語」を同定する。既存のモデル説明(例:Leave-one-out や Sampling Shapley を用いて)からこれらの語を抽出することで、予測がなぜ不確実であるかを明らかにし、実験と人間評価を通じて、不確実性の説明が包括的なモデルの解釈可能性とユーザーの信頼を高めるために不可欠であることを示している。
Predictive uncertainty estimation of pre-trained language models is an important measure of how likely people can trust their predictions. However, little is known about what makes a model prediction uncertain. Explaining predictive uncertainty is an important complement to explaining prediction labels in helping users understand model decision making and gaining their trust on model predictions, while has been largely ignored in prior works. In this work, we propose to explain the predictive uncertainty of pre-trained language models by extracting uncertain words from existing model explanations. We find the uncertain words are those identified as making negative contributions to prediction labels, while actually explaining the predictive uncertainty. Experiments show that uncertainty explanations are indispensable to explaining models and helping humans understand model prediction behavior.
研究の動機と目的
- 事前学習された言語モデルにおける予測不確実性の説明が不足している現状に鑲って、それがユーザーの信頼に与える重要性を踏まえ、その問題を解決すること。
- 予測の信頼性に悪影響を及げる語が、不確実性の原因として同定可能かどうかを調査すること。
- ラベルに関する説明だけでは不十分であり、不確実性の説明がモデルの挙動を理解するために不可欠であることを実証すること。
- 人間評価とモデルの性能指標を用いて、不確実性の説明の有効性を評価すること。
- ラベルに関連する(重要である)語と不確実性に関連する(不確実な)語を統合した包括的な説明フレームワークを提案すること。
提案手法
- Leave-one-out (LOO) および Sampling Shapley (SS) の2つの手法を用いて、顕著なトークンを同定するモデルの説明を抽出する。
- 予測ラベルに負の寄与を示すが、予測信頼性の低下に大きな影響を与える語を「不確実な語」として同定する。
- 局所モデル解釈可能性(LMI)スコアを用いて不確実性の説明を定義し、高い負の LMI 値を示すトークンを不確実な語としてマークする。
- トークンごとの LMI スコアを正規化して分布を作成し、信頼性低下に寄与する負の寄与が顕著な上位の不確実な語を選別する。
- 不確実な語の削除に伴う信頼性の変化(例:69% から 93% への上昇)を、不確実性の説明の質の代理指標として用いる。
- Amazon Mechanical Turk を用いて、重要語および不確実な語の両方について人間評価を実施し、予測の正確性、説明の質、相対的な有用性を評価する。
実験結果
リサーチクエスチョン
- RQ1既存のモデル説明から、信頼性の低下に寄与する「不確実な語」を信頼性を持って同定できるか?
- RQ2LOO および Sampling Shapley は、予測不確実性を説明する不確実な語をどれほど効果的に同定できるか?
- RQ3ラベルの説明だけではなく、不確実性の説明を加えることで、人間のモデル予測理解はどの程度向上するか?
- RQ4不確実な語を削除することで、モデルの信頼性が顕著に向上するか?これにより、それらが不確実性の原因であることが裏付けられるか?
- RQ5ユーザーがモデルの挙動を解釈するのを助ける観点から、不確実性の説明はラベルの説明よりも有用性が高いか?
主な発見
- 予測ラベルに負の寄与を示す「不確実な語」は、モデルの信頼性を顕著に低下させ、予測不確実性を説明する上で中心的な役割を果たす。
- 実験の結果、ある例では不確実な語を削除することで予測信頼性が 69% から 93% に上昇し、それらが不確実性の原因であることが裏付けられた。
- 人間評価の結果、不確実性の説明は不可欠であることが確認された。被験者の85%が、不確実な語の削除に伴う信頼性の変化を正しく予測した。
- 平均して、不確実性の説明は明確さと有用性の観点で 4.2/5 の評価を得ており、ラベルの説明と比較して優れた評価を受けていた。
- LMI を用いた手法は、不確実な語を効果的に同定できており、LMI 分布の上位10語は常に信頼性低下に負の影響を示していた。
- LOO および Sampling Shapley の両手法とも、意味のある不確実性の説明を効果的に抽出できたが、SS は複数のデータセットにわたる一貫性がわずかに優れていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。