Skip to main content
QUICK REVIEW

[論文レビュー] VisFIS: Visual Feature Importance Supervision with Right-for-the-Right-Reason Objectives

Zhuofan Ying, Peter Hase|arXiv (Cornell University)|Jun 22, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

VisFISは、十分性、不確実性、不変性、妥当性の4つの主要な目的を最適化することで、VQAモデルの精度と推論の頑健性を向上させる、画用力重要度の監視フレームワークを提案する。このフレームワークは、分布内および分布外のVQAベンチマークで強力なベースラインを上回り、正確で妥当な説明のおかげで性能向上が達成されていることが示された。妥当性のみによる向上ではない。

ABSTRACT

Many past works aim to improve visual reasoning in models by supervising feature importance (estimated by model explanation techniques) with human annotations such as highlights of important image regions. However, recent work has shown that performance gains from feature importance (FI) supervision for Visual Question Answering (VQA) tasks persist even with random supervision, suggesting that these methods do not meaningfully align model FI with human FI. In this paper, we show that model FI supervision can meaningfully improve VQA model accuracy as well as performance on several Right-for-the-Right-Reason (RRR) metrics by optimizing for four key model objectives: (1) accurate predictions given limited but sufficient information (Sufficiency); (2) max-entropy predictions given no important information (Uncertainty); (3) invariance of predictions to changes in unimportant features (Invariance); and (4) alignment between model FI explanations and human FI explanations (Plausibility). Our best performing method, Visual Feature Importance Supervision (VisFIS), outperforms strong baselines on benchmark VQA datasets in terms of both in-distribution and out-of-distribution accuracy. While past work suggests that the mechanism for improved accuracy is through improved explanation plausibility, we show that this relationship depends crucially on explanation faithfulness (whether explanations truly represent the model's internal reasoning). Predictions are more accurate when explanations are plausible and faithful, and not when they are plausible but not faithful. Lastly, we show that, surprisingly, RRR metrics are not predictive of out-of-distribution model accuracy when controlling for a model's in-distribution accuracy, which calls into question the value of these metrics for evaluating model reasoning. All supporting code is available at https://github.com/zfying/visfis

研究の動機と目的

  • 従来の特徴量重要度(FI)監視には、ランダムな監視でも同程度の向上が得られるため、人間のアノテーションと意味的に整合しないという限界があることを是正する。
  • 十分性、不確実性、不変性、妥当性の4つの主要なモデル目的を最適化することで、モデルの精度と推論の頑健性を向上させる。
  • 正しい理由で正しい(RRR)指標が、分布外一般化性能を信頼性高く予測できるかどうかを調査する。
  • 説明の妥当性と忠実性の関係が、データポイントレベルでのモデル精度にどのように影響するかを検討する。
  • FI監視が主に忠実かつ妥当な説明をもたらすことで精度が向上することを示す。妥当性のみによる向上ではない。

提案手法

  • 4つの目的(1)十分性—重要な特徴量のみで正確な予測が得られること、(2)不確実性—重要な特徴量が存在しない場合に最大エントロピーの出力を得ること、(3)不変性—重要な特徴量以外の摂動に対して予測が安定すること、(4)妥当性—モデルが生成する特徴量重要度と人間アノテーションの一致度が高まることを同時に最適化するマルチ目的学習フレームワークを導入する。
  • 訓練中に十分性と不確実性のシナリオを再現するため、マスクされた画像領域(Replaced)を用いたデータ拡張を実施する。
  • 勾配ベースの説明手法(例:Grad-CAM)を用いてモデルが生成する特徴量重要度を推定し、人間アノテーションからの逸脱を正則化項(コントラスト型またはL2損失)でペナルティ付ける。
  • 4つの目的の重み付き組み合わせを用いてモデルを訓練し、トレードオフをバランスさせるハイパーパrameterを調整する。
  • CLEVR-XAI、VQA-HAT、GQAのデータセットを活用し、分布内および分布外の設定で性能を評価する。
  • 交差検証と再サンプリングを用いて、RRR指標が分布外一般化性能をどの程度予測できるかを評価する。

実験結果

リサーチクエスチョン

  • RQ1意味的でない(ランダムな)監視ではなく、意味的で明確な特徴量重要度監視がVQAモデルの精度向上に寄与するか?
  • RQ2十分性、不確実性、不変性、妥当性という4つの目的が、モデル性能と推論の整合性にどの程度寄与するか?
  • RQ3説明の妥当性が向上するだけで精度が向上するのか、それとも忠実性も必要か?
  • RQ4分布内精度を制御した場合、RRR指標(RRR-Suff、RRR-Inv、RRR-Unc)は分布外一般化性能を予測できるか?
  • RQ5異なるモデルやデータポイントの設定において、妥当性、忠実性、精度の関係はどのように変化するか?

主な発見

  • VisFISはVQA-HATで最先端の性能を達成し、分布内精度52.79%、分布外精度40.49%を記録。強力なベースラインを上回った。
  • ランダムな監視では同様の向上が再現されないため、VisFISは人間アノテーションの特徴量重要度から意味的な信号を学習していることが確認された。
  • 説明が忠実かつ妥当な場合にのみ、モデル精度が顕著に向上する。単に妥当性が高いだけでは不十分であり、忠実性が信頼できる推論に不可欠であることが示された。
  • RRR指標(RRR-Suff、RRR-Inv、RRR-Unc)は、分布内精度のみを考慮した場合に比べて、分布外精度をよりよく予測しない。これにより、これらの指標が一般化性能の代理指標としての有効性に疑問が呈された。
  • 平均妥当性が低いモデルでも、低妥当性のデータポイントで高い忠実性を維持することで高い精度を達成できる。一方、高妥当性のモデルは一部のデータポイントで忠実性が低く、その影響で性能向上が相殺される。
  • 十分性+不確実性の組み合わせが、十分性と包括性のバランスにおいて最良のトレードオフを実現し、Saliency-Guided Trainingなどの先行手法に比べて優れた説明可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。