Skip to main content
QUICK REVIEW

[論文レビュー] Visual correspondence-based explanations improve AI robustness and human-AI team accuracy

Giang Nguyen, Mohammad Reza Taesiri|arXiv (Cornell University)|Jul 26, 2022
Explainable Artificial Intelligence (XAI)被引用数 10
ひとこと要約

本稿では、照合画像とトレーニング例との間の視覚的対応関係を用いて予測の前に説明を生成することで、AIの頑健性と人間-AIチームの精度を向上させる、自己解釈可能な画像分類器 EMD-Corr と CHM-Corr を提案する。これらのモデルは、分布外(OOD)データにおいて ResNet-50 や kNN と比較して +1 から +4 の精度向上を達成し、人間の研究では説明が人間の意思決定を顕著に改善し、ImageNet や CUB において、AI と人間の両方が単独で行う場合よりも優れた補完的で人間-AIチームの精度を実現した。

ABSTRACT

Explaining artificial intelligence (AI) predictions is increasingly important and even imperative in many high-stakes applications where humans are the ultimate decision-makers. In this work, we propose two novel architectures of self-interpretable image classifiers that first explain, and then predict (as opposed to post-hoc explanations) by harnessing the visual correspondences between a query image and exemplars. Our models consistently improve (by 1 to 4 points) on out-of-distribution (OOD) datasets while performing marginally worse (by 1 to 2 points) on in-distribution tests than ResNet-50 and a $k$-nearest neighbor classifier (kNN). Via a large-scale, human study on ImageNet and CUB, our correspondence-based explanations are found to be more useful to users than kNN explanations. Our explanations help users more accurately reject AI's wrong decisions than all other tested methods. Interestingly, for the first time, we show that it is possible to achieve complementary human-AI team accuracy (i.e., that is higher than either AI-alone or human-alone), in ImageNet and CUB image classification tasks.

研究の動機と目的

  • 予測の前に意思決定を説明する自己解釈可能な画像分類器を開発し、頑健性と人間-AI協働を向上させること。
  • 後処理による説明やアトリビューションマップの限界を克服し、トレーニング例との視覚的対応に基づいて意思決定を根拠づけること。
  • 対応に基づく説明が人間の意思決定精度を向上させ、より優れた人間-AIチームパフォーマンスを実現するかどうかを評価すること。
  • 補完的で人間-AIチームの精度(AI 単独または人間単独のパフォーマンスを上回る)が、画像分類において達成可能であることを示すこと。
  • 顔認識や鳥類識別などの現実世界の高リスクなAI応用分野において、視覚的対応による説明の実用的価値を検証すること。

提案手法

  • モデルはまず、クエリ画像とトレーニング画像の間の画像レベル特徴類似度(ResNet-50 の layer4 特徴)に基づいて、トレーニング画像をランク付けする。
  • その後、局所的な画像パッチ間の視覚的対応関係を測定することで、上位50件の候補を再ランク付けする。
  • 最終的な予測は、再ランク付けされた上位20件の候補の多数決によって行われ、これらが同時に説明としても機能する。
  • パッチ単位の対応関係を計算する際、地球移動距離(EMD)とコサイン類似度を用い、背景特徴よりも構造的整合性を重視する。
  • 本手法は ImageNet および CUB データセットに適用され、分布内および複数の OOD ベンチマーク(ImageNet-R、ImageNet-Sketch、DAmageNet、および敵対的パッチを含む)での評価が行われた。
  • ImageNet および CUB における大規模な人間実験では、対応に基づく説明と kNN による説明の有効性を比較し、人間の精度とチームパフォーマンスを測定した。

実験結果

リサーチクエスチョン

  • RQ1標準的なモデル(ResNet-50 や kNN と比較して)分布外(OOD)データにおけるAI分類器の頑健性が、視覚的対応に基づく説明によって向上するか。
  • RQ2対応に基づく説明が、AI支援画像分類タスクにおける人間の意思決定精度を向上させるか。
  • RQ3対応に基づく説明を用いることで、人間-AIチームが補完的で高い精度(AI 単独または人間単独の精度を上回る)を達成できるか。
  • RQ4説明の質が、特に敵対的または曖昧な入力において、AI支援人間意思決定の信頼性にどのように影響するか。
  • RQ5AIの信頼度に実用的な閾値が存在し、AIの予測と人間の判断を組み合わせた場合に最適な人間-AIチームパフォーマンスが達成できるか。

主な発見

  • EMD-Corr と CHM-Corr は、分布内 ImageNet ではわずかに劣る(1–2ポイント)ものの、分布外(OOD)データにおいては ResNet-50 や kNN と比較して 1 から 4 ポイントの精度向上を達成した。
  • 大規模な人間実験において、対応に基づく説明は、kNN による説明と比較して、誤ったAI予測を人間がより顕著に拒否する精度が向上した。
  • 対応に基づく説明を用いた人間-AIチームの精度は、ImageNet において AI 単独および人間単独の精度を上回り、補完的パフォーマンスが実証された。
  • CUB においても、人間-AIチームの精度は両者単独の精度を上回ったが、改善幅は小さい(+0.02)ことから、微細分類においても本手法の有効性が示された。
  • AIが自信のある予測(信頼度 ≥ T)を出した場合に人間が残りのケースを処理することで、最適な人間-AIチームパフォーマンスが達成され、最適な閾値 T* でチーム精度が最大化された。
  • 本研究は、高リスクなAI応用分野における人間意思決定支援において、アトリビューションマップや kNN による説明よりも、視覚的対応による説明がより効果的であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。