Skip to main content
QUICK REVIEW

[논문 리뷰] Visual correspondence-based explanations improve AI robustness and human-AI team accuracy

Giang Nguyen, Mohammad Reza Taesiri|arXiv (Cornell University)|2022. 07. 26.
Explainable Artificial Intelligence (XAI)인용 수 10
한 줄 요약

이 논문은 질의 이미지와 훈련 예제 간의 시각적 대응을 사용하여 예측 이전에 설명을 생성함으로써 AI의 강건성과 인간-AI 협업 정확도를 향상시키는 두 가지 자기 해석 가능한 이미지 분류기인 EMD-Corr와 CHM-Corr를 제안한다. 이 모델들은 ResNet-50과 kNN에 비해 분포 외(OOD) 데이터셋에서 +1에서 +4정도의 정확도 향상을 보이며, 인간 연구 결과에서는 이러한 설명이 인간의 의사결정을 크게 향상시켜 ImageNet과 CUB에서 개별적으로는 어느 한 쪽보다도 높은 보완적인 인간-AI 팀 정확도를 달성한다.

ABSTRACT

Explaining artificial intelligence (AI) predictions is increasingly important and even imperative in many high-stakes applications where humans are the ultimate decision-makers. In this work, we propose two novel architectures of self-interpretable image classifiers that first explain, and then predict (as opposed to post-hoc explanations) by harnessing the visual correspondences between a query image and exemplars. Our models consistently improve (by 1 to 4 points) on out-of-distribution (OOD) datasets while performing marginally worse (by 1 to 2 points) on in-distribution tests than ResNet-50 and a $k$-nearest neighbor classifier (kNN). Via a large-scale, human study on ImageNet and CUB, our correspondence-based explanations are found to be more useful to users than kNN explanations. Our explanations help users more accurately reject AI's wrong decisions than all other tested methods. Interestingly, for the first time, we show that it is possible to achieve complementary human-AI team accuracy (i.e., that is higher than either AI-alone or human-alone), in ImageNet and CUB image classification tasks.

연구 동기 및 목표

  • 예측 이전에 결정을 해석 가능한 방식으로 설명하는 자기 해석 가능한 이미지 분류기를 개발하여 강건성과 인간-AI 협업을 향상시키는 것.
  • 후행적 설명과 할당 지ap 등 기존 방법의 한계를 보완하기 위해 훈련 예제와의 시각적 대응에 기반한 결정을 마련하는 것.
  • 대응 기반 설명이 인간의 의사결정 정확도를 향상시키고, 더 뛰어난 인간-AI 팀 성능을 가능하게 하는지 평가하는 것.
  • 자기 해석 가능한 인간-AI 팀 정확도—즉, AI 전용 또는 인간 전용 성능을 초월하는 성능—가 이미지 분류에서 달성 가능한지 입증하는 것.
  • 얼굴 및 새 식별과 같은 실제 고위험 응용 분야에서 시각적 대응 설명의 실용성을 검증하는 것.

제안 방법

  • 모델들은 질의 이미지와의 이미지 수준 특성 유사도(ResNet-50 layer4 특성)를 기반으로 훈련 이미지를 우선 순위 정렬한다.
  • 그 후, 국소 이미지 패치 간의 시각적 대응을 측정하여 상위 50개 후보를 재순위 정렬한다.
  • 최종 예측은 재순위 정렬된 상위 20개 후보의 다수결 클래스를 취함으로써 이루어지며, 이들 또한 설명으로 기능한다.
  • 패치 수준의 대응을 계산하기 위해 지구 이동 거리(EMD)와 코사인 유사도를 사용하여 배경 특징보다 구조적 정렬을 강조한다.
  • 이 방법은 ImageNet과 CUB 데이터셋에 적용되며, 분포 내 및 여러 분포 외 벤치마크(예: ImageNet-R, ImageNet-Sketch, DAmageNet, 악성 패치 등)에서 평가된다.
  • ImageNet과 CUB에서 대규모 인간 연구를 수행하여 대응 기반 설명과 kNN 설명 간의 실용성을 비교하고, 인간 정확도와 팀 성능을 측정한다.

실험 결과

연구 질문

  • RQ1표준 모델인 ResNet-50과 kNN에 비해 대응 기반 설명이 분포 외(OOD) 데이터에서 AI 분류기의 강건성을 향상시키는가?
  • RQ2대응 기반 설명은 AI 보조 이미지 분류 작업에서 인간의 의사결정 정확도를 향상시키는가?
  • RQ3대응 기반 설명을 사용할 경우 인간-AI 팀이 개별적으로는 어느 한 쪽보다도 높은 정확도를 달성할 수 있는가?
  • RQ4설명의 품질이 악성 또는 모호한 입력 상황에서 AI 보조 인간 의사결정의 신뢰성에 어떤 영향을 미치는가?
  • RQ5AI 예측과 인간 판단을 융합할 때 최적의 인간-AI 팀 성능을 달성하기 위해 AI 신뢰도의 실용적 기준이 존재하는가?

주요 결과

  • EMD-Corr와 CHM-Corr는 분포 내 ImageNet에서 약간의 성능 저하(1~2점)를 보이며, ResNet-50과 kNN에 비해 분포 외(OOD) 데이터셋에서 1~4점의 정확도 향상을 보였다.
  • 대규모 인간 연구 결과, 대응 기반 설명은 kNN 설명보다 잘못된 AI 예측을 거부하는 데 있어 인간의 정확도가 유의미하게 높아졌다.
  • 대응 기반 설명을 사용한 인간-AI 팀 정확도는 ImageNet에서 AI 전용 및 인간 전용 정확도를 모두 초월하여 보완적인 성능을 보였다.
  • CUB에서는 인간-AI 팀 정확도도 개별 에이전트의 성능을 초월했지만, 개선 폭은 작았음(+0.02)으로, 이는 미세한 분류 과제에서도 방법의 유용성을 시사한다.
  • AI가 확신 있는 예측을 할 경우(신뢰도 ≥ T)와 인간이 나머지를 처리할 경우 최적의 인간-AI 팀 성능이 달성되었으며, 최적의 임계값 T*에서 팀 정확도가 최대가 되었다.
  • 연구 결과는 시각적 대응 설명이 할당 지도나 kNN 설명보다 인간의 의사결정 지원에 더 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.