Skip to main content
QUICK REVIEW

[논문 리뷰] VisFIS: Visual Feature Importance Supervision with Right-for-the-Right-Reason Objectives

Zhuofan Ying, Peter Hase|arXiv (Cornell University)|2022. 06. 22.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

VisFIS는 네 가지 핵심 목표인 충분성, 불확실성, 불변성, 타당성을 동시에 최적화함으로써 VQA 모델의 정확도와 추론의 강인성을 향상시키는 새로운 시각적 특징 중요도 감독 프레임워크를 제안한다. 이는 분포 내 및 분포 외 VQA 벤치마크에서 강력한 베이스라인을 능가하며, 타당성만 있는 것이 아니라 진정성 있는 설명 덕분에 성능 향상이 이루어진다.

ABSTRACT

Many past works aim to improve visual reasoning in models by supervising feature importance (estimated by model explanation techniques) with human annotations such as highlights of important image regions. However, recent work has shown that performance gains from feature importance (FI) supervision for Visual Question Answering (VQA) tasks persist even with random supervision, suggesting that these methods do not meaningfully align model FI with human FI. In this paper, we show that model FI supervision can meaningfully improve VQA model accuracy as well as performance on several Right-for-the-Right-Reason (RRR) metrics by optimizing for four key model objectives: (1) accurate predictions given limited but sufficient information (Sufficiency); (2) max-entropy predictions given no important information (Uncertainty); (3) invariance of predictions to changes in unimportant features (Invariance); and (4) alignment between model FI explanations and human FI explanations (Plausibility). Our best performing method, Visual Feature Importance Supervision (VisFIS), outperforms strong baselines on benchmark VQA datasets in terms of both in-distribution and out-of-distribution accuracy. While past work suggests that the mechanism for improved accuracy is through improved explanation plausibility, we show that this relationship depends crucially on explanation faithfulness (whether explanations truly represent the model's internal reasoning). Predictions are more accurate when explanations are plausible and faithful, and not when they are plausible but not faithful. Lastly, we show that, surprisingly, RRR metrics are not predictive of out-of-distribution model accuracy when controlling for a model's in-distribution accuracy, which calls into question the value of these metrics for evaluating model reasoning. All supporting code is available at https://github.com/zfying/visfis

연구 동기 및 목표

  • 사람의 애너테이션과 의미적으로 일치하지 않을 수 있는 무작위 감독으로 인해 유사한 성과를 내는 기존 특징 중요도(FI) 감독의 한계를 해결한다.
  • 충분성, 불확실성, 불변성, 타당성의 네 가지 핵심 모델 목표를 최적화하여 모델의 정확도와 추론 강인성을 향상시킨다.
  • 우리가 '옳은 이유로 옳은'지(Reasoning Right-for-the-Right-Reason, RRR)를 예측하는 데에 RRR 지표가 분포 외 일반화 성능을 신뢰성 있게 예측할 수 있는지 조사한다.
  • 데이터 포인트 수준에서 설명의 타당성과 진정성 간의 상호작용이 모델 정확도에 어떻게 영향을 주는지 분석한다.
  • 특징 중요도 감독이 정확도를 향상시키는 데 주로 진정성 있고 타당한 설명 덕분이지, 타당성만으로는 성능 향상이 이루어지지 않음을 입증한다.

제안 방법

  • 다중 목표 학습 프레임워크를 도입하여 다음 네 가지를 동시에 최적화한다: (1) 충분성—중요한 특징만으로 정확한 예측을 수행하는 것; (2) 불확실성—중요하지 않은 특징만 존재할 때 최대 엔트로피 출력을 내는 것; (3) 불변성—중요하지 않은 특징의 변형에 대해 예측이 안정적인 것; (4) 타당성—모델이 생성한 특징 중요도와 인간 애너테이션 간의 일치도.
  • 학습 중 충분성과 불확실성 시나리오를 시뮬레이션하기 위해 마스킹된 이미지 영역(Replaced)을 활용한 데이터 증강 기법을 사용한다.
  • 기울기 기반 설명 방법(예: Grad-CAM)을 적용하여 모델이 생성한 특징 중요도를 추정하고, 인간 애너테이션과의 편차를 대비해 대비 손실 또는 L2 손실을 통해 페널티를 적용한다.
  • 네 가지 목표의 가중 조합을 사용하여 모델을 학습하고, 상호 간의 트레이드오프를 균형 잡기 위해 하이퍼파rameter를 조정한다.
  • CLEVR-XAI, VQA-HAT, GQA 데이터셋을 활용하여 분포 내 및 분포 외 설정에서의 성능을 평가한다.
  • 교차 검증과 재표본 추출을 통해 RRR 지표가 OOD 일반화 성능을 예측하는 데의 능력을 평가한다.

실험 결과

연구 질문

  • RQ1의미 있는 감독(무작위가 아님)을 통해 특징 중요도 감독이 VQA 모델의 정확도를 향상시킬 수 있는가?
  • RQ2충분성, 불확실성, 불변성, 타당성의 네 목표가 함께 모델 성능과 추론 정밀도를 얼마나 향상시키는가?
  • RQ3타당성만 향상된다고 해서 정확도가 높아지는가, 아니면 진정성도 동반되어야 하는가?
  • RQ4분포 내 정확도를 제어할 때 RRR 지표들(예: RRR-Suff, RRR-Inv, RRR-Unc)이 분포 외 일반화 성능을 분포 내 성능보다 더 잘 예측할 수 있는가?
  • RQ5다양한 모델 및 데이터 포인트 설정에서 타당성, 진정성, 정확도 간의 관계는 어떻게 변화하는가?

주요 결과

  • VisFIS는 VQA-HAT에서 최신 기준 성능을 달성하여 분포 내 정확도 52.79%와 분포 외 정확도 40.49%를 기록하며 강력한 베이스라인을 능가한다.
  • 무작위 감독을 사용할 경우 성능 향상이 재현되지 않아, VisFIS가 인간 애너테이션 기반 특징 중요도에서 의미 있는 신호를 학습하고 있음을 확인한다.
  • 설명이 타당성과 진정성 모두에서 높을 때 모델 정확도가 크게 향상되며, 단지 타당성만 높은 경우는 성능 향상이 이루어지지 않아, 신뢰할 수 있는 추론을 위해 진정성이 필수적임을 입증한다.
  • RRR 지표들(예: RRR-Suff, RRR-Inv, RRR-Unc)은 분포 내 정확도만 고려할 경우보다 분포 외 정확도를 더 잘 예측하지 못하며, 이는 일반화 예측 지표로서의 유용성에 의문을 제기한다.
  • 낮은 평균 타당성이라도 높은 진정성을 유지하는 모델은 높은 정확도를 달성할 수 있으며, 반대로 높은 타당성 모델은 일부 데이터 포인트에서 낮은 진정성을 보이며 성능 향상이 상쇄된다.
  • 충분성 + 불확실성 목표 조합이 충분성과 포괄성 간의 최적의 트레이드오프를 이룹니다. 이는 이전 방법들(예: Saliency-Guided Training)에 비해 훨씬 뛰어난 설명 가능성과 성능을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.