Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Attention-Model Explainability through Faithfulness Violation Test

Yibing Liu, Haoliang Li|arXiv (Cornell University)|2022. 01. 28.
Explainable Artificial Intelligence (XAI)인용 수 12
한 줄 요약

이 논문은 주어진 입력 특징이 모델 예측에 기여하는지 또는 억제하는지를 올바르게 반영하는지 여부를 평가하기 위해 민감도 일致성(폴라리티 일치성)을 기반으로 한 충실도 위반 테스트를 제안한다. 이 방법은 대부분의 주로 주의 메커니즘 기반 설명 방법, 특히 원시 주의(attention)가 높은 충실도 위반을 겪고 있음을 드러내며, 기울기 기반 방법(예: Attention ⊙ Gradient)은 상대적으로 낮은 위반 비율을 보임으로써 설명의 신뢰성 평가에서 폴라리티 일치성을 우선 고려해야 함을 시사한다.

ABSTRACT

Attention mechanisms are dominating the explainability of deep models. They produce probability distributions over the input, which are widely deemed as feature-importance indicators. However, in this paper, we find one critical limitation in attention explanations: weakness in identifying the polarity of feature impact. This would be somehow misleading -- features with higher attention weights may not faithfully contribute to model predictions; instead, they can impose suppression effects. With this finding, we reflect on the explainability of current attention-based techniques, such as Attentio$\odot$Gradient and LRP-based attention explanations. We first propose an actionable diagnostic methodology (henceforth faithfulness violation test) to measure the consistency between explanation weights and the impact polarity. Through the extensive experiments, we then show that most tested explanation methods are unexpectedly hindered by the faithfulness violation issue, especially the raw attention. Empirical analyses on the factors affecting violation issues further provide useful observations for adopting explanation methods in attention models.

연구 동기 및 목표

  • 기존의 충실도 평가 방법이 주의 기반 설명에서 폴라리티 일치성을 간과하는 심각한 격차를 보완하기 위해.
  • 설명 가중치가 입력 특징이 모델 예측에 기여하는지 또는 억제하는지를 정확히 반영하고 있는지 진단하기 위해.
  • 일반적으로 사용되는 설명 방법(예: Attention Rollout, LRP 기반 방법)이 이 새로운 기준 하에서 어떻게 성능을 보이는지 평가하기 위해.
  • 주의 기반 설명에서 충실도 위반이 발생하는 주요 아키텍처적 및 방법론적 요인을 규명하기 위해.
  • 충실도 있는 설명 방법의 설계 및 평가에 있어 폴라리티 일치성을 필수 기준으로 삼아야 한다는 주장을 펼치기 위해.

제안 방법

  • 최고의 주의 가중치의 부호가 해당 입력 특징의 실제 영향 방향(기여 또는 억제)을 정확히 반영하고 있는지 평가하는 진단용 충실도 위반 테스트를 제안한다.
  • 각 샘플에 대해 가장 큰 크기를 가진 주의 가중치를 식별하고, 그 부호가 실제 영향 방향과 일치하는지 확인한다. 이 방향은 상위 10퍼센트의 주의 가중치를 제거한 후의 신뢰도 변화를 통해 결정된다.
  • 신뢰도 변화량(ΔC)을 사용하여 고주의 영역 제거가 미치는 영향을 측정한다: ΔC < 0은 억제를 의미하고, ΔC > 0은 기여를 의미한다.
  • 여섯 가지 다양한 작업과 아홉 개인 데이터셋에서 원시 주의, Attention ⊙ Gradient, LRP 기반 변형 등 총 아홉 가지 설명 방법에 대해 테스트를 적용한다.
  • 외부 분포(Out-of-Distribution, OOD) 문제를 완화하기 위해 치환 함수를 활용하여 충실도 평가의 강건성을 확보한다.
  • 기존의 충실도 측정 지표와 비교하여, 이전 지표들은 폴라리티 불일치를 탐지하지 못함을 입증한다.

실험 결과

연구 질문

  • RQ1기존의 주의 기반 설명 방법이 얼마나 높은 정도로 특징 영향의 폴라리티를 유지하지 못하는가? 즉, 높은 주의 가중치가 해당 특징이 모델 예측에 기여하는지 또는 억제하는지를 정확히 반영하고 있는가?
  • RQ2제안된 충실도 위반 테스트는 기존의 충실도 평가 지표와 비교해 폴라리티 불일치를 얼마나 잘 탐지하는가?
  • RQ3어느 설명 방법이 가장 낮은 충실도 위반 비율을 보이며, 그 성능 향상에 기여하는 아키텍처적 또는 방법론적 요인은 무엇인가?
  • RQ4모델의 복잡도와 영향 폴라리티 식별 능력은 충실도 위반 발생 확률에 어떤 영향을 미치는가?
  • RQ5Attention ⊙ Gradient와 같은 기울기 기반 주의 설명 방법은 원시 주의나 LRP 기반 방법에 비해 충실도 위반을 줄일 수 있는가?

주요 결과

  • 원시 주의는 VQA v2.0 데이터셋에서 40%의 높은 충실도 위반 비율을 보이며, 이는 40퍼센트의 경우에서 고주의 영역이 모델의 신뢰도를 떨어뜨리는 억제 효과를 미치고 있음을 의미한다.
  • Attention ⊙ Gradient 방법은 Yelp에서 2%, AgNews에서 3%, VQA v2.0에서 6%의 위반 비율로 감소시켜 폴라리티 일치성에서 뚜렷한 향상을 보였다.
  • 절대 기울기 값 기반 방법(예: Attention ⊙ |∇α|)과 부호 기반 기울기 방법(예: Attention ⊙ sign(∇α))은 중간 정도의 향상을 보였으며, 각각 Yelp에서 15%, AgNews에서 7%, VQA에서 25%의 위반 비율을 기록했다.
  • 본 연구는 모델 아키텍처의 복잡도와 영향 폴라리티 식별 능력이 충실도 위반 빈도에 영향을 미치는 핵심 요인임을 발견했다.
  • 기존의 충실도 평가 지표는 폴라리티 불일치를 탐지하지 못하며, 이는 종합적인 평가를 위해 제안된 위반 테스트의 필요성을 강조한다.
  • 실험 결과는 심지어 중요도 상관관계가 높더라도 폴라리티 일치성을 유지하지 못하는 경우 설명 방법이 오해의 소지가 있음을 보여주며, VQA 데이터셋의 빨간 점 위반 사례에서 이를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.