Skip to main content
QUICK REVIEW

[논문 리뷰] A Human-Grounded Evaluation Benchmark for Local Explanations of Machine Learning

Sina Mohseni, Eric D. Ragan|arXiv (Cornell University)|2018. 01. 16.
Explainable Artificial Intelligence (XAI)참고 문헌 30인용 수 46
한 줄 요약

다층 인간 주의 벤치마크를 도입하여 모델 saliency 설명을 정량적으로 평가하고, Grad-CAM과 LIME 설명을 사용해 다층 인간 주의 마스크를 분할 마스크 및 인간 판단과 비교한다.

ABSTRACT

Research in interpretable machine learning proposes different computational and human subject approaches to evaluate model saliency explanations. These approaches measure different qualities of explanations to achieve diverse goals in designing interpretable machine learning systems. In this paper, we propose a human attention benchmark for image and text domains using multi-layer human attention masks aggregated from multiple human annotators. We then present an evaluation study to evaluate model saliency explanations obtained using Grad-cam and LIME techniques. We demonstrate our benchmark's utility for quantitative evaluation of model explanations by comparing it with human subjective ratings and ground-truth single-layer segmentation masks evaluations. Our study results show that our threshold agnostic evaluation method with the human attention baseline is more effective than single-layer object segmentation masks to ground truth. Our experiments also reveal user biases in the subjective rating of model saliency explanations.

연구 동기 및 목표

  • 로컬 설명 방법의 객관적이고 인간 기반 평가의 필요성을 촉진한다.
  • saliency 설명의 기준 진실(Ground Truth)으로서 다층 인간 주의 벤치마크를 제안한다.
  • 이미지와 텍스트 도메인 전반에 걸친 saliency 방법의 빠르고 재현 가능하며 객관적인 평가를 가능하게 한다.

제안 방법

  • 이미지와 텍스트의 샘플당 10명의 주석자들로부터 다층 인간 주의 마스크를 수집한다.
  • 영역/단어의 합집합을 통해 주석을 집계하여 다층 마스크를 형성한다.
  • 임계값을 설정하지 않고 픽셀 단위 MAE를 사용하여 Grad-CAM과 LIME saliency maps를 세 가지 기준선과 비교한다.
  • 이미지의 경우 대상 픽셀을 고립시키기 위해 정확한 분할 마스크를 사용해 배경을 선택적으로 마스킹한다.
  • 참여자 연구를 수행하여 기준 진실과 주관적 평가를 비교한다.
  • 설명 오류의 유형을 이해하기 위해 FP 및 FN 오류를 분리 분석한다.

실험 결과

연구 질문

  • RQ1다층 인간 주의 벤치마크가 단층 분할 마스크와 차이가 있는 객관적 기준 진실을 제공하는가?
  • RQ2Grad-CAM과 LIME saliency maps가 서로 다른 기준 진실(인간 주의 vs 분할) 및 인간 판단에 대해 어떻게 평가되는가?
  • RQ3saliency 설명에 대한 주관적 평가에서 어떤 편향이 존재하며, FP 대 FN 오류가 평가에 어떤 영향을 미치는가?
  • RQ4기준 진실 벤치마크와 주관적 평가 간의 일치 또는 불일치 측면에서의 관계는 무엇인가?

주요 결과

  • 다층 인간 주의 벤치마크는 분할 기반의 기준 진실과 상관관계가 있었지만 FN 오류 처리에서 차이가 나타났으며, 이는 더 높은 세분성과 잠재적 위음성(false negatives)을 시사한다.
  • 주관적 인간 평가는 두 기준 진실 모두와 다르게 나타나며, 설명 및 평가에 측정 가능한 편향을 보여준다.
  • 인간 주의 마스크를 포함한 기준 진실은 임계값에 의존하지 않는 MAE 평가를 제공하여 이진 마스크 생성을 필요로 하지 않으며 단층 마스크를 넘어서는 세분화를 제공한다.
  • LIME 설명은 Grad-CAM 설명과 다른 사용자 반응을 이끌어내어 시각적 외관이 판단에 미치는 영향을 드러낸다.
  • 사용자는 FP 오류에 대한 민감도가 낮고 FN 오류에 더 민감하게 반응하는 경향을 보였으며, 이는 전경 커버리지 불완전이 설명 품질 인식에 영향을 미친다는 것을 시사한다.
  • 본 연구는 객관적 기준 진실과 주관적 판단이 달라질 수 있음을 보여주어 보완적 평가 접근의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.