[논문 리뷰] RISE: Randomized Input Sampling for Explanation of Black-box Models
RISE는 무작위로 마스킹된 입력을 이용해 블랙박스 이미지 분류기를 탐색하고 픽셀 단위의 saliency 맵을 구축하며, 자동 인과 메트릭(삭제/삽입) 및 인간 중심의 가리키기 게임으로 평가된다.
Deep neural networks are being used increasingly to automate data analysis and decision making, yet their decision-making process is largely unclear and is difficult to explain to the end users. In this paper, we address the problem of Explainable AI for deep neural networks that take images as input and output a class probability. We propose an approach called RISE that generates an importance map indicating how salient each pixel is for the model's prediction. In contrast to white-box approaches that estimate pixel importance using gradients or other internal network state, RISE works on black-box models. It estimates importance empirically by probing the model with randomly masked versions of the input image and obtaining the corresponding outputs. We compare our approach to state-of-the-art importance extraction methods using both an automatic deletion/insertion metric and a pointing metric based on human-annotated object segments. Extensive experiments on several benchmark datasets show that our approach matches or exceeds the performance of other methods, including white-box approaches. Project page: http://cs-people.bu.edu/vpetsiuk/rise/
연구 동기 및 목표
- 비전 과제에서 심층 신경망을 블랙박스 의사결정자로서 설명할 필요성을 동기 부여한다.
- 모델 내부에 접근할 필요 없이 일반적인 블랙박스 saliency 방법을 제안한다.
- 자동 인과 메트릭과 인간 중심 메트릭을 사용하여 saliency 품질을 정량적으로 평가한다.
- 여러 데이터세트와 기본 아키텍처에 대한 적용 가능성을 보여준다.
- RISE가 이미지 캡션 모델의 설명으로 확장될 수 있음을 보여준다.
제안 방법
- 랜덤 이진 마스크를 생성하고 이를 업샘플링하여 입력 이미지를 요소별 마스킹으로 교란한다.
- 가중치 합으로 saliency 맵을 계산하는데, 가중치는 마스킹된 입력에서 기본 모델의 출력 점수이다.
- N개의 랜덤 마스크의 몬테카를로 샘플링으로 saliency 맵을 추정하고, f(I ⊙ M_i) · M_i의 평균으로, E[M]로 스케일링한다.
- 양선형 보간으로 업샘플링하고 임의의 공간적 이동으로 매끄럽고 견고한 마스크를 생성한다.
- saliency 맵에 따라 픽셀이 제거되거나 추가될 때 클래스 확률이 얼마나 떨어지거나 상승하는지 측정하는 삭제 및 삽입 메트릭으로 설명을 평가한다.
- 데이터세트(PASCAL VOC07, MSCOCO2014, ImageNet) 전반에서 화이트박스 및 다른 블랙박스 방법과 비교한다.
실험 결과
연구 질문
- RQ1그래디언트나 내부 정보를 얻지 못하는 완전한 블랙박스 접근법이 이미지 분류기에 대해 픽셀 수준의 신뢰할 수 있는 설명을 만들 수 있는가?
- RQ2학습된 마스크 가중치와 결합된 무작위 입력 마스크가 화이트박스 방법과 비교해 경쟁력 있는 saliency 맵을 제공하는가?
- RQ3삭제/삽입 메트릭이 다양한 아키텍처와 데이터셋에서 설명의 인과적 품질을 어떻게 반영하는가?
- RQ4RISE가 분류 작업을 넘어 캡션 생성 모델에 적용될 수 있는가?
주요 결과
- RISE는 ImageNet에서 ResNet50 및 VGG16과 함께 여러 베이스라인보다 삭제 및 삽입 점수에서 더 나은 성능을 보인다(삭제는 낮을수록, 삽입은 높을수록 좋다).
- ResNet50의 삭제 점수는 0.1076±0.0005이고 삽입은 0.7267±0.0006; VGG16의 경우 삭제 0.0980±0.0025 및 삽입 0.6663±0.0014.
- 보고된 지표에서 Grad-CAM보다 ImageNet에서 더 나은 성능을 보이나 여전히 베이스 모델 내부 정보를 필요로 하지 않는 블랙박스 방법이다.
- VOC MSCOCO에서 RISE는 다른 블랙박스 방법에 비해 가리키기 게임 정확도가 우수하며 화이트박스 접근 방식과 대등하다.
- RISE는 마스킹된 입력을 통해 단어 수준 saliency를 평가함으로써 이미지 캡션 모델의 설명으로 확장 가능하다.
- 이 방법은 여러 실행에서 견고하며(3회 실행의 평균±표준편차로 보고).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.