Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Visually Explaining Similarity Models

Meng Zheng, Srikrishna Karanam|arXiv (Cornell University)|2020. 08. 13.
Data Visualization and Analytics참고 문헌 58인용 수 5
한 줄 요약

이 논문은 분류 헤드가 필요 없이 이미지 유사도 모델에 대한 기울기 기반 시각적 주의 메커니즘을 제안하여, 이미지 쌍이 왜 유사하다고 판단되는지 해석 가능한 설명을 가능하게 한다. 학습된 특징 임베딩을 활용해 유사도 주의 맵을 생성함으로써, 미분 가능한 제약 조건을 통해 모델 성능을 향상시키며, 검색, 재식별, 소수의 샘플 세그먼테이션 작업에서 기존의 기준 모델들을 능가한다.

ABSTRACT

We consider the problem of visually explaining similarity models, i.e., explaining why a model predicts two images to be similar in addition to producing a scalar score. While much recent work in visual model interpretability has focused on gradient-based attention, these methods rely on a classification module to generate visual explanations. Consequently, they cannot readily explain other kinds of models that do not use or need classification-like loss functions (e.g., similarity models trained with a metric learning loss). In this work, we bridge this crucial gap, presenting a method to generate gradient-based visual attention for image similarity predictors. By relying solely on the learned feature embedding, we show that our approach can be applied to any kind of CNN-based similarity architecture, an important step towards generic visual explainability. We show that our resulting attention maps serve more than just interpretability; they can be infused into the model learning process itself with new trainable constraints. We show that the resulting similarity models perform, and can be visually explained, better than the corresponding baseline models trained without these constraints. We demonstrate our approach using extensive experiments on three different kinds of tasks: generic image retrieval, person re-identification, and low-shot semantic segmentation.

연구 동기 및 목표

  • 분류 헤드나 손실 함수를 사용하지 않는 유사도 모델에서 시각적 설명 가능성의 부족을 해결한다.
  • 메트릭 학습 손실로 훈련된 유사도 모델을 위한 직관적인 기울기 기반 주의 맵을 개발한다.
  • 주의 맵을 훈련 가능한 제약 조건으로 통합하여 모델 성능을 향상시킬 수 있도록 한다.
  • 이 방법이 다양한 비전 작업, 예를 들어 소수의 샘플 세그먼테이션 및 인물 재식별 작업에 걸쳐 유연하게 적용될 수 있음을 보여준다.
  • 실제 응용 분야에서 비지도 대응 학습 및 제로/소수의 샘플 일반화를 위한 기반을 마련한다.

제안 방법

  • 분류 로그리트에 의존하지 않고 특징 임베딩 기울기에서 유도된 미분 가능한 활성화를 제안하여 주의 맵을 생성한다.
  • 유사도 주의를 두 개 이상의 이미지 간의 유사도 점수에 기여하는 영역을 강조하는 주의 맵의 집합으로 정의한다.
  • 입력 이미지의 공간 중요도 맵을 특징 임베딩을 통해 기울기 기반 역전파를 사용하여 계산한다.
  • 유사도 마이닝을 도입하여, 훈련 중에 주의 맵이 메트릭 학습 목표와 일치하도록 하는 미분 가능한 제약 조건을 강화한다.
  • 임베딩 거리 값을 목표로 삼아 컨볼루션 특징 맵에 대해 기울기를 계산함으로써, 시앙세이 및 트리플릿 네트워크에 이 방법을 적용한다.
  • 유사도 주의 맵을 정규화 신호로 훈련 과정에 통합하여 특징 학습을 정교화한다.

실험 결과

연구 질문

  • RQ1분류 헤드나 분류 손실이 없는 유사도 모델에 대해 기울기 기반 시각적 주의를 생성할 수 있는가?
  • RQ2기존의 GradCAM과 비교해 더 직관적이고 정확한 설명을 제공하는 주의 맵을 얻을 수 있는가?
  • RQ3유사도 주의 맵을 훈련 가능한 제약 조건으로 사용하여 유사도 모델의 성능을 향상시킬 수 있는가?
  • RQ4제안된 방법이 이미지 검색, 인물 재식별, 소수의 샘플 세그먼테이션과 같은 다양한 비전 작업에 일반화되는가?
  • RQ5유사도 주의 맵을 통해 소수의 샘플 레이블 전파 작업을 위한 비지도 대응 학습이 가능할 수 있는가?

주요 결과

  • 제안된 방법은 GradCAM보다 더 직관적이고 정확한 주의 맵을 생성하여, 유사한 쌍의 이미지에서 대응되는 영역을 명확히 강조한다.
  • 유사도 주의 맵은 훈련 중에 미분 가능한 제약 조건으로 사용될 수 있으며, 이러한 제약 조건이 없는 기준 모델에 비해 모델 성능 향상을 이룬다.
  • 이 방법은 소수의 샘플 세분화 작업에서 최신 기술 수준의 성능을 달성하며, PAN-init과 같은 기존 방법들보다도 뛰어나다. 이는 관련 없는 데이터셋에서 훈련된 경우에도 성립한다.
  • 이 방법은 일반적인 이미지 검색, 인물 재식별, 소수의 샘플 세그먼테이션과 같은 다양한 작업에 잘 일반화되어 있으며, 넓은 적용 가능성을 보여준다.
  • 모델은 제로샷 및 소수의 샘플 설정에서도 성능이 뛰어나며, 하류 작업과 관련 없는 데이터에서 훈련된 경우에도 강력한 일반화 및 대응 학습 능력을 보여준다.
  • 이 방법은 비지도 대응 학습을 가능하게 하여, 의료 영상 검색과 같은 분야에서 소수의 샘플 및 제로샷 학습의 새로운 길을 열어준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.