Skip to main content
QUICK REVIEW

[논문 리뷰] Explainable Event Recognition

Imran Khan, Kashif Ahmad|arXiv (Cornell University)|2021. 10. 02.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 이미지 기반 이벤트 인식에서 모델 결정을 해석할 수 있도록 Grad-CAM과 Xception 기반 CNN을 사용하는 해석 가능한 이벤트 인식 프레임워크를 제안한다. 결과적으로 예측의 78–84%가 이벤트에 관련된 주요 객체 또는 영역에 기반하며, 자연재해, 사회적 이벤트, 스포츠 이벤트에 대해 각각 F1 점수 0.91, 0.94, 0.97을 기록하여 모델의 해석 가능성과 일반화 능력을 입증한다.

ABSTRACT

The literature shows outstanding capabilities for CNNs in event recognition in images. However, fewer attempts are made to analyze the potential causes behind the decisions of the models and exploring whether the predictions are based on event-salient objects or regions? To explore this important aspect of event recognition, in this work, we propose an explainable event recognition framework relying on Grad-CAM and an Xception architecture-based CNN model. Experiments are conducted on three large-scale datasets covering a diversified set of natural disasters, social, and sports events. Overall, the model showed outstanding generalization capabilities obtaining overall F1-scores of 0.91, 0.94, and 0.97 on natural disasters, social, and sports events, respectively. Moreover, for subjective analysis of activation maps generated through Grad-CAM for the predicted samples of the model, a crowdsourcing study is conducted to analyze whether the model's predictions are based on event-related objects/regions or not? The results of the study indicate that 78%, 84%, and 78% of the model decisions on natural disasters, sports, and social events datasets, respectively, are based onevent-related objects or regions.

연구 동기 및 목표

  • 딥 러닝 기반 이벤트 인식 모델에서의 해석 가능성 부족 문제를 해결하기 위해, 특히 예측이 이벤트에 관련된 주요 객체나 영역에 기반하는지 여부를 다루기 위해.
  • 활성화 맵을 분석하여 모델의 결정이 의미적으로 관련 있는 시각적 콘텐츠에 기반하는지 평가하기 위해.
  • 자연재해, 사회적 이벤트, 스포츠 이벤트를 포함한 다양한 이벤트 카테고리에 걸쳐 해석 가능한 이벤트 인식의 기준을 설정하기 위해.
  • 모델 예측이 이벤트 관련 시각적 신호에 기반하는지 확인하기 위해 공동 작업 기반의 인지 연구를 수행하기 위해.

제안 방법

  • 프리트레인된 ImageNet 기반 Xception 아키텍처를 사용하여 특징 추출 및 이벤트 분류를 수행한다.
  • 최종 합성곱층에서의 활성화 맵을 생성하기 위해 Grad-CAM을 적용하여 예측에 기여도가 가장 높은 영역을 강조한다.
  • 활성화 맵을 시각화하고 분석하여 주목할 만한 영역이 이벤트 관련 객체나 장면과 일치하는지 확인한다.
  • 세 명의 평가자가 참여한 다수결 투표 방식을 사용하여 각 예측이 이벤트에 관련된 주요 영역에 기반하는지 레이블링하는 공동 작업 기반 연구를 수행한다.
  • 자연재해, 사회적 이벤트, 스포츠 이벤트를 포함한 세 가지 대규모 데이터셋을 사용하여 다양한 시각적 및 의미적 복잡성을 다룬다.
  • 예측 성능와 해석 가능성 양측을 평가하기 위해 F1 점수와 주관적 분석 정확도를 측정한다.

실험 결과

연구 질문

  • RQ1이미지의 어느 부분이 모델의 예측에 가장 큰 기여를 하는가? 이는 이벤트에 관련된 주요 객체나 영역과 일치하는가?
  • RQ2모델의 예측은 이벤트 관련 시각적 콘텐츠에 기반하는가, 아니면 관련 없는 이미지 요소에 의해 영향을 받는가?
  • RQ3모델의 결정은 인간 관찰자에게 해석 가능하고 의미적으로 유의미한가?
  • RQ4자연재해, 사회적 이벤트, 스포츠 이벤트와 같은 다양한 이벤트 카테고리에 대해 모델의 일반화 능력은 얼마나 뛰어나며?

주요 결과

  • 자연재해, 사회적 이벤트, 스포츠 이벤트 데이터셋에서 각각 F1 점수 0.91, 0.94, 0.97을 기록하여 강력한 일반화 능력을 보였다.
  • 주관적 분석 결과, 자연재해의 78% 예측, 사회적 이벤트의 84% 예측, 스포츠 이벤트의 78% 예측이 이벤트에 관련된 주요 객체나 영역에 기반하였다.
  • 스포츠 이벤트 중에서 하키의 경우 개별 클래스 정확도가 0.98로 가장 높았고, F1 레이스의 경우 0.53으로 가장 낮아 클래스별 과제가 존재함을 시사했다.
  • 오분류의 주요 원인은 유사한 시각적 특징을 가진 혼동되는 클래스 또는 명확한 이벤트에 관련된 주요 객체 부재였다.
  • 강력한 성능에도 불구하고 현재의 정확도(78–84%)와 이상적인 100% 사이의 격차는 이벤트에 관련된 주요성 모델링 향상 여지가 있음을 시사한다.
  • 활성화 맵 분석 결과, 모델이 주로 이벤트 관련 영역에 주목하고 있음을 확인하여 Grad-CAM의 이 분야에서의 해석 가능성 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.