Skip to main content
QUICK REVIEW

[논문 리뷰] Evidential Deep Learning for Open Set Action Recognition

Wentao Bao, Qi Yu|arXiv (Cornell University)|2021. 07. 21.
Human Pose and Action Recognition참고 문헌 53인용 수 10
한 줄 요약

이 논문은 예측 불확실성을 정량화하여 알려진 동작과 미지의 동작을 구분할 수 있도록 해주는 새로운 방법인 딥 에비디언셜 액션 인식(Deep Evidential Action Recognition, DEAR)을 제안한다. Evidential Uncertainty Calibration (EUC)과 대비적 에비디언셜 디비어징(CED)을 통합함으로써 DEAR는 미지의 동작과 정적 배경 편향에 대해 강건성을 확보하고, UCF-101, HMDB-51, Mimetics 데이터셋에서 다양한 모델과 벤치마크에서 일관된 성능 향상을 달성한다.

ABSTRACT

In a real-world scenario, human actions are typically out of the distribution from training data, which requires a model to both recognize the known actions and reject the unknown. Different from image data, video actions are more challenging to be recognized in an open-set setting due to the uncertain temporal dynamics and static bias of human actions. In this paper, we propose a Deep Evidential Action Recognition (DEAR) method to recognize actions in an open testing set. Specifically, we formulate the action recognition problem from the evidential deep learning (EDL) perspective and propose a novel model calibration method to regularize the EDL training. Besides, to mitigate the static bias of video representation, we propose a plug-and-play module to debias the learned representation through contrastive learning. Experimental results show that our DEAR method achieves consistent performance gain on multiple mainstream action recognition models and benchmarks. Code and pre-trained models are available at {\small{\url{https://www.rit.edu/actionlab/dear}}}.

연구 동기 및 목표

  • 외부 분포의 동작이 존재하는 실세계 환경에서 알려진 동작을 인식하고, 알려지지 않은 동작을 거부해야 하는 개방 집합 액션 인식(OSAR) 문제에 도전한다.
  • 영상 데이터에 내재된 시간적 동적 특성과 정적 편향을 처리하지 못하는 기존의 이미지 기반 개방 집합 인식 방법의 한계를 극복한다.
  • 에비디언셜 딥 러닝(EDL)을 활용한 체계적인 불확실성 추정 프레임워크를 개발하여, 외부 분포의 동작에 대해 높은 불확실성을 할당함으로써 모델이 '모르는 것을 안다'는 능력을 갖도록 한다.
  • 모델이 배경 정보(예: '물' 또는 '하늘')에 의존하는 정적 배경 편향 문제를 완화하여, 맥락이 없는 동작에 대한 일반화 능력을 향상시킨다.
  • 백본 모델을 재학습하지 않고도 사용할 수 있는 플러그 앤 플레이 모듈을 설계하여, 대비 학습을 활용해 표현을 편향 없애는 방식으로 개방 집합 시나리오에서의 강건성을 향상시킨다.

제안 방법

  • 모델이 각 클래스에 대한 확률에 대한 딜레르트 분포를 예측하도록 액션 인식 문제를 에비디언셜 딥 러닝(EDL) 문제로 재정의한다.
  • 특정한 손실 함수인 에비디언셜 불확실성 보정(EUC)을 도입하여, 특히 폐쇄 집합 환경에서 과신을 방지하기 위해 에비디언셜 학습 과정을 정규화한다.
  • 대비 학습을 활용해 양성 및 음성 영상 클립을 대조함으로써 편향에 강인한 표현을 학습하는 대비적 에비디언셜 디비어징(CED) 모듈을 제안한다.
  • EUC와 CED를 기존 액션 인식 모델(TPN, TSM, I3D 등)에 플러그 앤 플레이 방식으로 통합하여, 최소한의 아키텍처 수정으로도 엔드 투 엔드 학습이 가능하도록 한다.
  • 예측 불확실성(증거에서 유도됨)을 활용해 미지의 동작을 식별한다: 높은 불확실성은 미지 클래스의 거부를 의미한다.
  • 몬테 카를로 샘플링이나 사후 근사 없이도 딜레르트 분포의 성질을 직접 활용해 효율적이고 확장 가능한 불확실성 추정이 가능하다.

실험 결과

연구 질문

  • RQ1에비디언셜 딥 러닝은 개방 집합 인식을 위한 체계적인 불확실성 추정을 가능하게 하기 위해 영상 액션 인식에 효과적으로 적용될 수 있는가?
  • RQ2제안된 에비디언셜 불확실성 보정(EUC) 손실은 특히 개방 집합 조건에서 모델의 캘리브레이션을 향상시키고 과신을 줄이는가?
  • RQ3대비 학습은 '물'이나 '하늘'과 같은 정적 배경 단서에 대한 의존도를 줄임으로써 영상 표현을 효과적으로 디비어징할 수 있는가?
  • RQ4EUC와 CED의 조합은 HMDB-51 및 Mimetics와 같은 벤치마크 데이터셋에서 미지의 동작으로의 일반화 능력을 어느 정도 향상시키는가?
  • RQ5DEAR는 TPN, TSM, I3D와 같은 다양한 백본 모델에서 폐쇄 집합 및 개방 집합 인식 환경 모두에서 어떻게 성능을 발휘하는가?

주요 결과

  • TPN 백본을 사용할 때 DEAR는 UCF-101에서 81.79%의 정확도와 HMDB-51를 미지 데이터로 간주할 때 79.23%의 개방 집합 F1 스코어를 기록하여 기존 방법을 능가한다.
  • 개방 집합 설정에서 기대 캘리브레이션 오차(ECE)는 0.284에서 0.268로 감소하여, EUC 손실이 모델의 캘리브레이션을 향상시키고 과신을 줄이는 데 기여함을 시사한다.
  • 기존 Kinetics로 사전 학습된 모델을 사용할 때 CED 모듈은 편향이 없는 Mimetics 데이터셋에서 정확도를 26.56%에서 34.38%로 향상시켜 효과적인 디비어징을 입증한다.
  • Mimetics 데이터셋에서 DEAR는 CED를 적용한 결과 34.38%의 정확도를 기록하여 기준 모델(26.56%)을 크게 능가하며, 맥락이 없는 동작에 대한 강건성을 보여준다.
  • 혼동 행렬 분석 결과, DEAR 없이선 HMDB-51의 '공을 쏘는 것'과 같은 미지의 동작이 UCF-101의 '활 쏘기'로 잘못 분류되는 경우가 빈번히 발생함을 확인할 수 있었으며, 이는 정적 배경 편향 때문이었다.
  • DEAR는 폐쇄 집합 인식에서도 높은 성능(예: Kinetics에서 91.18% 정확도)을 유지하면서 동시에 개방 집합 일반화 능력을 향상시켜 이중적인 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.