[논문 리뷰] Segregated Temporal Assembly Recurrent Networks for Weakly Supervised Multiple Action Detection
이 논문은 클래스별 주의(attention)를 사용하여 행동 클립을 조립하고, 개선된 RNN을 통해 행동 간 시간적 관계를 모델링함으로써 약한 지도 학습 다중 행동 검출을 위한 분리된 시간적 어셈블리 순환(Star) 네트워크를 제안한다. 이 방법은 THUMOS’14와 ActivityNet1.3에서 최신 기술 수준의 성능을 달성하여 이전의 약한 지도 학습 방법을 뛰어넘고, mAP에서 완전 지도 학습 기반 기준선과 동등한 성능을 기록한다.
This paper proposes a segregated temporal assembly recurrent (STAR) network for weakly-supervised multiple action detection. The model learns from untrimmed videos with only supervision of video-level labels and makes prediction of intervals of multiple actions. Specifically, we first assemble video clips according to class labels by an attention mechanism that learns class-variable attention weights and thus helps the noise relieving from background or other actions. Secondly, we build temporal relationship between actions by feeding the assembled features into an enhanced recurrent neural network. Finally, we transform the output of recurrent neural network into the corresponding action distribution. In order to generate more precise temporal proposals, we design a score term called segregated temporal gradient-weighted class activation mapping (ST-GradCAM) fused with attention weights. Experiments on THUMOS'14 and ActivityNet1.3 datasets show that our approach outperforms the state-of-the-art weakly-supervised method, and performs at par with the fully-supervised counterparts.
연구 동기 및 목표
- 단일 영상 레이블만을 사용하는 비정형 영상에서 약한 지도 학습 다중 행동 검출의 과제를 해결한다.
- 행동 특징 어셈블리 과정에서 배경 및 관련 없는 행동의 간섭을 줄이기 위해 클래스별 주의 가중치를 학습한다.
- 다중 동시 행동 간 시간적 의존성을 개선된 순환 신경망을 통해 모델링한다.
- 시간적 프포지션 생성을 위한 주의 가중치와 융합된 새로운 ST-GradCAM을 통해 국소화 정밀도를 향상시킨다.
- 약한 지도 학습과 완전 지도 학습 행동 검출 방법 간의 성능 격차를 줄인다.
제안 방법
- 각 행동 카테고리별로 인스턴스 패턴을 형성하기 위해 클래스 가변 주의 메커니즘을 사용하여 영상 클립을 어셈블링함으로써 배경 및 관련 없는 행동의 간섭을 최소화한다.
- 어셈블된 특징을 개선된 순환 신경망(RNN)에 통합하여 다중 행동 간 시간적 관계를 학습한다.
- 더 정밀한 행동 프포지션 생성을 위해 주의 가중치를 적응적으로 조정할 수 있도록 RNN에 반복 정렬 메커니즘을 통합한다.
- 특정 행동 카테고리에 대한 특징 중요도를 강조하는 분리된 시간적 기울기 기반 CAM(ST-GradCAM)을 설계하고, 주의 가중치와 융합하여 국소화를 향상시킨다.
- 영상 레이블만을 사용하여 전체 프레임워크를 약한 지도 학습 방식으로 엔드 투 엔드로 훈련한다.
- 평가에 IoU 임계값 0.1–0.5를 사용하고, THUMOS’14와 ActivityNet1.3에서 mAP를 주요 지표로 삼는다.
실험 결과
연구 질문
- RQ1영상 레이블만을 사용하는 약한 지도 학습 프레임워크가 비정형 영상에서 다중 행동을 효과적으로 국소화할 수 있는가?
- RQ2특징 어셈블리 과정에서 배경 및 관련 없는 행동의 간섭을 줄이기 위해 주의 메커니즘을 어떻게 설계할 수 있는가?
- RQ3행동 간 시간적 관계를 모델링하면 약한 지도 학습 환경에서 국소화 성능 향상에 얼마나 기여하는가?
- RQ4클래스별 주의와 융합된 새로운 ST-GradCAM 방법이 표준 GradCAM에 비해 시간적 프포지션 정확도를 향상시킬 수 있는가?
- RQ5제안된 STAR 프레임워크는 벤치마크 데이터셋에서 약한 지도 학습 및 완전 지도 학습 최신 기술 수준의 방법과 비교해 어떻게 성능을 내는가?
주요 결과
- THUMOS’14에서 STAR는 IoU 0.1일 때 mAP 68.8%와 IoU 0.2일 때 mAP 60.0%를 기록하여 모든 보고된 약한 지도 학습 방법보다 크게 뛰어난 성능을 보였다.
- THUMOS’14에서 STAR는 이전까지 최고의 약한 지도 학습 방법보다 평균 mAP에서 7% 향상되었으며, IoU 0.1과 0.2에서 모두 모든 완전 지도 학습 방법을 초월했다.
- ActivityNet1.3에서 STAR는 IoU 0.5일 때 mAP 31.1%를 기록하여 이전까지 최고의 약한 지도 학습 방법보다 평균 mAP에서 2% 향상되었다.
- STAR는 약한 지도 학습과 완전 지도 학습 간 성능 격차를 줄였으며, 프레임 레벨 레이블이 없는 상황에서도 강력한 완전 지도 학습 기반 기준선과 유사한 성능을 달성했다.
- 제거 실험 결과, 주의 기반 어셈블리와 ST-GradCAM 구성 요소가 성능 향상에 핵심적임을 확인하였으며, 둘 중 하나를 제거하면 mAP가 크게 감소하였다.
- 다양한 행동 밀도에 걸쳐 일반화 능력이 뛰어나, 높은 행동 밀도를 가진 영상에서도 높은 mAP를 유지함을 그림 8에서 확인할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.