Skip to main content
QUICK REVIEW

[논문 리뷰] Two-Stream Consensus Network for Weakly-Supervised Temporal Action Localization

Yuanhao Zhai, Le Wang|arXiv (Cornell University)|2020. 10. 22.
Human Pose and Action Recognition참고 문헌 47인용 수 14
한 줄 요약

이 논문은 프레임 수준의 참조 지도가 없는 약한 감독 하에 시계열 행동 탐지(weakly-supervised temporal action localization)를 위한 이중 스트림 공감 네트워크(Two-Stream Consensus Network, TSCN)를 제안한다. 이는 후기 융합 주의도(attention)로부터 반복적으로 프레임 수준의 가짜 참조 지도를 개선함으로써 모델의 감독을 강화하고 가짜 양성 결과(false positives)를 줄인다. 또한 주의도 값이 0 또는 1의 극단으로 수렴하도록 유도하는 주의도 정규화 손실을 도입하여 고정된 0.5 임계값을 통해 고품질의 행동 제안을 가능하게 하였으며, THUMOS14 및 ActivityNet에서 최신 기준(SOTA) 성능을 달성하였다.

ABSTRACT

Weakly-supervised Temporal Action Localization (W-TAL) aims to classify and localize all action instances in an untrimmed video under only video-level supervision. However, without frame-level annotations, it is challenging for W-TAL methods to identify false positive action proposals and generate action proposals with precise temporal boundaries. In this paper, we present a Two-Stream Consensus Network (TSCN) to simultaneously address these challenges. The proposed TSCN features an iterative refinement training method, where a frame-level pseudo ground truth is iteratively updated, and used to provide frame-level supervision for improved model training and false positive action proposal elimination. Furthermore, we propose a new attention normalization loss to encourage the predicted attention to act like a binary selection, and promote the precise localization of action instance boundaries. Experiments conducted on the THUMOS14 and ActivityNet datasets show that the proposed TSCN outperforms current state-of-the-art methods, and even achieves comparable results with some recent fully-supervised methods.

연구 동기 및 목표

  • 프레임 수준의 참조 지도가 없는 약한 감독 하의 시계열 행동 탐지에서 가짜 양성 결과를 줄이기 위한 도전 과제를 해결하기 위해.
  • 주목적 기반 탐지에 의존하는 고정된 경험적 임계값에 대한 의존도를 제거함으로써 행동 제안의 품질을 향상시키기 위해.
  • 후기 융합을 통해 RGB와 옵티컬 플로우 스트림의 상보적 강점을 활용하여 더 정확한 프레임 수준의 가짜 감독을 생성하기 위해.
  • 정확한 경계 탐지 가능성을 높이기 위해 주의도 맵의 모호함을 줄이고 바이너리 유사 활성 패턴을 유도하기 위해.
  • 학습 시에 영상 수준의 레이블만을 사용하여 완전 감독 기반 방법과 비교할 만한 성능을 달성하기 위해.

제안 방법

  • 후기 융합 주의도 출력에서 프레임 수준의 가짜 참조 지도를 반복적으로 생성하는 학습 체계를 도입한다.
  • 이 가짜 참조 지도를 세밀한 감독으로 사용하여 양 스트림 모델을 재학습함으로써 점진적으로 정밀도를 향상시키고 가짜 양성 결과를 줄인다.
  • 예측된 주의도 값을 0 또는 1으로 유도하는 새로운 주의도 정규화 손실을 도입하여 모호함을 최소화하고 제안의 정밀도를 향상시킨다.
  • 후기 융합은 학습 가능한 가중치를 사용해 RGB 및 플로우 스트림 주의도 맵을 융합하여 개별 스트림보다 더 강력한 공감 출력을 생성한다.
  • 이 방법은 영상 수준의 레이블로 이중 스트림 모델을 초기 학습한 후, 반복 루프 내에서 가짜 레이블 개선과 모델 재학습을 번갈아 수행한다.
  • 행동 제안은 융합된 주의도 맵을 0.5로 임계화하여 생성되며, 정규화된 주의도 분포 덕분에 고품질의 결과를 도출한다.

실험 결과

연구 질문

  • RQ1후기 융합 주의도에서 유도된 가짜 참조 지도를 반복적으로 개선하는 방식이 약한 감독 하의 시계열 행동 탐지 정확도 향상에 기여하는가?
  • RQ2주의도 정규화 손실이 주의도 맵의 모호함을 효과적으로 줄이고 고정된 임계값을 사용한 고품질 행동 제안을 가능하게 하는가?
  • RQ3RGB와 옵티컬 플로우 스트림의 후기 융합이 개별 스트림보다 더 나은 프레임 수준의 감독을 제공하는가?
  • RQ4약한 감독 방법이 얼마나 높은 수준의 성능을 달성할 수 있는가? 완전 감독 기반 기준과 비교해보면?
  • RQ5외형과 운동 모odal의 상보적 강점이 공감 기반 탐지에 어떻게 기여하는가?

주요 결과

  • TSCN 모델은 가짜 참조 지도를 사용해 훈련했을 때 THUMOS14 데이터셋에서 IoU=0.5일 때 평균 정밀도(mAP)가 45.0%를 기록하였으며, 영상 전용 기반 모델의 40.9%보다 유의미하게 높았다.
  • ActivityNet 데이터셋에서는 가짜 감독을 통한 융합 모델이 44.6% mAP@IoU=0.5를 기록했고, 그렇지 않은 경우 44.4%에 그쳐 일관된 성능 향상을 입증하였다.
  • RGB 스트림의 정밀도와 재현율은 가짜 감독 덕분에 크게 향상되었으며, 영상 전용일 때 13.2%와 8.2%에서 각각 22.1%와 14.4%로 증가하였다.
  • 플로우 스트림는 가짜 감독 덕분에 F-측정치가 0.6% 향상되어 32.07에서 35.73로 상승하여 정밀도와 재현율의 균형이 향상됨을 보여주었다.
  • 가짜 감독을 통한 융합 모델은 THUMOS14에서 31.3%의 정밀도와 44.6%의 mAP를 기록하여 공감 학습이 정밀도 향상과 전체 성능 향상에 기여함을 보였다.
  • 정성적 결과는 가짜 감독이 가짜 양성 결과를 줄이고 경계 정렬을 향상시킴을 확인하였으며, 특히 근접한 행동 인스턴스나 이례적인 카메라 앵글에서 두드러진 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.