[논문 리뷰] WOAD: Weakly Supervised Online Action Detection in Untrimmed Videos
WOAD는 비디오 수준 레이블만을 사용하여 훈련하는 약한 감독 온라인 동작 탐지 프레임워크를 제안한다. 이는 공동 최적화된 시간적 제안 생성기(TPG)를 통해 허위 프레임별 레이블을 생성하고, 온라인 동작 식별기(OAR)를 통해 실시간 동작 탐지 기능을 수행한다. 이는 강한 감독 방법과 비교해 유사한 성능을 달성하며, 강한 감독 하에서도 최신 기술 수준의 성능을 기록한다.
Online action detection in untrimmed videos aims to identify an action as it happens, which makes it very important for real-time applications. Previous methods rely on tedious annotations of temporal action boundaries for training, which hinders the scalability of online action detection systems. We propose WOAD, a weakly supervised framework that can be trained using only video-class labels. WOAD contains two jointly-trained modules, i.e., temporal proposal generator (TPG) and online action recognizer (OAR). Supervised by video-class labels, TPG works offline and targets at accurately mining pseudo frame-level labels for OAR. With the supervisory signals from TPG, OAR learns to conduct action detection in an online fashion. Experimental results on THUMOS'14, ActivityNet1.2 and ActivityNet1.3 show that our weakly-supervised method largely outperforms weakly-supervised baselines and achieves comparable performance to the previous strongly-supervised methods. Beyond that, WOAD is flexible to leverage strong supervision when it is available. When strongly supervised, our method obtains the state-of-the-art results in the tasks of both online per-frame action recognition and online detection of action start.
연구 동기 및 목표
- 온라인 동작 탐지에서 세그먼트 수준의 시간 경계를 위한 높은 주석 비용 문제를 해결하기 위해, 단지 비디오 수준 레이블만을 사용한 훈련을 가능하게 한다.
- 실시간 추론 능력을 유지하면서도 높은 정확도의 온라인 프레임 단위 동작 식별 및 동작 시작 탐지 성능을 달성하는 프레임워크를 개발한다.
- 가용한 강한 감독 정보를 유연하게 통합할 수 있도록 하여 재학습 없이도 성능 향상을 이룬다.
- 약한 감독에서 정확한 온라인 탐지를 학습하는 과제를 시간 모델링을 통해 생성된 허위 레이블을 활용하여 극복한다.
제안 방법
- WOAD는 두 가지 공동 훈련되는 모듈로 구성된다: 비디오 수준 레이블을 사용해 클래스별 시간적 동작 제안을 탐색하는 오프라인으로 작동하는 시간적 제안 생성기(TPG).
- TPG는 동일한 동작 클래스의 프레임을 그룹화하여 프레임 단위 허위 레이블을 생성하며, 시간적 맥락을 통해 정밀도를 향상시킨다.
- 온라인 동작 식별기(OAR)는 TPG에서 생성된 허위 레이블을 사용하여 실시간으로 프레임 단위 동작 식별 및 동작 시작 탐지 기능을 수행한다.
- TPG와 OAR의 공동 훈련을 통해 공유 표현 학습이 가능해져 두 모듈의 성능이 모두 향상된다.
- OAR에서는 장기적 의존성을 캐치하고 시작 탐지 민감도를 향상시키기 위해 시간 풀링과 양방향 LSTM을 사용한다.
- 하이퍼파라미터 λ로 조정 가능한 가중치 손실 함수를 사용하여 TPG와 OAR의 목적함수를 통합한다.
실험 결과
연구 질문
- RQ1세그먼트 수준 주석 없이 비디오 수준 레이블만을 사용하여 온라인 동작 탐지가 효과적으로 훈련될 수 있는가?
- RQ2약한 비디오 수준 감독 하에서 신뢰할 수 있는 허위 프레임별 레이블을 생성하기 위해 어떤 방법이 필요한가?
- RQ3공동 훈련된 TPG-OAR 프레임워크가 기존의 약한 감독 온라인 동작 탐지 방법보다 우수한 성능을 낼 수 있는가?
- RQ4강한 감독 정보가 가용할 경우 WOAD의 성능는 어떻게 스케일링되는가?
주요 결과
- THUMOS’14, ActivityNet1.2, ActivityNet1.3에서 WOAD는 약한 감독 하에 각각 평균 F-AP 54.4%, 55.0%, 54.6%를 기록하여 기존의 약한 감독 기반 기준선을 초월했다.
- 강한 감독 하에서는 동일한 데이터셋에서 평균 F-AP 67.1%, 66.3%, 66.6%를 기록하여 이전의 강한 감독 기반 방법들을 모두 능가하는 최신 기술 수준의 성능를 달성했다.
- 단일 Tesla V100 GPU에서 프레임당 추론 시간이 0.40ms로 측정되어 TRN 대비 6배 빠르고, 파라미터 수 110M으로 TRN(314M 파라미터) 대비 3배 더 효율적이다.
- 제거 실험 결과, 시간 풀링 또는 RNN 레이어를 제거할 경우 성능이 심각하게 저하됨을 확인하여, 정확한 시작 탐지에 있어 이들의 중요성을 입증했다.
- 기본 TPG 대신 더 정확한 TPG(BaS-Net)를 사용할 경우 BaS-Net 기준선 대비 평균 F-AP이 6.8% 향상되어 WOAD 프레임워크의 강건성을 입증했다.
- 오직 20개의 장시간 영상만을 사용하는 도전적인 TVSeries 데이터셋에서 WOAD는 약한 감독 하에 평균 cAP 59.1%를 기록하여, 저자료 및 장시간 영상 환경에서의 한계를 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.