[논문 리뷰] Weakly Supervised Temporal Action Localization via Representative Snippet Knowledge Propagation
이 논문은 동영상 내부 및 동영상 간에 대표적인 비디오 스니펫으로부터 지식을 전파하여 허위 레이블 품질을 향상시키는 약한 지도 학습 기반 시간 행동 로컬라이제이션 방법을 제안한다. 메모리 백업과 이분할 무작위 보행 모듈을 사용하여 특징 표현을 개선하여 보다 정확한 시간 분류 활성화 맵을 생성하며, THUMOS14에서 1.2%의 mAP 향상으로 최신 기술 수준(SOTA) 성능을 달성하고 여러 기준 모델에서 일관된 향상을 보였다.
Weakly supervised temporal action localization aims to localize temporal boundaries of actions and simultaneously identify their categories with only video-level category labels. Many existing methods seek to generate pseudo labels for bridging the discrepancy between classification and localization, but usually only make use of limited contextual information for pseudo label generation. To alleviate this problem, we propose a representative snippet summarization and propagation framework. Our method seeks to mine the representative snippets in each video for propagating information between video snippets to generate better pseudo labels. For each video, its own representative snippets and the representative snippets from a memory bank are propagated to update the input features in an intra- and inter-video manner. The pseudo labels are generated from the temporal class activation maps of the updated features to rectify the predictions of the main branch. Our method obtains superior performance in comparison to the existing methods on two benchmarks, THUMOS14 and ActivityNet1.3, achieving gains as high as 1.2% in terms of average mAP on THUMOS14.
연구 동기 및 목표
- 약한 지도 학습 기반 시간 행동 로컬라이제이션에서 영상 수준 분류와 스니펫 수준 로컬라이제이션 간의 괴리 문제를 해결하기 위해.
- 개별 스니펫을 초월한 맥락 정보를 활용하여 허위 레이블 품질을 향상시키기 위해.
- 대표 스니펫을 지식 수송 수단으로 삼아 내부 및 외부 동영상 간 지식 전이를 가능하게 하기 위해.
- 지각에 혼란을 줄 수 있는 분류 또는 배경 스니펫에 대한 의존도를 줄이기 위해.
- 영상 수준 레이블만을 사용하는 최소한의 지도 학습으로 최신 기술 수준의 성능를 달성하기 위해.
제안 방법
- 시야, 동작, 배경 변동을 처리하기 위해 기대값 최대화 주의 메커니즘을 사용하여 각 영상에서 대표 스니펫을 식별한다.
- 모든 영상의 고신뢰도 대표 스니펫을 저장하는 메모리 백업을 유지하여 외부 영상 간 지식 전이를 가능하게 한다.
- 내부 및 외부 영상의 대표 스니펫으로부터 지식을 전파하여 영상 특징을 업데이트하는 이분할 무작위 보행(BiRW) 모듈을 적용한다.
- 업데이트된 특징을 사용하여 개선된 시간 분류 활성화 맵(TCAMs)을 생성하고, 이를 주 모델의 예측을 교정하기 위한 온라인 허위 레이블로 활용한다.
- 이중 브랜치 학습 체계를 통합: 주 브랜치는 영상 수준 레이블에서 학습하고, 보조 브랜치는 허위 레이블에서 학습하여 대표 스니펫에 대한 집중도를 높인다.
- 반복적 전파 동안 특징 업데이트를 안정화시키기 위해 잔차 연결을 적용하여 기울기 감쇠를 방지한다.
실험 결과
연구 질문
- RQ1영상의 대표 스니펫과 메모리 백업에서 지식을 전파함으로써 약한 지도 학습 기반 시간 행동 로컬라이제이션에서 허위 레이블 품질을 향상시킬 수 있는가?
- RQ2대표 스니펫으로부터 내부 및 외부 영상 간 지식 전파가 로컬라이제이션 정확도에 어떤 영향을 미치는가?
- RQ3점수 대신 특징을 전파하는 것이 약한 지도 학습 환경에서 더 나은 성능을 이끌어내는가?
- RQ4제안된 프레임워크는 최소한의 아키텍처 변경으로 기존 최신 기술 수준 모델을 일관되게 향상시킬 수 있는가?
- RQ5성능과 학습 안정성의 균형을 고려할 때 최적의 전파 반복 수는 얼마인가?
주요 결과
- 제안된 방법은 이전 방법 대비 THUMOS14에서 평균 mAP가 1.2% 절대적 향상으로 최신 기술 수준의 성능을 입증하였다.
- ActivityNet1.3에서도 뛰어난 성능을 달성하여 데이터셋 간 일반화 능력을 확인하였다.
- 제거 분석 결과, 잔차 연결을 사용한 가중치 기반 특징 전파가 직접 전파 또는 점수 기반 전파보다 성능이 뛰어났다.
- STPN, BM, WUM, FAC-Net 등 다양한 기준 모델에서 일관되게 성능 향상을 보였으며, 최대 4.8%의 mAP 향상이 관찰되었다.
- 최적의 전파 반복 수는 5회였으며, 이보다 높은 반복 수는 기울기 불안정성으로 인해 성능 저하를 초래하였다.
- 메모리 백업 메커니즘은 저비용 GPU 메모리로도 효과적인 외부 영상 간 지식 전이를 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.