Skip to main content
QUICK REVIEW

[논문 리뷰] ASM-Loc: Action-aware Segment Modeling for Weakly-Supervised Temporal Action Localization

Bo He, Xitong Yang|arXiv (Cornell University)|2022. 03. 29.
Human Pose and Action Recognition인용 수 5
한 줄 요약

ASM-Loc는 표준 MIL 기반 방법의 한계를 극복하기 위해 동작 인식 세그먼트 모델링을 도입한 새로운 약한 지도 학습 시간 행동 로컬라이제이션 프레임워크를 제안한다. 동적 세그먼트 샘플링, 내부 및 상호 세그먼트 어텐션, 의사 인스턴스 수준의 지도 학습, 다단계 보정을 통합함으로써 ASM-Loc는 THUMOS-14와 ActivityNet-v1.3에서 최신 기준 성능을 달성하여 이전 방법 대비 mAP를 각각 4.8%와 2.4% 향상시켰다.

ABSTRACT

Weakly-supervised temporal action localization aims to recognize and localize action segments in untrimmed videos given only video-level action labels for training. Without the boundary information of action segments, existing methods mostly rely on multiple instance learning (MIL), where the predictions of unlabeled instances (i.e., video snippets) are supervised by classifying labeled bags (i.e., untrimmed videos). However, this formulation typically treats snippets in a video as independent instances, ignoring the underlying temporal structures within and across action segments. To address this problem, we propose \system, a novel WTAL framework that enables explicit, action-aware segment modeling beyond standard MIL-based methods. Our framework entails three segment-centric components: (i) dynamic segment sampling for compensating the contribution of short actions; (ii) intra- and inter-segment attention for modeling action dynamics and capturing temporal dependencies; (iii) pseudo instance-level supervision for improving action boundary prediction. Furthermore, a multi-step refinement strategy is proposed to progressively improve action proposals along the model training process. Extensive experiments on THUMOS-14 and ActivityNet-v1.3 demonstrate the effectiveness of our approach, establishing new state of the art on both datasets. The code and models are publicly available at~\url{https://github.com/boheumd/ASM-Loc}.

연구 동기 및 목표

  • 표준 MIL 기반 프레임워크를 초월한 시간적 구조 모델링을 통해 약한 지도 학습과 완전 지도 학습 간의 성능 격차를 해소한다.
  • 짧은 동작의 탐지 실패나 국소화의 불완전성 또는 과다성과 같은 MIL 기반 방법의 일반적인 결함을 해결한다.
  • 시간적 의존성을 세그먼트 내외에서 활용하는 세그먼트 중심 구성 요소를 도입함으로써 경계 예측 및 국소화 완전성을 향상시킨다.
  • 의사 인스턴스 수준 지도 학습에서의 불확실성 추정을 통해 노이즈가 많은 레이블에 대한 강건성을 향상시킨다.
  • 다단계 학습 전략을 통해 액션 프포잘을 점진적으로 보정하여 국소화 정확도를 향상시킨다.

제안 방법

  • 세그먼트 중심 모델링의 기초로 사용하기 위해 표준 MIL 기반 방법을 사용해 초기 액션 프포잘을 생성한다.
  • 제안된 지속 시간에 따라 동적으로 계산된 스케일업 비율을 기반으로 짧은 액션 프포잘을 업샘플링하는 동적 세그먼트 샘플링을 구현하여 짧고 긴 액션의 기여를 균형 잡는다.
  • 각 액션 프포잘 내부에서 자기 어텐션을 적용하여 액션 다이내믹스를 모델링하고 배경 노이즈를 억제하는 내부 세그먼트 어텐션 모듈을 도입한다.
  • 다른 액션 프포잘 간에 자기 어텐션을 적용하여 액션 간 시간적 의존성을 캡처하는 상호 세그먼트 어텐션 모듈을 제안한다 (예: "CricketsBowling" 다음에 "CricketsShotting").
  • 불확실성 추정을 통한 의사 인스턴스 수준 손실을 적용하여 경계 예측을 보정하고 노이즈가 많은 의사 레이블의 영향을 줄인다.
  • 여러 학습 단계를 거쳐 액션 프포잘을 반복적으로 개선하는 다단계 보정 전략을 활용하여 점진적으로 향상된 국소화 성능을 달성한다.

실험 결과

연구 질문

  • RQ1명시적인 세그먼트 기반 모델링이 표준 MIL 기반 프레임워크를 초월해 약한 지도 학습 시간 행동 로컬라이제이션 성능을 향상시킬 수 있는가?
  • RQ2액션 세그먼트 내외의 시간적 구조를 모델링하면 국소화 정확도와 경계 예측에 어떤 영향을 미치는가?
  • RQ3짧은 액션 세그먼트의 동적 샘플링이 짧은 지속 시간 액션의 탐지 성능 향상에 얼마나 기여하는가?
  • RQ4의사 인스턴스 수준 지도 학습에서의 불확실성 추정은 레이블 노이즈를 완화하는 데 얼마나 효과적인가?
  • RQ5액션 프포잘의 다단계 보정이 약한 지도 학습 TAL에서 일관된 성능 향상을 이끌어내는가?

주요 결과

  • ASM-Loc는 45.1% mAP로 THUMOS-14에서 새로운 최고 기록을 수립하였으며, 기준 모델 대비 4.8% 향상되었다.
  • ActivityNet-v1.3에서 ASM-Loc는 45.1% mAP를 달성하여 이전 최고 기록 대비 2.4% 향상되었으며, 다양한 데이터셋에서의 일관된 성능 향상을 입증했다.
  • 동적 세그먼트 샘플링 모듈은 초단기(XXS) 세그먼트에서 +4.9%, 단기(S) 세그먼트에서 +1.2%의 국소화 성능 향상을 이룩했다.
  • 내부 세그먼트 어텐션 모듈은 전역 및 배경 전용 어텐션 설정보다 뚜렷이 우수한 성능을 보이며, 세그먼트 중심 자기 어텐션의 必要성 을 입증했다.
  • 의사 인스턴스 수준 지도 학습에서의 불확실성 추정은 평균 mAP를 1% 향상시켜 노이즈 영향을 줄이는 데 효과적임을 보였다.
  • 다단계 보정은 단계가 늘어날수록 성능 향상을 보이며, 3단계로는 성능 향상이 포화 상태에 도달함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.