Skip to main content
QUICK REVIEW

[논문 리뷰] Bottom-Up Temporal Action Localization with Mutual Regularization

Peisen Zhao, Lingxi Xie|arXiv (Cornell University)|2020. 02. 18.
Human Pose and Action Recognition참고 문헌 41인용 수 8
한 줄 요약

이 논문은 하부 구조 기반 시간 행동 로컬라이제이션 프레임워크를 제안하며, 상호 정규화를 통해 프레임 수준의 행동 단계 예측을 향상시킨다. 각 단계 내에서의 시간적 스무스함과 시작, 계속, 종료 단계 간의 순서 일관성을 강제하기 위해 내부 단계 일관성(IntraC) 및 상호 단계 일관성(InterC) 손실을 도입한다. 이 방법은 THUMOS14에서 IoU=0.7일 때 mAP가 6.8% 절대적으로 향상되었으며, 다양한 TAL 아키텍처로 일반화된다.

ABSTRACT

Recently, temporal action localization (TAL), i.e., finding specific action segments in untrimmed videos, has attracted increasing attentions of the computer vision community. State-of-the-art solutions for TAL involves evaluating the frame-level probabilities of three action-indicating phases, i.e. starting, continuing, and ending; and then post-processing these predictions for the final localization. This paper delves deep into this mechanism, and argues that existing methods, by modeling these phases as individual classification tasks, ignored the potential temporal constraints between them. This can lead to incorrect and/or inconsistent predictions when some frames of the video input lack sufficient discriminative information. To alleviate this problem, we introduce two regularization terms to mutually regularize the learning procedure: the Intra-phase Consistency (IntraC) regularization is proposed to make the predictions verified inside each phase; and the Inter-phase Consistency (InterC) regularization is proposed to keep consistency between these phases. Jointly optimizing these two terms, the entire framework is aware of these potential constraints during an end-to-end optimization process. Experiments are performed on two popular TAL datasets, THUMOS14 and ActivityNet1.3. Our approach clearly outperforms the baseline both quantitatively and qualitatively. The proposed regularization also generalizes to other TAL methods (e.g., TSA-Net and PGCN). code: https://github.com/PeisenZhao/Bottom-Up-TAL-with-MR

연구 동기 및 목표

  • 고립된 모델링으로 인해 시작, 계속, 종료 단계를 별도로 다룰 경우 발생하는 일관성 없고 비연속적인 프레임 수준의 예측 문제를 해결하기 위해.
  • 기본 이진 분류 설정에서 忽시되는 프레임 간의 시간적 의존성과 단계 순서 제약 조건을 활용하기 위해.
  • 엔드 투 엔드로 미분 가능한 정규화를 통해 예측의 자기 일관성을 강제함으로써 로컬라이제이션 정확도를 향상시키기 위해.
  • 제안된 정규화가 기본 모델을 초월해 다른 최신 TAL 프레임워크로도 일반화됨을 보여주기 위해.

제안 방법

  • 각 단계(시작, 계속, 종료)의 양성 및 음성 영역 내에서 스무스함을 강제하기 위해 내부 단계 일관성(IntraC) 정규화를 도입하여 영역 내 부정확성 최소화.
  • 계속-시작 및 계속-종료 확률 간의 예측을 결합함으로써 행동 단계의 논리적 순서를 강제하기 위해 상호 단계 일관성(InterC) 정규화를 제안.
  • 세 단계 분류기 간의 일관성 검사를 통해 상호 정규화를 가능하게 하여, 기울기 흐름을 방해하지 않으면서 엔드 투 엔드 학습 중에 상호 보완적 학습을 유도.
  • 표준 크로스 엔트로피 손실에 IntraC 및 InterC 항목을 포함하는 미분 가능한 손실 함수를 사용하여, 시간적 사전 지식을 반영한 단계 예측의 공동 최적화를 가능하게 함.
  • 정규화를 프레임 수준의 확률 맵에 적용하여 예측을 안정화시키고, 모호한 영역에서의 가짜 양성 예측을 억제함.
  • THUMOS14 및 ActivityNet1.3에서의 검증을 통해 다양한 베이스라인과 아키텍처에서 일관된 성능 향상을 입증함.

실험 결과

연구 질문

  • RQ1행동 단계 내에서 시간적 스무스함을 강제하면 하부 구조 TAL의 프레임 수준 예측 일관성과 로컬라이제이션 정확도가 향상되는가?
  • RQ2시작, 계속, 종료 단계 간의 순서 관계를 모델링하면 모순되는 예측이 감소하고 로컬라이제이션 품질이 향상되는가?
  • RQ3제안된 상호 정규화는 기본 모델을 초월해 다른 TAL 프레임워크로 효과적으로 전이 가능한가?
  • RQ4엄격한 IoU 임계치, 예를 들어 IoU=0.7에서 정규화가 성능 향상에 얼마나 기여하는가?
  • RQ5약한 감독 또는 비감독 설정에서 제안된 일관성 손실은 다른 스무스닝 또는 정규화 전략보다 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 이전 최신 기술 대비 THUMOS14 데이터셋에서 IoU=0.7일 때 mAP가 6.8% 절대적으로 향상되었다.
  • ActivityNet1.3에서 기준 모델 대비 IoU=0.3일 때 mAP가 2.1% 향상되었고, IoU=0.5일 때는 1.8% 향상되었다.
  • IntraC 및 InterC 정규화는 예측을 크게 안정화시키며, 시작 및 종료 단계 맵에서의 가짜 양성 예측을 감소시켰다.
  • 정성적 결과에서는 정규화가 불필요한 제안, 예를 들어 "CleanAndJerk"와 "Wakeboarding" 사이의 잘못된 시작 지점 등을 억제함을 보여주었다.
  • 상호 정규화는 잘 일반화된다: TSA-Net 및 PGCN에 적용했을 때 양 모델 모두 성능 향상을 보였으며, 이는 방법의 이식 가능성 확인.
  • 오라클 분석 결과 제안서 랭킹이 주요 성능 저하 요인임을 확인했고, 제안된 방법은 예측 일관성 향상으로써 이 격차의 상당 부분을 메웠다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.