Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Train-Test Consistency for Semi-supervised Temporal Action Localization

Xudong Lin, Zheng Shou|arXiv (Cornell University)|2019. 10. 24.
Human Pose and Action Recognition참고 문헌 64인용 수 4
한 줄 요약

이 논문은 훈련과 테스트 시에 적응형 임계값을 예측하여 훈련 시 전략(주의/의존성 기반 집계)과 테스트 시 전략(고정 임계값 분할) 간의 괴리를 제거하는, 반감독형 시간 행동 로컬라이제이션을 위한 훈련-테스트 일致성 프레임워크 TTC-Loc을 제안한다. 훈련 중에 시간적 경계 주석으로부터 명시적 지도를 제공함으로써, TTC-Loc은 단 한 개의 클래스당 하나의 완전 주석이 있는 영상만으로도 THUMOS'14에서 33.4% mAP (IoU=0.5)를 달성하여 최신 기준 성능을 달성한다.

ABSTRACT

Recently, Weakly-supervised Temporal Action Localization (WTAL) has been densely studied but there is still a large gap between weakly-supervised models and fully-supervised models. It is practical and intuitive to annotate temporal boundaries of a few examples and utilize them to help WTAL models better detect actions. However, the train-test discrepancy of action localization strategy prevents WTAL models from leveraging semi-supervision for further improvement. At training time, attention or multiple instance learning is used to aggregate predictions of each snippet for video-level classification; at test time, they first obtain action score sequences over time, then truncate segments of scores higher than a fixed threshold, and post-process action segments. The inconsistent strategy makes it hard to explicitly supervise the action localization model with temporal boundary annotations at training time. In this paper, we propose a Train-Test Consistent framework, TTC-Loc. In both training and testing time, our TTC-Loc localizes actions by comparing scores of action classes and predicted threshold, which enables it to be trained with semi-supervision. By fixing the train-test discrepancy, our TTC-Loc significantly outperforms the state-of-the-art performance on THUMOS'14, ActivityNet 1.2 and 1.3 when only video-level labels are provided for training. With full annotations of only one video per class and video-level labels for the other videos, our TTC-Loc further boosts the performance and achieves 33.4\% mAP (IoU threshold 0.5) on THUMOS's 14.

연구 동기 및 목표

  • 제한된 완전 주석을 활용하여 약한 지도 학습과 완전 지도 학습 간의 성능 격차를 줄이기 위해.
  • 기존 WTAL 방법에서 훈련 시와 테스트 시에 다른 전략을 사용하는 훈련-테스트 불일치 문제를 식별하고 해결하기 위해.
  • 훈련 중에 행동 로컬라이제이션 모델을 시간적 경계 주석으로 명시적 지도로 제공함으로써, 훈련과 추론 행동을 일치시키기 위해.
  • 영상 수준 레이블과 희박한 완전 주석을 조합한 반감독형 시간 행동 로컬라이제이션(STAL) 설정을 제안하여 모델의 일반화 능력을 향상시키기 위해.
  • 약한 지도 학습 및 반감독 학습 설정 모두에서 벤치마크 데이터셋에서 최신 기준 성능을 달성하기 위해.

제안 방법

  • 훈련 및 추론 시 모두 예측된 임계값을 사용하여 행동 세그먼트 검출을 수행하는 훈련-테스트 일치 전략을 도입하여 고정된 수동 임계값을 대체한다.
  • 영상 수준 특징에서 적응형 임계값을 생성하기 위해 시그모이드 함수를 사용한 미분 가능 게이팅 메커니즘을 설계하여 엔드 투 엔드 학습을 가능하게 한다.
  • 내적을 통해 행동 점수와 배경 점수 간의 마진을 최대화하는 정규화 손실 $L_{\text{reg}}$ 를 제안하여 강력한 행동 제안 생성을 촉진한다.
  • 일부 영상의 시간적 경계 주석을 직접 사용하여 모델을 지도하는 로컬라이제이션 손실 $L_{\text{loc}}$ 를 통합하여 반감독 학습을 가능하게 한다.
  • 영상 수준 레이블과 부분적인 완전 주석을 함께 학습하며, 사전 훈련 및 미세조정보다 우수한 성능을 보이는 기본 전략을 사용한다.
  • 분류 손실 $L_{\text{clas}}$, 정규화 손실 $L_{\text{reg}}$, 로컬라이제이션 손실 $L_{\text{loc}}$ 를 통합한 유일한 손실 함수를 사용하여 엔드 투 엔드 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1행동 로컬라이제이션에서 훈련-테스트 불일치를 제거하면 약한 지도 학습 설정 하에서 모델 성능이 향상되는가?
  • RQ2훈련 중에 적응형 임계값을 예측하는 것이 시간적 경계 주석을 효과적으로 활용할 수 있는가?
  • RQ3반감독형 시간 행동 로컬라이제이션에서 영상 수준 레이블과 희박한 완전 주석을 조합하는 최적의 훈련 전략은 무엇인가?
  • RQ4게이팅 함수와 정규화 형식의 선택이 로컬라이제이션 성능에 상당한 영향을 미치는가?
  • RQ5일致한 훈련-테스트 전략은 최소한의 완전 주석으로서 완전 지도 학습 성능에 가까운 반감독 모델을 가능하게 하는가?

주요 결과

  • TTC-Loc는 반감독 설정 하에서 THUMOS'14에서 32.0% mAP를 달성하여 이전 최신 기준 성능 방법보다 뚜렷이 뛰어나다.
  • 클래스당 하나의 완전 주석 영상과 나머지 영상에 대한 영상 수준 레이블만으로도, THUMOS'14에서 IoU=0.5일 때 33.4% mAP를 달성하여 극한의 지도 하에서의 강력한 일반화 능력을 입증한다.
  • 완전 주석과 약한 지도 학습을 함께 합쳐 훈련하는 전략이 사전 훈련 및 미세조정보다 뛰어나 32.0% mAP를 기록한 반면, 후자는 28.4% mAP를 기록한다.
  • 시그모이드 게이팅 함수는 이진화(13.5%)와 소프트시그모이드(27.4%)보다 뛰어난 성능(28.2% mAP)을 보이며, 더 나은 최적화 안정성을 제공한다.
  • 내적을 사용한 $L_{\text{reg}}$ 형식이 L1, L2, 코사인 유사도보다 우수한 성능(28.2% mAP)을 기록하며, 더 강력한 마진 강화 효과를 제공한다.
  • $L_{\text{reg}}$ 와 $L_{\text{loc}}$ 를 추가하면 로컬라이제이션 정확도가 크게 향상되며, $L_{\text{reg}}$ 만으로도 성능이 18.4%에서 28.2% mAP로 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.