Skip to main content
QUICK REVIEW

[논문 리뷰] Few-Shot Video Classification via Temporal Alignment

Kaidi Cao, Jingwei Ji|arXiv (Cornell University)|2019. 06. 27.
Human Pose and Action Recognition참고 문헌 46인용 수 16
한 줄 요약

이 논문은 쿼리 비디오와 서포트 세트 프록시 간의 적응형 정렬 경로를 학습하여 장기적 시간적 순서를 명시적으로 모델링하는 시간적 정렬 모듈(Temporal Alignment Module, TAM)을 제안한다. 연속적 리프레젠테이션을 통해 엔드 투 엔드 학습을 가능하게 함으로써, TAM은 한 클래스당 하나의 레이블 예시만을 사용하여 Kinetics와 Something-Something-V2에서 평균 풀링 기반 모델 대비 약 8% 높은 정확도를 달성하며 최신 기준 성능을 확보한다.

ABSTRACT

There is a growing interest in learning a model which could recognize novel classes with only a few labeled examples. In this paper, we propose Temporal Alignment Module (TAM), a novel few-shot learning framework that can learn to classify a previous unseen video. While most previous works neglect long-term temporal ordering information, our proposed model explicitly leverages the temporal ordering information in video data through temporal alignment. This leads to strong data-efficiency for few-shot learning. In concrete, TAM calculates the distance value of query video with respect to novel class proxies by averaging the per frame distances along its alignment path. We introduce continuous relaxation to TAM so the model can be learned in an end-to-end fashion to directly optimize the few-shot learning objective. We evaluate TAM on two challenging real-world datasets, Kinetics and Something-Something-V2, and show that our model leads to significant improvement of few-shot video classification over a wide range of competitive baselines.

연구 동기 및 목표

  • 새로운 클래스에 대한 레이블 데이터가 극도로 제한된 소수의 예시 비디오 분류 문제에 대응하기 위해.
  • 기존 방법에서 자주 忽시되는 비디오의 장기적 시간적 순서를 명시적으로 모델링하기 위해.
  • 정렬 경로를 엔드 투 엔드로 학습할 수 있는 미분 가능 프레임워크를 개발하여 데이터 효율성을 향상시키기 위해.
  • 정확한 소수의 예시 분류를 방해하는 비디오 간 비선형적 시간적 변형을 극복하기 위해.
  • 최소한의 감독 신호로도 실제 비디오 데이터셋에서 기존 기반 모델을 능가하는 성능을 확보하기 위해.

제안 방법

  • TAM은 쿼리 비디오와 서포트 비디오 특징 간에 학습된 정렬 경로를 따라 프레임별 코사인 거리의 평균을 계산하여 시간적 정렬 점수를 산출한다.
  • 정렬 경로는 연속적 리프레젠테이션을 적용한 동적 프로그래밍을 통해 결정되며, 이는 엔드 투 엔드 역전파를 가능하게 한다.
  • 학습 중 최적화의 안정성과 기울기 흐름의 균형을 위해 스무딩 파라미터 λ를 도입한다.
  • 모델은 싸이미즈 유사 백본을 사용해 깊이 있는 비디오 특징을 추출한 후, TAM 모듈을 통해 분류를 수행한다.
  • 최종 예측은 각 클래스의 모든 서포트 프록시에 대해 최소 정렬 점수를 계산하여 수행된다.
  • 소수의 예시 일반화 성능을 최적화하기 위해 메타학습 목적함수를 사용해 엔드 투 엔드로 프레임워크를 학습한다.

실험 결과

연구 질문

  • RQ1시간적 순서의 명시적 모델링이 소수의 예시 비디오 분류 성능을 향상시키는가?
  • RQ2소수의 예시 학습에서 적응형 시간적 정렬이 고정 또는 히우리스틱 정렬 전략보다 어떻게 비교되는가?
  • RQ3연속적 리프레젠테이션은 시간적 정렬 모듈의 효과적인 엔드 투 엔드 학습을 얼마나 잘 가능하게 하는가?
  • RQ4비디오 시퀀스의 비선형적 시간적 변형에 대해 모델은 얼마나 강인한가?
  • RQ5제안된 방법은 다양한 시각적 복잡도를 지닌 다양한 비디오 데이터셋 간에 일반화되는가?

주요 결과

  • 1-shot 설정에서 TAM은 Kinetics에서 73.0%의 top-1 정확도, Something-Something-V2에서 85.8%의 top-1 정확도를 기록하며, 평균 풀링 기반 모델 대비 약 8% 높은 성능을 확보한다.
  • 5-shot 설정에서는 Something-Something-V2에서 TAM이 85.8%의 top-1 정확도를 기록하며, 다음으로 우수한 기반 모델을 크게 앞서나간다.
  • 제거 분석 결과, TAM을 통한 적응형 정렬은 Min, Mean, Diagonal 등의 기반 모델 대비 1-shot 및 5-shot 설정 모두에서 3% 이상 성능 향상을 이룬다.
  • 스무딩 파라미터 λ의 선택에 대해 모델은 강인하며, 두 데이터셋 모두에서 [0.05, 0.1] 범위 내에서 최적의 성능을 기록한다.
  • 정성적 분석을 통해 TAM은 엔드 투 엔드 방식으로 쿼리와 서포트 비디오 간에 의미 있는 시간적으로 일관된 정렬 경로를 학습하는 것으로 확인된다.
  • 연속적 리프레젠테이션 기법은 정렬 경로를 통해 효과적인 역전파를 가능하게 하여 소수의 예시 학습 목적함수를 직접 최적화할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.