Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid Relation Guided Set Matching for Few-shot Action Recognition

Xiang Wang, Shiwei Zhang|arXiv (Cornell University)|2022. 04. 28.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 하이브리드 관계 가이드드 세트 매칭(HyRSM)이라는 새로운 소수의 액션 인식 프레임워크를 제안한다. 이 프레임워크는 비디오 내부 및 비디오 간 관계를 포괄하는 하이브리드 관계 모듈을 통해 작업에 특화된 특징 학습을 향상시키며, 세트 기반 비디오 매칭을 위한 이중 방향 평균 하우스도르프 거리(Mean Hausdorff Metric)를 통해 시간적 비일치성에 대한 강건성을 향상시킨다. HyRSM은 여섯 가지 벤치마크에서 최신 기술 성능(SOTA)을 달성하였으며, 5-way 1-shot 설정에서 SSv2-Full에서 56.0%의 top-1 정확도를 기록하였다.

ABSTRACT

Current few-shot action recognition methods reach impressive performance by learning discriminative features for each video via episodic training and designing various temporal alignment strategies. Nevertheless, they are limited in that (a) learning individual features without considering the entire task may lose the most relevant information in the current episode, and (b) these alignment strategies may fail in misaligned instances. To overcome the two limitations, we propose a novel Hybrid Relation guided Set Matching (HyRSM) approach that incorporates two key components: hybrid relation module and set matching metric. The purpose of the hybrid relation module is to learn task-specific embeddings by fully exploiting associated relations within and cross videos in an episode. Built upon the task-specific features, we reformulate distance measure between query and support videos as a set matching problem and further design a bidirectional Mean Hausdorff Metric to improve the resilience to misaligned instances. By this means, the proposed HyRSM can be highly informative and flexible to predict query categories under the few-shot settings. We evaluate HyRSM on six challenging benchmarks, and the experimental results show its superiority over the state-of-the-art methods by a convincing margin. Project page: https://hyrsm-cvpr2022.github.io/.

연구 동기 및 목표

  • 기존의 소수의 액션 인식 방법들이 에피소드 내에서 비디오를 독립적으로 다루며, 비디오 간 상호관계를 忽略하는 한계를 해결하기 위해.
  • 시간적 정렬이 엄격한 지표가 비일치되거나 순서가 변동되는 액션을 처리할 때 취약성을 보이는 문제를 해결하기 위해.
  • 작업에 특화된 표현을 학습하고 탄력적이고 내성적인 비디오 매칭을 가능하게 하는 통합형 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 비디오 간 의미적 및 구조적 관계를 모델링하여 소수의 비디오 분류에서 일반화 능력과 강건성을 향상시키기 위해.

제안 방법

  • 하이브리드 관계 모듈은 먼저 각 비디오 내에서 장거리 시간적 의존성을 모델링하기 위해 내부 관계 함수를 적용하여 구조적 패턴을 향상시킨다.
  • 그 후 같은 에피소드 내의 비디오 간에 상호 관계 함수를 적용하여 교차 비디오 의미적 단서를 추출하고, 쿼리 예측에 관련된 특징을 풍부하게 한다.
  • 이 방법은 쿼리-서포트 비디오 매칭을 세트 매칭 문제로 재정의하여, 각 비디오를 프레임의 집합으로 간주함으로써 엄격한 시간 순서를 완화한다.
  • 이중 방향 평균 하우스도르프 거리(Mean Hausdorff Metric)를 제안하여 비디오 세트 간의 거리를 계산하고, 비일치된 부분 액션에 대한 저항력을 향상시킨다.
  • 프레임워크는 에피소드 기반 메타학습을 사용하여 엔드 투 엔드로 훈련되며, 특징과 매칭 점수를 함께 최적화한다.
  • 다양한 백본(ResNet-18, -34, -50)을 사용하여 평가함으로써 확장성과 강건성을 입증하였다.

실험 결과

연구 질문

  • RQ1에피소드 내에서 비디오 내부 및 비디오 간 관계를 동시에 모델링하면 소수의 액션 인식을 위한 특징의 구분 능력이 향상되는가?
  • RQ2탄력적인 거리 측정법을 사용하는 세트 매칭 공식화가 비일치되거나 순서가 변동되는 액션을 처리할 때 엄격한 시간 정렬보다 우수한 성능을 내는가?
  • RQ3작업에 특화된 관계 가이드드 특징 학습 전략이 소수 설정에서 작업에 무관한 특징 학습보다 더 잘 일반화되는가?
  • RQ4제안된 이중 방향 평균 하우스도르프 거리(Mean Hausdorff Metric)는 노이즈와 비일치성에 대해 기존의 정렬 지표보다 더 강건한가?

주요 결과

  • HyRSM은 5-way 1-shot 설정에서 SSv2-Full 데이터셋에서 56.0%의 top-1 정확도를 기록하여 이전의 최신 기술 성능(SOTA) 방법들을 초월하였다.
  • 제안된 이중 방향 평균 하우스도르프 거리(Bi-MHM)는 동일한 설정에서 OTAM(42.8%)과 TRX(42.0%)를 능가하여 SSv2-Full에서 44.6%의 정확도를 달성하였다.
  • 하이브리드 관계 모듈은 유사도 시각화를 통해 정답 매칭이 더 두드러지게 나타나는 것으로 보여, 특징의 구분 능력 향상을 뚜렷이 입증하였다.
  • 更深은 백본(예: ResNet-34)은 성능 향상을 이끌었으며, HyRSM은 Kinetics, HMDB51, Epic-kitchens 포함 여섯 가지 벤치마크에서 모두 최신 기술 성능(SOTA)을 유지하였다.
  • 매개변수와 FLOPs가 약간 증가했음에도 불구하고, 복잡한 분류기 헤드가 없어 OTAM 및 TRX보다 빠른 추론 속도를 기록하였다.
  • 제거 실험 결과, 표준 하우스도르프 거리 또는 단방향 지표보다 세트 매칭 거리 측정법이 노이즈와 비일치성에 더 강건함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.