[논문 리뷰] Hierarchical Compositional Representations for Few-shot Action Recognition
이 논문은 소수의 샘플에서 행동을 인식하는 데 초점을 맞춘 계층적 조합 표현(HCR) 프레임워크를 제안한다. 행동은 하위 행동과 공간적 주의를 갖는 하위 행동(SAS-actions)으로 분해되어 세밀한 이식 가능한 패턴을 포착한다. 하위 행동 시퀀스를 비교하기 위해 지구 이동 거리(EMD)를 사용함으로써, 이 방법은 HMDB51, UCF101, Kinetics 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 5-way 1-shot 설정에서 정확도가 각각 67.5%, 88.9%, 75.7%였다.
Recently action recognition has received more and more attention for its comprehensive and practical applications in intelligent surveillance and human-computer interaction. However, few-shot action recognition has not been well explored and remains challenging because of data scarcity. In this paper, we propose a novel hierarchical compositional representations (HCR) learning approach for few-shot action recognition. Specifically, we divide a complicated action into several sub-actions by carefully designed hierarchical clustering and further decompose the sub-actions into more fine-grained spatially attentional sub-actions (SAS-actions). Although there exist large differences between base classes and novel classes, they can share similar patterns in sub-actions or SAS-actions. Furthermore, we adopt the Earth Mover's Distance in the transportation problem to measure the similarity between video samples in terms of sub-action representations. It computes the optimal matching flows between sub-actions as distance metric, which is favorable for comparing fine-grained patterns. Extensive experiments show our method achieves the state-of-the-art results on HMDB51, UCF101 and Kinetics datasets.
연구 동기 및 목표
- 데이터 부족과 복잡한 시간적 동역학으로 인한 소수의 샘플에서 행동 인식의 과제를 해결하기 위해.
- 기존 방법에서 전역 영상 풀링과 고정된 클립 정렬의 한계를 극복하기 위해.
- 공통적인 세밀한 패턴을 발견함으로써 기본 클래스에서 새로운 클래스로의 분류 지식을 이식할 수 있도록 하기 위해.
- 표현 학습을 향상시키기 위해 행동을 하위 행동과 공간적 주의를 갖는 하위 행동(SAS-actions)으로 계층적으로 분해하기 위해.
- 세밀한 하위 행동 시퀀스를 비교하기 위한 강력한 거리 측정법으로 지구 이동 거리(EMD)를 도입하기 위해.
제안 방법
- 복잡한 행동을 시간적으로 일관된 하위 행동으로 분해하기 위해 계층적 클러스터링을 적용한다.
- 공간적 주의를 갖는 하위 행동(SAS-actions)을 추출하기 위해 파트 주의 모듈(PAM)을 설계한다. 이는 명시적(신체 부위) 및 암시적(맥락적 신호) 구성 요소를 구분한다.
- 사전 정의된 신체 부위에 주의를 유도하기 위해 파트 사전 제약 조건을 사용하여 관련 운동 패턴의 국소화를 향상시킨다.
- 각 영상을 하위 행동 및 SAS-action 임베딩의 시퀀스로 표현하여 세밀한 비교를 가능하게 한다.
- 하위 행동 시퀀스 간 최적의 운반 흐름을 계산하기 위해 지구 이동 거리(EMD)를 사용하여 강력한 유사도 측정을 가능하게 한다.
- EMD 공간에서 내부 클래스 간의 거리를 최소화하고 외부 클래스 간의 거리를 최대화하는 메트릭 학습 목표를 사용하여 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1하위 행동과 SAS-actions로 행동을 계층적으로 분해함으로써, 이식 가능한 세밀한 패턴을 포착함으로써 소수의 샘플에서 행동 인식 성능을 향상시킬 수 있는가?
- RQ2소수의 샘플에서 행동 인식을 위한 영상 표현 비교에 있어, 전통적인 코사인 거리나 유클리드 거리와 비교해 지구 이동 거리(EMD)가 더 우수한 성능을 보일 수 있는가?
- RQ3주의를 통해 학습된 명시적 및 암시적 SAS-actions가 신체 부위와 맥락적 신호를 효과적으로 모델링하여 일반화 성능를 향상시킬 수 있는가?
- RQ4하위 행동의 수가 인식 성능에 어떤 영향을 미치며, 세밀함과 중복 사이의 최적의 균형은 무엇인가?
- RQ5대규모 영상 데이터셋(예: IG-65M)에서 미리 훈련하면, 낮은 데이터 환경에서의 소수의 샘플 일반화 성능가 향상되는가?
주요 결과
- 제안된 HCR 방법은 5-way 1-shot 설정에서 HMDB51에서 최신 기술 수준의 정확도 67.5%를 달성하였다.
- UCF101에서는 5-way 1-shot 벤치마크에서 88.9%의 정확도를 기록하여 기존 방법들을 능가하였다.
- Kinetics에서는 5-way 1-shot에서 75.7%의 정확도를 달성하여 다양한 행동 클래스 간 강력한 일반화 능력을 보였다.
- 최적의 하위 행동 수는 HMDB51에선 12개, UCF101에선 16개, Kinetics에선 24개였으며, 이는 데이터셋 별로 세밀함의 균형이 달라지는 것을 시사한다.
- 지구 이동 거리(EMD)는 영상 표현 간의 유사도 측정에서 유클리드 거리 및 코사인 거리보다 유의미하게 뛰어난 성능을 보였다.
- 평균 풀링(AvgPool)은 최대 풀링(MaxPool)보다 더 좋은 성능를 보였으며, 이는 덜 분류 능력 있는 특징을 유지하는 것이 소수의 샘플 일반화에 유리하다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.