Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Discriminative Representations for Skeleton Based Action Recognition

Huanyu Zhou, Qingjie Liu|arXiv (Cornell University)|2023. 03. 07.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 공간-시간 분리와 대비 학습을 활용하여 뼈대 기반 행동 인식에서 분류 성능을 햖थ하는 플러그 앤 플레이 기능 정련 헤드(FR-Head)를 제안한다. 이는 확신 있는 프로토타입을 사용하여 모호한 샘플을 동적으로 식별하고 校정함으로써 NTU RGB+D, NTU RGB+D 120, 그리고 NW-UCLA 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 모호한 행동 그룹에서 최대 1.4%의 상위-1 정확도 향상을 기록한다.

ABSTRACT

Human action recognition aims at classifying the category of human action from a segment of a video. Recently, people have dived into designing GCN-based models to extract features from skeletons for performing this task, because skeleton representations are much more efficient and robust than other modalities such as RGB frames. However, when employing the skeleton data, some important clues like related items are also discarded. It results in some ambiguous actions that are hard to be distinguished and tend to be misclassified. To alleviate this problem, we propose an auxiliary feature refinement head (FR Head), which consists of spatial-temporal decoupling and contrastive feature refinement, to obtain discriminative representations of skeletons. Ambiguous samples are dynamically discovered and calibrated in the feature space. Furthermore, FR Head could be imposed on different stages of GCNs to build a multi-level refinement for stronger supervision. Extensive experiments are conducted on NTU RGB+D, NTU RGB+D 120, and NW-UCLA datasets. Our proposed models obtain competitive results from state-of-the-art methods and can help to discriminate those ambiguous samples. Codes are available at https://github.com/zhysora/FR-Head.

연구 동기 및 목표

  • 공간적·시간적 특징이 유사한 행동(예: 쓰기, 읽기, 타이핑)이 상호 구분하기 어려운 뼈대 기반 방법에서 발생하는 모호한 행동 인식 문제를 해결하기 위해.
  • 학습 중에 식별된 모호한 샘플에 초점을 맞춰 대비 학습을 통해 표현을 정련함으로써 표현의 분류 성능를 향상시키기 위해.
  • 다양한 GCN 기반 백본에 통합될 수 있는 경량이며 모듈화된 구성 요소를 설계하여 다수준 특징 향상 기능을 제공하기 위해.
  • 추론 비용을 증가시키지 않고 모호한 행동 그룹에서의 성능 향상을 달성하여 플러그 앤 플레이 배포가 가능하도록 하기 위해.

제안 방법

  • FR-Head는 원시 특징을 공간적 및 시간적 구성요소로 분리하여 각 차원에 대해 집중적인 정련을 가능하게 하여 분류 패턴에 대한 민감도를 향상시킨다.
  • 높은 예측 신뢰도를 가진 확신 있는 샘플을 이용해 대비 손실을 통해 내부 클래스 간 거리의 최소화와 외부 클래스 간 거리의 최대화를 통해 클래스 프로토타입을 유지한다.
  • 모호한 샘플은 특징 공간 내에서 올바른 클래스 프로토타입에 더 가까이 또는 잘못된 클래스 프로토타입에서 더 멀리 이동시키는 방식으로 동적으로 校정된다.
  • 이 모듈은 GCN 백본의 여러 단계에 적용되어 분류 손실과 대비 손실을 함께 최적화하는 다수준 정련을 가능하게 한다.
  • 학습 안정성 향상과 일반화 성능 향상을 위해 모멘텀 기반 프로토타입 업데이트 전략을 사용한다.
  • 이미 존재하는 GCN 모델과 호환되며 추론 단계에서 제거 가능하므로 런타임 오버헤드가 없다.

실험 결과

연구 질문

  • RQ1대비 학습이 뼈대 기반 행동 인식에서 모호한 행동에 대한 분류 표현 학습에 효과적으로 활용될 수 있는가?
  • RQ2공간적 및 시간적 특징을 어떻게 분리하여 각각 별도로 정련함으로써 미세한 행동 차이에 대한 모델 민감도를 향상시킬 수 있는가?
  • RQ3플러그 앤 플레이 모듈이 백본 아키텍처를 수정하지 않고도 모호한 행동 그룹에서의 성능 향상을 이룰 수 있는가?
  • RQ4GCN 단계를 거쳐 다수준 정련을 수행할 경우, 도전적인 행동 카테고리에서 정확도 향상에 얼마나 기여하는가?
  • RQ5모호한 행동 그룹에서 최신 기술 수준 모델과 비교해 제안된 방법의 정확도 및 강건성은 어떠한가?

주요 결과

  • 제안된 FR-Head는 NTU RGB+D 120의 X-Sub 분할에서 상위-1 정확도 92.8%를 기록하여 이전 SOTA 모델인 CTR-GCN보다 0.4% 높은 성능을 달성한다.
  • NTU RGB+D의 X-View 분할에서 96.8%의 상위-1 정확도를 기록하여 보고된 모든 방법 중에서 1위를 차지한다.
  • NW-UCLA 데이터셋에서 96.8%의 상위-1 정확도를 달성하여 새로운 SOTA 결과를 수립한다.
  • 그룹별 평가에서 CTR-GCN 대비 모호한 행동 그룹에서 최대 1.4%포인트의 정확도 향상을 기록한다.
  • t-SNE 시각화 결과는 제안된 방법이 모호한 행동에 대해 더 조밀하고 잘 분리된 특징 클러스터를 생성함을 확인한다.
  • 절단 실험을 통해 공간-시간 분리와 대비 정련이 성능 향상에 필수적임을 입증하였으며, 각 구성 요소가 분류 성능 향상에 기여하는 데 기여도가 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.