Skip to main content
QUICK REVIEW

[논문 리뷰] Feedback Graph Convolutional Network for Skeleton-based Action Recognition

Hao Yang, Dan Yan|arXiv (Cornell University)|2020. 03. 17.
Human Pose and Action Recognition참고 문헌 60인용 수 19
한 줄 요약

이 논문은 뼈대 기반 동작 인식을 위한 새로운 GCN 아키텍처인 피드백 그래프 컨볼루션 네트워크(FGCN)를 제안한다. 피드백 연결을 통해 근본적인 공간-시간 특징 학습을 위한 굵기에서 세밀한 점진적 학습을 가능하게 한다. 다단계 시간 샘플링과 수평 및 피드백 스킵 연결을 갖춘 피드백 그래프 컨볼루션 블록(FGCB)을 도입함으로써 특징 표현을 향상시키고 조기 예측을 가능하게 하여 NTU-RGB+D, NTU-RGB+D120, Northwestern-UCLA 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

Skeleton-based action recognition has attracted considerable attention in computer vision since skeleton data is more robust to the dynamic circumstance and complicated background than other modalities. Recently, many researchers have used the Graph Convolutional Network (GCN) to model spatial-temporal features of skeleton sequences by an end-to-end optimization. However, conventional GCNs are feedforward networks which are impossible for low-level layers to access semantic information in the high-level layers. In this paper, we propose a novel network, named Feedback Graph Convolutional Network (FGCN). This is the first work that introduces the feedback mechanism into GCNs and action recognition. Compared with conventional GCNs, FGCN has the following advantages: (1) a multi-stage temporal sampling strategy is designed to extract spatial-temporal features for action recognition in a coarse-to-fine progressive process; (2) A dense connections based Feedback Graph Convolutional Block (FGCB) is proposed to introduce feedback connections into the GCNs. It transmits the high-level semantic features to the low-level layers and flows temporal information stage by stage to progressively model global spatial-temporal features for action recognition; (3) The FGCN model provides early predictions. In the early stages, the model receives partial information about actions. Naturally, its predictions are relatively coarse. The coarse predictions are treated as the prior to guide the feature learning of later stages for a accurate prediction. Extensive experiments on the datasets, NTU-RGB+D, NTU-RGB+D120 and Northwestern-UCLA, demonstrate that the proposed FGCN is effective for action recognition. It achieves the state-of-the-art performance on the three datasets.

연구 동기 및 목표

  • 기본적인 순방향 GCN이 저수준 특징 학습 중에 고수준 의미 정보에 접근하는 데 한계가 있음을 해결하기 위해.
  • 다단계 시간 샘플링을 통해 전체 시퀀스 입력을 피하고 계산 복잡도를 감소시키기 위해.
  • 고수준에서 저수준 레이어로 의미 특징을 피드백함으로써 동작 인식 정확도를 향상시키기 위해.
  • 진행 단계에서의 조기 예측을 통해 실시간 추론을 지원하기 위해.
  • 밀도 있는 피드백 보강된 GCN 블록(FGCB)을 통해 전역 공간-시간 의존성을 모델링하기 위해.

제안 방법

  • 뼈대 시퀀스를 이산적인 시간 단계로 나누어 점진적 처리를 위한 다단계 시간 샘플링 전략을 제안한다.
  • 수평 및 피드백 스킵 연결을 갖춘 밀도 있는 그래프 컨볼루션 네트워크인 피드백 그래프 컨볼루션 블록(FGCB)을 도입하여 고수준 의미 특징을 하위 레이어로 되돌려보내는 데 사용한다.
  • 출력이 이전 단계에서 후속 단계의 입력을 조절하는 상향식 원인-결과 피드백 메커니즘을 사용하여 특징의 점진적 정교화를 가능하게 한다.
  • 초기 단계에서의 조기 예측을 후속 단계의 특징 학습을 유도하는 사전 지식으로 활용하여 최종 예측 정확도를 향상시킨다.
  • 다양한 단계의 예측을 융합하여 최종 영상 수준의 동작 레이블을 도출하기 위해 시간 축합 전략을 적용한다.
  • 모델을 단계별로 훈련하는 점진적 최적화 과정을 도입하여 특징 표현력과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1피드백 메커니즘이 고수준 의미 정보가 저수준 레이어를 지시하도록 함으로써 뼈대 기반 동작 인식을 위한 GCN의 특징 학습을 향상시킬 수 있는가?
  • RQ2굵기에서 세밀한 다단계 시간 샘플링 전략은 계산 비용을 감소시키면서도 정확도를 유지하거나 향상시키는가?
  • RQ3부분적인 입력 시퀀스에서의 조기 예측이 후속 단계의 특징 학습을 정교화하고 최종 정확도를 향상시키는 데 효과적인 사전 지식이 될 수 있는가?
  • RQ4기본 뼈대 동작 인식 벤치마크에서 제안된 FGCN 모델은 최신 기준 방법 대비 정확도와 추론 효율성 측면에서 어떻게 비교되는가?
  • RQ5피드백 메커니즘이 인간 행동의 전역 공간-시간 의존성을 모델링하는 데 얼마나 기여하는가?

주요 결과

  • NTU-RGB+D 데이터셋의 교차 주제 벤치마크에서 FGCN은 90.2%의 정확도를 기록했으며, ST-GCN보다 8.7% 높고, 교차 시점 벤치마크에서는 96.3%로 8.0% 높게 기록했다.
  • 더 큰 NTU-RGB+D120 데이터셋에서 FGCN은 교차 주제 기준으로 85.4%, 교차 설정 기준으로 87.4%의 정확도를 달성하여, 각각 ST-GCN보다 13.0%와 16.1% 높게 기록했다.
  • Northwestern-UCLA 데이터셋에서 FGCN은 95.3%의 정확도를 기록했으며, 이는 이전 최신 기준 AGC-LSTM보다 2.0%포인트 높고, HBRNN-L보다 16.8%포인트 높은 성능이다.
  • 최근 최신 기준 방법들에 비해 뚜렷한 향상을 보였으며, NTU-RGB+D120의 두 벤치마크에서 두스트림 어텐션 LSTM보다 24.0% 이상의 격차를 확보했다.
  • FGCN의 조기 예측 기능은 지연 민감한 응용 분야, 예를 들어 로봇 공학 및 자율 주행과 같은 분야에서 유용한 실시간 추론을 가능하게 한다.
  • 제거 실험 결과 피드백 메커니즘과 다단계 샘플링 전략이 성능 향상에 필수적임을 확인했으며, FGCB의 제거로 인해 NTU-RGB+D 교차 주제 벤치마크에서 정확도가 5.1% 감소했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.