Skip to main content
QUICK REVIEW

[논문 리뷰] Pose Refinement Graph Convolutional Network for Skeleton-based Action Recognition

Shijie Li, Jinhui Yi|arXiv (Cornell University)|2020. 10. 14.
Human Pose and Action Recognition참고 문헌 54인용 수 5
한 줄 요약

이 논문은 뼈대 기반 행동 인식 모델인 자세 보정 그래프 컨볼루션 네트워크(Pr-GCN)를 제안한다. 이 모델은 노이즈가 있는 인간 자세 추정치를 보정하고 병렬적이고 경량화된 아키텍처를 통해 공간적 및 운동 특징을 점진적으로 융합함으로써 높은 효율성을 달성한다. 최신 기술의 GCN들과 비교해 파라미터를 86%-93% 감소시키고, FLOPs를 89%-96% 감소시키며, Kinetics 및 NTU RGB+D 데이터셋에서 경쟁력 있는 정확도를 유지한다. 이는 자원이 제한된 로봇 응용 분야에 매우 적합하다.

ABSTRACT

With the advances in capturing 2D or 3D skeleton data, skeleton-based action recognition has received an increasing interest over the last years. As skeleton data is commonly represented by graphs, graph convolutional networks have been proposed for this task. While current graph convolutional networks accurately recognize actions, they are too expensive for robotics applications where limited computational resources are available. In this paper, we therefore propose a highly efficient graph convolutional network that addresses the limitations of previous works. This is achieved by a parallel structure that gradually fuses motion and spatial information and by reducing the temporal resolution as early as possible. Furthermore, we explicitly address the issue that human poses can contain errors. To this end, the network first refines the poses before they are further processed to recognize the action. We therefore call the network Pose Refinement Graph Convolutional Network. Compared to other graph convolutional networks, our network requires 86\%-93\% less parameters and reduces the floating point operations by 89%-96% while achieving a comparable accuracy. It therefore provides a much better trade-off between accuracy, memory footprint and processing time, which makes it suitable for robotics applications.

연구 동기 및 목표

  • 자신의 뼈대 기반 행동 인식을 위한 기존 그래프 컨볼루션 네트워크(GCN)의 높은 계산 비용 문제를 해결하고, 특히 자원이 제한된 로봇 응용 분야에의 구현을 위해 고려한다.
  • 기존 방법에서 종종 忽시되는 2D/3D 뼈대 데이터에서의 자세 추정 오차의 영향을 명시적으로 완화한다.
  • 공간적 및 시간적 정보를 새로운 점진적 융합 메커니즘을 통해 융합함으로써 높은 정확도를 유지하면서도 컴act하고 효율적인 아키텍처를 설계한다.
  • 기존의 GCN 기반 접근 방식과 비교해 모델 효율성(파라미터, FLOPs)과 정확도 사이의 우월한 트레이드오프를 달성한다.

제안 방법

  • 네트워크는 먼저 공간적 및 시간적 맥락을 이용해 관절별 오프셋을 추정하는 자세 보정 모듈(Pose Refinement Module, PRM)을 적용하여 노이즈가 있는 뼈대 데이터를 보정한다.
  • 보정된 자세는 두 개의 병렬 브랜치를 가진 점진 융합 모듈(Gradual Fusion Module, GFM)을 통해 처리된다: 공간적 그래프 컨볼루션을 위한 위치-유량 브랜치와 운동 특징에 대한 시간적 컨벌루션을 위한 운동-유량 브랜치.
  • GFM은 시간에 따라 공간적 및 운동적 표현을 점진적으로 융합하며, 조기에 시간 해상도를 낮춰 계산 비용을 최소화한다.
  • 시간적 집계는 1D 컨볼루션을 통해 수행되어 시간에 걸쳐 특징을 통합하고 행동 클래스 확률을 예측한다.
  • 전체 네트워크는 자세 보정을 위한 추가적인 지도 없이 오직 행동 분류 손실만을 사용해 엔드 투 엔드로 훈련된다.
  • 깊이 분리형 컨벌루션과 조기 시간 감소 기법을 사용하여 FLOPs와 모델 크기를 크게 감소시킨다.

실험 결과

연구 질문

  • RQ1뼈대 기반 행동 인식을 위한 그래프 컨볼루션 네트워크를 정확도를 유지하면서도 크게 효율적으로 만들 수 있는가?
  • RQ2노이즈가 있는 인간 자세 추정치를 명시적으로 보정하는 것이 실세계 상황에서 행동 인식 성능을 향상시키는가?
  • RQ3병렬적이고 점진적인 공간적 및 운동적 특징 융합이 순차적 융합보다 정확도와 효율성 측면에서 뛰어나게 작용하는가?
  • RQ4제안된 아키텍처는 계산 자원이 제한된 로봇 플랫폼에 배치하기에 적합한가?

주요 결과

  • 2D 자세를 사용한 Kinetics 데이터셋에서 PR-GCN는 상위 1위 정확도 33.7%를 기록했으며, 2s-AGCN(36.1%)과 유사한 성능을 내면서도 파라미터의 7%와 GFLOPs의 4%만을 사용한다.
  • 3D 자세를 사용한 NTU RGB+D 데이터셋에서 PR-GCN는 X-Sub에서 85.2%의 상위 1위 정확도, X-View에서는 91.7%를 기록했으며, ST-GCN와 GFNet을 능가했고, 파라미터는 0.5M개, GFLOPs는 1.7로 매우 적은 자원을 사용했다.
  • 최신 기술의 GCN들과 비교해 파라미터 수를 86%-93% 감소시키고 부동소수점 연산 수를 89%-96% 감소시켜 효율성-정확도 트레이드오프를 크게 향상시켰다.
  • 제거 실험 결과, GFM에서 위치 및 운동 특징의 병렬 융합이 필수적임을 확인했으며, 이는 순차적 융합 대비 정확도를 2.4% 향상시켰다.
  • 자세 보정 모듈은 다양한 데이터셋에서 평균 1.5%의 정확도 향상을 이끌었으며, 이는 자세 추정 오차를 효과적으로 완화함과 동시에 계산 오버헤드를 최소화함을 보여준다.
  • 경량 기반 모델인 EleAtt-GRU와 GFNet과 비교해 PR-GCN는 더 낮은 파라미터 수와 FLOPs로 더 높은 정확도를 달성했으며, 효율성-정확도 균형에서의 열등함이 없음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.