Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time 3D human action recognition based on Hyperpoint sequence

Xing Li, Qian Huang|arXiv (Cornell University)|2021. 11. 16.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 실시간 3D 인간 동작 인식을 위한 프레임 수준 병렬 포인트 클라우드 시퀀스 네트워크인 SequentialPointNet을 제안한다. 포인트 클라우드 프레임을 하이퍼포인트 시퀀스로 평탄화하고, 내부 프레임 채널 혼합과 프레임 간 혼합을 분리하는 새로운 하이퍼포인트 믹서 모듈을 사용함으로써, 기존 모델 대비 최대 10배 빠른 추론 속도를 달성하면서도 NTU RGB+D 60, NTU RGB+D 120, MSR Action3D 및 UTD-MHAD 데이터셋에서 최신 기술 수준(SOTA)의 정확도를 초월한다.

ABSTRACT

Real-time 3D human action recognition has broad industrial applications, such as surveillance, human-computer interaction, and healthcare monitoring. By relying on complex spatio-temporal local encoding, most existing point cloud sequence networks capture spatio-temporal local structures to recognize 3D human actions. To simplify the point cloud sequence modeling task, we propose a lightweight and effective point cloud sequence network referred to as SequentialPointNet for real-time 3D action recognition. Instead of capturing spatio-temporal local structures, SequentialPointNet encodes the temporal evolution of static appearances to recognize human actions. Firstly, we define a novel type of point data, Hyperpoint, to better describe the temporally changing human appearances. A theoretical foundation is provided to clarify the information equivalence property for converting point cloud sequences into Hyperpoint sequences. Secondly, the point cloud sequence modeling task is decomposed into a Hyperpoint embedding task and a Hyperpoint sequence modeling task. Specifically, for Hyperpoint embedding, the static point cloud technology is employed to convert point cloud sequences into Hyperpoint sequences, which introduces inherent frame-level parallelism; for Hyperpoint sequence modeling, a Hyperpoint-Mixer module is designed as the basic building block to learning the spatio-temporal features of human actions. Extensive experiments on three widely-used 3D action recognition datasets demonstrate that the proposed SequentialPointNet achieves competitive classification performance with up to 10X faster than existing approaches.

연구 동기 및 목표

  • 3D 동작 인식을 위한 기존 포인트 클라우드 시퀀스 모델의 비효율성과 높은 계산 비용을 해결하기 위해.
  • 효율적이고 병렬 처리 가능한 처리를 가능하게 하면서도 포인트 클라우드 시퀀스의 완전한 공간적 및 시간적 정보를 유지하기 위해.
  • 정확도를 유지하거나 초월하는 경량이며 고속의 아키텍처를 개발하기 위해.
  • 공간적 및 시간적 특징 학습을 분리하여 3D 동작 인식에서의 표현 학습 향상에 기여하기 위해.

제안 방법

  • PointNet 기반의 공유 가능하고 학습 가능한 하이퍼포인트 임베딩 모듈을 사용하여 각 포인트 클라우드 프레임을 하이퍼포인트로 평탄화하기.
  • 시퀀스 내 각 프레임의 전체 공간적 구조를 유지하기 위해 새로운 데이터 유형인 하이퍼포인트 시퀀스를 도입하기.
  • 내부 프레임 채널 혼합과 프레임 간 혼합을 명시적으로 분리하는 하이퍼포인트 믹서 모듈 설계하기.
  • 프레임 수준 병렬성을 가능하게 하기 위해 프레임 혼합 연산을 특징 혼합 파이프라인의 끝단에 배치하기.
  • 상호 프레임 계산 의존성을 제거하기 위해 주요 모델링 연산을 프레임 수준 단위로 분할하여 동시에 실행 가능하게 하기.
  • 성능과 효율성의 최적 균형을 확보하기 위해 2층의 다중 척도 피라미드 특징 추출 전략을 사용하기.

실험 결과

연구 질문

  • RQ1프레임 수준 병렬 아키텍처는 정확도를 희생시키지 않고도 3D 동작 인식의 추론 속도를 크게 향상시킬 수 있는가?
  • RQ2하이퍼포인트 시퀀스 표현 방식은 동작 인식을 위한 공간적 및 시간적 정보를 효과적으로 유지하는가?
  • RQ3공간적 및 시간적 특징 혼합을 분리함으로써 모델 성능과 학습 효율성이 향상되는가?
  • RQ4정확도와 계산 비용의 균형을 고려할 때 최적의 피라미드 층 수와 포인트 클라우드 프레임 수는 얼마인가?
  • RQ5기존 최신 기술 수준의 포인트 클라우드 시퀀스 모델과 비교해 본다면, 제안된 방법은 속도와 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • SequentialPointNet는 기존 포인트 클라우드 시퀀스 모델 대비 최대 10배 빠른 속도를 기록했으며, 단일 GPU에서 시퀀스당 추론 시간이 단 5ms로 단축되었다.
  • NTU RGB+D 60 데이터셋에서 교차 뷰 정확도 97.6%를 달성하여 기존 최신 기술 수준의 방법들을 능가했다.
  • NTU RGB+D 120 데이터셋에서는 교차 설정 정확도 95.4%를 기록하여 다양한 카메라 설정 간의 강력한 일반화 능력을 입증했다.
  • MSR Action3D에서는 91.94%의 교차 주제 정확도, UTD-MHAD에서는 92.31%의 정확도를 확보하여 다양한 동작 인식 벤치마크에서의 강인함을 확인했다.
  • 비교된 모든 방법들 중에서 가장 경량이며, 총 파라미터 수가 372만 개에 불과하여 MeteorNet, P4Transformer 및 PSTNet보다도 현저히 적은 수였다.
  • 제거 실험 결과, 2층 피라미드와 20프레임이 최적의 성능을 낼 수 있음을 확인했으며, 20프레임 이상에서는 정확도가 안정화됨을 관찰했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.