Skip to main content
QUICK REVIEW

[논문 리뷰] Human Pose-based Estimation, Tracking and Action Recognition with Deep Learning: A Survey

Lijuan Zhou, Xiang Meng|arXiv (Cornell University)|2023. 10. 19.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 종합 검토는 딥러닝 기반의 인간 자세 추정, 추적, 행동 인식에 대한 종합적이고 통합적인 리뷰를 제공하며, 이들 간의 상호연결성과 종단간 프레임워크로의 통합을 강조한다. 2D/3D, 단일/다중 인물, 이미지/비디오 환경에서의 최신 기법을 분석하고, 효율성, 제로샷 학습, 다중모달 융합 분야에서의 핵심 과제와 향후 방향성을 규명한다.

ABSTRACT

Human pose analysis has garnered significant attention within both the research community and practical applications, owing to its expanding array of uses, including gaming, video surveillance, sports performance analysis, and human-computer interactions, among others. The advent of deep learning has significantly improved the accuracy of pose capture, making pose-based applications increasingly practical. This paper presents a comprehensive survey of pose-based applications utilizing deep learning, encompassing pose estimation, pose tracking, and action recognition.Pose estimation involves the determination of human joint positions from images or image sequences. Pose tracking is an emerging research direction aimed at generating consistent human pose trajectories over time. Action recognition, on the other hand, targets the identification of action types using pose estimation or tracking data. These three tasks are intricately interconnected, with the latter often reliant on the former. In this survey, we comprehensively review related works, spanning from single-person pose estimation to multi-person pose estimation, from 2D pose estimation to 3D pose estimation, from single image to video, from mining temporal context gradually to pose tracking, and lastly from tracking to pose-based action recognition. As a survey centered on the application of deep learning to pose analysis, we explicitly discuss both the strengths and limitations of existing techniques. Notably, we emphasize methodologies for integrating these three tasks into a unified framework within video sequences. Additionally, we explore the challenges involved and outline potential directions for future research.

연구 동기 및 목표

  • 기존 검토에서 별개로 다뤄지는 딥러닝 기반의 인간 자세 추정, 추적, 행동 인식에 대한 종합적이고 통합적인 리뷰 제공.
  • 자세 추정, 추적, 행동 인식 간 상호의존성을 분석하여 각 작업이 상호 지원하는 방식을 부각.
  • 계산 복잡도, 뼈대 기반 제로샷 학습, 행동 인식에서의 다중모달 융합과 같은 핵심 과제 규명.
  • 자세 추정, 추적, 행동 인식을 동시에 최적화하는 종단간 통합 모델 개발을 주장하여 실용성과 성능 향상.
  • 오염, 저해상도 입력 처리 및 정확도와 추론 효율성의 균형 유지와 같은 향후 연구 방향 개선.

제안 방법

  • 자세 추정(2D/3D, 단일/다중 인물), 자세 추적(후처리 대비 통합, 상향식 대비 하향식), 행동 인식(추정된 자세 대비 뼈대 기반)에 걸쳐 기법을 체계적으로 분류.
  • CNN, RNN, GCN, Transformer를 포함한 딥러닝 아키텍처를 검토하며, 뼈대 시퀀스에 대한 응용에 중점을 둔다.
  • RGB 영상 입력을 사용하여 자세 추정, 추적, 행동 인식을 동시에 수행하는 종단간 프레임워크 분석. 시간적 일관성과 정확도 향상.
  • 표준 데이터셋에서의 성능 평가 및 mAP, 정확도 등의 지표를 사용한 메트릭 비교를 통해 복잡도와 성능 간의 상충관계 규명.
  • 입력 모odal(이미지, 비디오), 작업 유형(추정, 추적, 인식), 아키텍처(GCN, Transformer 등)를 기반으로 기법의 분류 체계 제안.
  • Transformer 및 GCN 기반 모델에서 계산 비용을 줄이기 위한 효율적인 어텐션 메커니즘(예: 토큰 프루닝) 및 경량 GCN 기법 논의.
Figure 1: The taxonomy of this survey.
Figure 1: The taxonomy of this survey.

실험 결과

연구 질문

  • RQ1딥러닝 기반 인간 운동 분석에서 자세 추정, 자세 추적, 행동 인식은 어떻게 상호연결되어 있는가?
  • RQ2자세 추정, 추적, 행동 인식을 동시에 수행하는 현재의 통합 모델의 핵심 한계는 무엇인가?
  • RQ3뼈대 기반 행동 인식을 위한 트랜스포머 기반 모델에서 계산 복잡도를 어떻게 줄일 수 있는가?
  • RQ4뼈대 기반 행동 인식에서 제로샷 학습의 전망과 과제는 무엇인가?
  • RQ5RGB, 뼈대, 텍스트와 같은 다중모달 융합을 효과적이고 일반적으로 적용하기 위해 어떻게 구현할 수 있는가?

주요 결과

  • 자세 추정, 추적, 행동 인식을 통합된 딥러닝 프레임워크로 통합하면 파이프라인 기반 접근 대비 성능 향상과 시간적 일관성 향상이著しく 향상된다.
  • 트랜스포머 기반 모델과 그래프 신경망(GCN)을 조합한 모델은 행동 인식에서 최신 기술 성능을 달성하지만, 순차 길이에 따라 정사각형 비례로 메모리와 계산 복잡도가 증가한다.
  • 어텐션 메커니즘에서 중요한 토큰을 선택하거나 프루닝하면 정확도 손실 없이 트랜스포머 기반 모델의 계산 비용을 줄일 수 있다.
  • 제로샷 뼈대 기반 행동 인식는 여전히 미비하게 다뤄져 있으며, 텍스트 기반 설명을 활용해 액션을 임베딩으로 매핑하여 일반화 능력을 향상시키는 방법은 소수에 그친다.
  • RGB, 뼈대, 텍스트 데이터를 융합한 다중모달 융합은 시각적으로 유사한 행동을 구분하고 제로샷 학습을 가능하게 하여 잠재력을 보이나, 일반화 가능하고 모델 독립적인 융합 전략이 부족하다.
  • 자세 추정과 행동 인식을 위한 현재의 통합 모델(예: UPS)은 별도의 모델 대비 성능이 열등하여 더 효과적인 공동 최적화 프레임워크 개발이 필요하다.
Figure 2: The relationship among the three tasks.
Figure 2: The relationship among the three tasks.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.