Skip to main content
QUICK REVIEW

[논문 리뷰] Pose-Based Two-Stream Relational Networks for Action Recognition in Videos

Wei Wang, Jinjin Zhang|arXiv (Cornell University)|2018. 05. 22.
Human Pose and Action Recognition참고 문헌 32인용 수 7
한 줄 요약

이 논문은 비디오 행동 인식을 위한 자세 기반 이중 스트림 상관계망(PSRN)을 제안한다. PSRN은 2D 인간 자세의 동적 특성과 행동과 관련된 물체를 동시에 모델링하며, 자세 시퀀스와 물체 특징을 다중 손실 감독 하에 자세-물체 상관계망을 통해 융합함으로써 Sub-JHMDB(80.2%)와 PennAction(98.1%)에서 최신 기준 성능(SOTA)을 달성한다. 이는 인간-물체 상호작용을 명시적으로 모델링함으로써 이전 방법보다 뛰어난 성능을 내는 데 기여한다.

ABSTRACT

Recently, pose-based action recognition has gained more and more attention due to the better performance compared with traditional appearance-based methods. However, there still exist two problems to be further solved. First, existing pose-based methods generally recognize human actions with captured 3D human poses which are very difficult to obtain in real scenarios. Second, few pose-based methods model the action-related objects in recognizing human-object interaction actions in which objects play an important role. To solve the problems above, we propose a pose-based two-stream relational network (PSRN) for action recognition. In PSRN, one stream models the temporal dynamics of the targeted 2D human pose sequences which are directly extracted from raw videos, and the other stream models the action-related objects from a randomly sampled video frame. Most importantly, instead of fusing two-streams in the class score layer as before, we propose a pose-object relational network to model the relationship between human poses and action-related objects. We evaluate the proposed PSRN on two challenging benchmarks, i.e., Sub-JHMDB and PennAction. Experimental results show that our PSRN obtains the state-the-of-art performance on Sub-JHMDB (80.2%) and PennAction (98.1%). Our work opens a new door to action recognition by combining 2D human pose extracted from raw video and image appearance.

연구 동기 및 목표

  • 실세계 환경에서 확보하기 어려운 3D 자세에 의존하는 자세 기반 행동 인식 방법의 한계를 해결하기 위해.
  • 기존 자세 기반 방법에서 간과되곤 하는 행동과 관련된 물체의 중요성을 고려하여, 인간-물체 상호작용 인식에 기여하기 위해.
  • 분류 레이어에서의 후기 융합이 아닌, 인간 자세와 관련 물체 간의 관계를 모델링하는 체계적인 융합 전략을 개발하기 위해.
  • 원본 비디오에서 추출한 2D 자세 추정치와 공간적 외관 특징만을 사용하여 효과적인 행동 인식을 가능하게 하여 실용성과 성능을 향상시키기 위해.

제안 방법

  • 개선된 OpenPose 모델을 사용하여 비디오 프레임에서 다중 인물의 2D 자세를 추출한 후, 타겟 인물의 자세를 선택하기 위해 주의 메커니즘을 적용한다.
  • 자세의 위치와 속도에 대해 각각 별도의 양방향 LSTM-RNN을 사용하여 자세의 동적 특성을 모델링함으로써 시간적 운동 패턴을 포착한다.
  • 사전 훈련된 VGG16 네트워크를 사용하여 무작위로 선택된 비디오 프레임에서 공간적 물체 특징을 추출하여 행동과 관련된 물체를 표현한다.
  • 자세 표현(각각 LSTM에서 유도된 것)과 물체 특징 맵을 융합하기 위해 자세-물체 상관계망을 구성하며, 물체 특징 맵의 각 열을 후보 물체로 간주한다.
  • 각 후보 물체를 자세의 은닉 상태 h^L_T 및 h^V_T와 조합하여 관계 특징 R을 계산함으로써 자세-물체 상호작용을 공동으로 모델링한다.
  • 자세 위치 LSTM, 자세 속도 LSTM, 최종 관계 특징 R에 각각 분류 손실을 적용하여 다중 손실 감독을 수행함으로써, 개선된 특징 표현을 갖는 엔드 투 엔드 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ12D 자세 시퀀스와 공간적 물체 특징을 융합하는 이중 스트림 네트워크가 자세 전용 또는 외관 전용 기반선 대비 행동 인식 성능 향상에 기여하는가?
  • RQ2인간 자세와 행동과 관련된 물체 간의 상관계망 상호작용을 모델링할 경우, 특히 시각적으로 유사한 행동에 대해 일반화 능력 향상과 오분류 감소에 기여하는가?
  • RQ3최종 분류 레이어 이전에 작동하는 상관계망 융합 기법이 기존의 후기 융합 전략보다 이중 스트림 네트워크에서 더 우수한 성능을 내는가?
  • RQ43D 자세가 아닌 원본 비디오에서 추출한 2D 자세 추정치를 사용할 경우, 실세계 환경에서의 성능와 실용적 구현에 어떤 영향을 미치는가?
  • RQ5제안된 다중 손실 감독 전략이 자세의 동적 특성과 자세-물체 관계 학습에 얼마나 효과적인가?

주요 결과

  • PSRN은 Sub-JHMDB에서 상위-1 정확도 80.2%를 기록하여 이전 방법들, 특히 RPAN(78.6%)을 초월하는 최신 기준 성능(SOTA)을 달성한다.
  • 더 어려운 PennAction 데이터셋에서는 98.1%의 정확도를 기록하여 RPAN(97.4%)을 크게 앞서며, 오분류 수를 31건에서 20건으로 줄였다.
  • 제거 실험 결과, 양방향 LSTM과 주의 메커니즘의 조합이 자세 표현 학습을 향상시키는 것으로 확인되었으며, 전체 PSRN(양방향 LSTM + 주의)은 Sub-JHMDB에서 83.7%, PennAction에서 98.1%의 성능을 기록했다.
  • 자세-물체 상관계망은 핵심 요소이다: 상관계망 모듈을 포함한 이중 스트림 융합이 모든 다른 스트림 융합 변형보다 뛰어난 성능을 보이며, 상호작용을 효과적으로 모델링하고 있음을 입증한다.
  • 혼동 행렬 분석 결과, PSRN은 유사한 행동 간 오분류를 감소시켰다(예: tennis_forehand vs. tennis_serve, squat vs. bench_press), 행동의 동적 특성과 물체 맥락을 더 잘 모델링하고 있음을 시사한다.
  • 특정 물체를 다루는 행동(예: bench_press, squat, 테니스 동작 등)에서 모델의 성능 향상이 가장 두드러지며, 물체와의 상관계모델링의 중요성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.