Skip to main content
QUICK REVIEW

[논문 리뷰] Skeleton-based Action Recognition of People Handling Objects

Sunoh Kim, Kimin Yun|arXiv (Cornell University)|2019. 01. 21.
Human Pose and Action Recognition참고 문헌 37인용 수 9
한 줄 요약

이 논문은 뼈대 데이터를 사용하여 인간 자세 그래프와 물체 관련 인간 자세 그래프를 모두 모델링함으로써 물체 관련 인간 행동을 인식하는 그래프 컨볼루션 네트워크 프레임워크인 OHA-GCN을 제안한다. 높은 신뢰도를 가진 프레임을 선택하고, 자세 추정 및 배경 제거를 통해 물체 자세를 통합함으로써 실시간 성능을 달성하며, 기준 및 자체 수집 데이터셋(불법 쓰레기 투기 데이터셋 포함)에서 최신 기술보다 뛰어난 성능을 보였다.

ABSTRACT

In visual surveillance systems, it is necessary to recognize the behavior of people handling objects such as a phone, a cup, or a plastic bag. In this paper, to address this problem, we propose a new framework for recognizing object-related human actions by graph convolutional networks using human and object poses. In this framework, we construct skeletal graphs of reliable human poses by selectively sampling the informative frames in a video, which include human joints with high confidence scores obtained in pose estimation. The skeletal graphs generated from the sampled frames represent human poses related to the object position in both the spatial and temporal domains, and these graphs are used as inputs to the graph convolutional networks. Through experiments over an open benchmark and our own data sets, we verify the validity of our framework in that our method outperforms the state-of-the-art method for skeleton-based action recognition.

연구 동기 및 목표

  • 자세 추정이 오류가 많고 맥락적 물체 정보가 종종 忽시되는 제약 조건이 없는 감시 환경에서 물체 관련 인간 행동을 인식하는 데 도전하는 것.
  • 그래프 표현에 물체 자세를 통합하여 뼈대 기반 행동 인식을 향상시키고 인간-물체 상호작용의 맥락적 이해를 강화하는 것.
  • 오차가 있는 자세 추정과 모호한 프레임을 다룰 수 있도록 정보성 프레임 선택과 이중 스트림 GCN 아키텍처를 통해 실시간이고 강력한 프레임워크를 개발하는 것.
  • 공개 기준 데이터셋과 실제 제약 조건이 있는 환경에서 불법 쓰레기 투기 영상을 수집한 새로운 데이터셋을 기반으로 프레임워크를 검증하는 것.

제안 방법

  • 자세 추정 및 배경 제거를 사용하여 인간과 물체 자세에서 뼈대 그래프를 구성하며, 노드는 관절과 물체 위치를 나타낸다.
  • 자세 신뢰도 점수를 기반으로 각 영상 세그먼트에서 하나의 고신뢰도 프레임을 선택하는 프레임 선택 전략을 적용하여 노이즈와 모호성을 감소시킨다.
  • 두 가지 유형의 그래프를 형성한다: (1) 공간과 시간에서의 신체 움직임을 캡처하는 인간 자세 그래프, (2) 인간-물체 간 공간-시간적 관계를 모델링하는 물체 관련 인간 자세 그래프.
  • 이중 스트림 GCN 아키텍처는 두 그래프 유형을 별도로 처리하며, 그래프 컨볼루션을 노드와 그 이웃에 적용하여 시공간적 특징을 추출한다.
  • 최종 예측은 두 스트림의 특징을 융합하여 인간 운동과 인간-물체 상호작용을 공동으로 모델링한다.
  • 시스템은 자세 추정에 OpenPose를 사용하며, 흐름 매칭을 통한 히ュ그렌 매칭을 통합하여 다수의 인물이 있는 장면에서 개별 액터를 분리한다.

실험 결과

연구 질문

  • RQ1제약 조건이 없는 환경에서 뼈대 그래프에 물체 자세를 통합하면 물체 관련 인간 행동 인식 성능이 향상되는가?
  • RQ2자세 신뢰도 점수에 기반한 정보성 프레임 선택 전략이 뼈대 기반 행동 인식의 강건성과 성능에 어떤 영향을 미치는가?
  • RQ3인간 자세와 물체 관련 인간 자세 그래프를 처리하는 이중 스트림 GCN 아키텍처가 단일 스트림 방법보다 더 높은 정확도를 달성할 수 있는가?
  • RQ4전체 감시 파이프라인에 구현했을 때 제안된 프레임워크의 실시간 성능는 어떠한가?

주요 결과

  • OHA-GCN 프레임워크는 ICVL-4 데이터셋에서 91.86%의 정확도를 기록하여 최신 기술인 ST-GCN 방법(80.23%)을 능가했다.
  • 이 방법은 초당 약 3571 프레임의 속도로 작동하여, 프레임당 17.26ms 소요되는 RGB 기반 CNN인 ResNet50보다 훨씬 빠르다.
  • 자세 추정 및 GCN 추론을 포함한 전체 파이프라인은 평균 프레임당 94.78ms(10.6 FPS)로 작동하여 실시간 감시 시스템의 구현 가능성을 입증했다.
  • 정보성 프레임 선택 전략을 사용함으로써, 훈련 및 추론 중 저신뢰도 또는 모호한 자세의 영향을 줄여 모델의 강건성을 향상시켰다.
  • 제안된 불법 쓰레기 투기(IRD) 데이터셋은 실제 제약 조건이 있는 환경에서 물체 관련 행동 인식 평가를 위한 현실적인 비디오 데이터를 제공한다.
  • 이중 스트림 GCN 아키텍처는 인간 자세 그래프와 물체 관련 인간 자세 그래프를 통합하여 가장 높은 성능를 기록했으며, 인간-물체 상호작용을 명시적으로 모델링하는 가치를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.