Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting Human Activities Using Stochastic Grammar

Siyuan Qi, Siyuan Huang|arXiv (Cornell University)|2017. 08. 02.
Human Pose and Action Recognition참고 문헌 2인용 수 3
한 줄 요약

이 논문은 부분적으로 관측된 RGB-D 영상에서 향후 인간 행동을 예측하기 위해 공간-시간 AND-OR 그래프(ST-AOG)를 사용하는 확률적 문법 기반 모델을 제안한다. 시간적 확률적 문법과 이어리 parsing을 통해 인간 행동, 물체, 그리고 기능을 통합하여 향후 하위 활동과 관련 레이블을 추론하며, 기준 데이터셋에서 의미적 이벤트 파싱 및 향후 행동 예측 분야에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This paper presents a novel method to predict future human activities from partially observed RGB-D videos. Human activity prediction is generally difficult due to its non-Markovian property and the rich context between human and environments. We use a stochastic grammar model to capture the compositional structure of events, integrating human actions, objects, and their affordances. We represent the event by a spatial-temporal And-Or graph (ST-AOG). The ST-AOG is composed of a temporal stochastic grammar defined on sub-activities, and spatial graphs representing sub-activities that consist of human actions, objects, and their affordances. Future sub-activities are predicted using the temporal grammar and Earley parsing algorithm. The corresponding action, object, and affordance labels are then inferred accordingly. Extensive experiments are conducted to show the effectiveness of our model on both semantic event parsing and future activity prediction.

연구 동기 및 목표

  • 마르코프 가정을 초월한 인간 행동의 계층적이고 구성적인 구조를 모델링하기 위해.
  • 부분적인 영상 관측에서 현재 활동 상태를 온라인으로 추론하고 향후 행동을 예측할 수 있도록 하기 위해.
  • 인간 행동, 상호작용하는 물체, 물체의 기능을 함께 모델링하여 더 풍부한 공간-시간 맥락을 포착하기 위해.
  • 큰 향후 상태 공간에서 예측하는 데 도전하는 문제를 기호적 추론과 확률적 문법을 통해 해결하기 위해.

제안 방법

  • 시간적 확률적 문법(T-AOG)과 공간 그래프(S-AOG)를 조합하여 하위 활동을 모델링하는 공간-시간 AND-OR 그래프(ST-AOG)를 사용하여 인간 행동을 표현한다.
  • 하위 활동을 확률적 문맥 자유 문법의 비단말 기호로 모델링하고, 종단기호는 행동-물체-기능 트리플릿을 나타낸다.
  • 현재 관측과 문법 규칙에 기반해 다음 하위 활동을 기호적으로 예측하기 위해 이어리 파싱 알고리즘을 사용한다.
  • 예측된 시퀀스의 확률을 추정하기 위해 비터비 스타일 추론을 사용해 파싱 가능성도 계산한다.
  • 해당 파싱된 하위 활동 예측과 학습된 특징 표현을 결합하여 행동, 물체, 기능 레이블을 추론한다.
  • 트레이닝 중 등가 클래스를 부트스트랩하기 위해 커버리지 임계값 0.5와 컨텍스트 윈도우 크기 4를 사용한다.

실험 결과

연구 질문

  • RQ1비마르코프, 계층적인 인간 행동의 구조를 어떻게 모델링할 수 있을까? 이는 향후 예측을 지원할 수 있도록 하기 위함이다.
  • RQ2물체의 기능과 공간 맥락은 행동 예측 정확도 향상에 어떤 역할을 하는가?
  • RQ3확률적 문법 모델이 RGB-D 영상 시퀀스에서 구성적 이벤트 구조를 효과적으로 포착할 수 있는가?
  • RQ4기호적 파싱과 이어리 알고리즘은 엔드 투 엔드 딥 러닝 모델에 비해 행동 예측에서 어떻게 비교되는가?
  • RQ5부분적인 영상 관측만으로도 모델이 새로운 향후 상태로 일반화할 수 있는 정도는 어느 정도인가?

주요 결과

  • 제안된 ST-AOG 모델은 SVM, LSTM, VGG-16와 같은 베이스라인 방법보다 행동 검출 및 향후 행동 예측 과제에서 뛰어난 성능을 보였다.
  • 확률적 문법과 이어리 파싱의 활용은 높은 정확도로 향후 하위 활동을 효과적으로 기호적으로 예측할 수 있도록 했다.
  • 물체의 기능과 공간 맥락을 통합함으로써, 이러한 요소를 忽시하는 모델에 비해 예측 성능이 크게 향상되었다.
  • 모델는 의미적 이벤트 파싱에서 뛰어난 성능을 달성하여 영상에서 계층적 행동 구조를 회복할 수 있음을 보여주었다.
  • 비터비 스타일 추론을 통한 파싱 가능성 계산은 예측된 향후 상태에 대한 신뢰할 수 있는 확률 추정치를 제공한다.
  • 제거 실험 결과, 시간적 문법과 공간 맥락 구성 요소가 최적의 성능을 내기 위해 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.