Skip to main content
QUICK REVIEW

[논문 리뷰] Forecasting Human-Object Interaction: Joint Prediction of Motor Attention and Actions in First Person Video

Miao Liu, Siyu Tang|arXiv (Cornell University)|2019. 11. 25.
Human Pose and Action Recognition참고 문헌 67인용 수 7
한 줄 요약

이 논문은 제1인칭 영상에서 향후 손 움직임(모터 주의), 상호작용 핫스팟(물체 위의 핵심 접촉 지점), 그리고 향후 행동을 동시에 예측하는 새로운 딥러닝 모델을 제안한다. 모터 주의를 확률 변수로 모델링함으로써, 네트워크는 예측된 손 움직임을 활용해 시공간적 특징 선택을 유도하며, EGTEA Gaze+와 EPIC-Kitchens에서 행동 예측 및 핫스팟 정렬 작업에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

We address the challenging task of anticipating human-object interaction in first person videos. Most existing methods ignore how the camera wearer interacts with the objects, or simply consider body motion as a separate modality. In contrast, we observe that the international hand movement reveals critical information about the future activity. Motivated by this, we adopt intentional hand movement as a future representation and propose a novel deep network that jointly models and predicts the egocentric hand motion, interaction hotspots and future action. Specifically, we consider the future hand motion as the motor attention, and model this attention using latent variables in our deep model. The predicted motor attention is further used to characterise the discriminative spatial-temporal visual features for predicting actions and interaction hotspots. We present extensive experiments demonstrating the benefit of the proposed joint model. Importantly, our model produces new state-of-the-art results for action anticipation on both EGTEA Gaze+ and the EPIC-Kitchens datasets. Our project page is available at https://aptx4869lm.github.io/ForecastingHOI/

연구 동기 및 목표

  • 의도적인 손 움직임을 모터 주의로 모델링하여 제1인칭 영상에서 인간-물체 상호작용을 예측하는 과제를 해결하기 위해.
  • 모터 주의를 상호작용 핫스팟 예측과 통합하여 행동 예측 성능을 향상시키기 위해.
  • 확률적 딥러닝을 사용해 향후 손 움직임과 물체 상호작용 영역의 불확실성을 함께 모델링하기 위해.
  • 모터 주의가 에고세트릭 비전에서 시각적 예측을 위한 핵심 예측 표현임을 입증하기 위해.

제안 방법

  • 모델은 미래 손 궤적을 모터 주의로 간주하며, 스위치 유닛을 사용해 확률 변수로 표현하는 딥 네트워크를 사용한다.
  • 모터 주의는 행동 및 핫스팟 예측을 위한 특징적인 시공간적 시각적 특징에 주의를 기울이는 데 사용된다.
  • 상호작용 핫스팟은 물체 위의 가능성이 높은 접촉 영역을 강조하는 공간 주의 맵으로 예측된다.
  • 모델은 지도 학습을 위해 참값 모터 주의, 상호작용 핫스팟, 행동 레이블을 감독 신호로 사용한다.
  • 통합 학습 프레임워크를 통해 모터 주의, 핫스팟, 행동 예측의 엔드 투 엔드 최적화가 가능하다.
  • 추론 과정에서는 액션 발생 직전의 영상 클립에서 세 가지 출력을 동시에 예측한다.

실험 결과

연구 질문

  • RQ1모터 주의를 확률적 표현으로 모델링하면 제1인칭 영상에서 행동 예측 성능이 향상되는가?
  • RQ2모터 주의와 상호작용 핫스팟을 함께 예측하는 것이 향후 행동 예측 성능에 어떻게 기여하는가?
  • RQ3물체가 모호할 경우 모터 주의가 향후 상호작용 영역을 얼마나 잘 국소화하는가?
  • RQ4추론 과정에서 관측된 손 좌표가 필요 없이도 모델이 손 궤적을 예측할 수 있는가?
  • RQ5EGTEA Gaze+와 EPIC-Kitchens와 같은 다양한 에고세트릭 데이터셋 간에 모델이 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 모델은 EPIC-Kitchens에서 F1 스코어 29.6, EGTEA Gaze+에서 25.69를 기록하며 기존 방법보다 각각 3.6%, 5.4% 향상된 새로운 최신 기술 수준 성능을 달성했다.
  • EGTEA Gaze+에서 평균 이격 오차는 0.23, 최종 이격 오차는 0.36를 기록했으며, 관측된 손 좌표가 필요 없음에도 불구하고 칼만 필터 및 GPR보다 우수하고, LSTM 성능과 유사하게 유지했다.
  • 모호한 상황에서도 상호작용 핫스팟을 성공적으로 예측했으며, 예를 들어 '스토브 조작' 시에 스토브 노브를 정확히 상호작용 지점으로 식별했다.
  • 시각화 결과에서 예측된 모터 주의가 손이 보이지 않는 경우에도 항상 올바른 물체와 상호작용 영역에 주의를 기울이는 것으로 나타났다.
  • EPIC-Kitchens에서는 EGTEA Gaze+보다 더 우수한 일반화 성능를 보였으며, 이는 더 많은 학습 샘플이 확보되어 있기 때문일 것이다.
  • 미래의 활성 물체가 보이지 않을 경우 실패 케이스가 발생하여, 향후 모델에 논리적 추론을 통합할 필요가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.