Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Hand Motion and Interaction Hotspots Prediction from Egocentric Videos

Shaowei Liu, Subarna Tripathi|arXiv (Cornell University)|2022. 04. 04.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 에고세트릭 비디오에서 향후 손-물체 상호작용을 예측하기 위한 새로운 접근법을 제안한다. 손의 운동 궤적과 다음 활성 물체 상의 상호작용 핫스팟(접촉점)을 동시에 예측한다. 객체 중심 트랜스포머(OCT)에 조건부 변동 자동인코더 헤드를 적용하여, 자기주의 어텐션(self-attention)을 통해 손-물체 상호작용을 추론하고, 확률적 샘플링을 통해 불확실성을 모델링한다. 이는 자동으로 대규모 데이터를 수집한 상태에서, Epic-Kitchens-55, Epic-Kitchens-100, EGTEA Gaze+ 데이터셋에서 최신 기준(SOTA) 성능을 달성한다.

ABSTRACT

We propose to forecast future hand-object interactions given an egocentric video. Instead of predicting action labels or pixels, we directly predict the hand motion trajectory and the future contact points on the next active object (i.e., interaction hotspots). This relatively low-dimensional representation provides a concrete description of future interactions. To tackle this task, we first provide an automatic way to collect trajectory and hotspots labels on large-scale data. We then use this data to train an Object-Centric Transformer (OCT) model for prediction. Our model performs hand and object interaction reasoning via the self-attention mechanism in Transformers. OCT also provides a probabilistic framework to sample the future trajectory and hotspots to handle uncertainty in prediction. We perform experiments on the Epic-Kitchens-55, Epic-Kitchens-100, and EGTEA Gaze+ datasets, and show that OCT significantly outperforms state-of-the-art approaches by a large margin. Project page is available at https://stevenlsw.github.io/hoi-forecast .

연구 동기 및 목표

  • 행동 레이블이나 픽셀 수준 예측을 넘어서, 에고세트릭 비디오에서 향후 손-물체 상호작용을 예측하는 것.
  • 확률적 프레임워크를 사용하여 향후 손의 운동과 물체 접촉점의 불확실성을 모델링하는 것.
  • 인간 레이블이 없는 상태에서 자동으로 대규모 데이터 수집 파이프라인을 개발하는 것.
  • 중간 표현으로서의 동시 궤적 및 핫스팟 예측을 활용하여 행동 예측 성능을 향상시키는 것.
  • 정확하고 저차원의 향후 상호작용 예측을 통해 AR 및 로봇 분야에서 인간-AI 협업을 향상시키는 것.

제안 방법

  • 자동 데이터 수집 파이프라인은 시중의 손 검출기와 호모지어피(호모지어피) 투영을 사용하여, 향후 손과 접촉점 위치를 마지막 관측 프레임으로 역으로 투영함으로써, 정렬된 대규모 학습 레이블을 생성한다.
  • 객체 중심 트랜스포머(OCT)는 컨볼루션 네트워크를 통해 입력 프레임의 시각적 특징을 인코딩하며, 손과 물체 특징은 객체 중심 토큰으로, 전체 프레임 특징은 맥락 토큰으로 처리한다.
  • 트랜스포머 인코더 내의 자기주의 어텐션은 여러 프레임에 걸쳐 손, 물체, 환경 맥락을 동시에 고려한 추론을 가능하게 한다.
  • 디코더에 조건부 변동 자동인코더(C-VAE) 헤드를 적용하여, 크로스 어텐션을 통해 유도된 조건부 잠재 변수에서 손 궤적과 상호작용 핫스팟을 예측함으로써 불확실성을 모델링한다.
  • 예측된 궤적과 핫스팟을 자동으로 수집된 레이블과 비교하여 복원 손실을 최소화함으로써 모델을 훈련시킨다.
  • 행동 예측 작업에 대한 미세조정은 OCT 인코더에 머신러닝 헤드(MLP)를 추가하여 수행되며, 학습된 표현의 전이 가능성(transferability)을 입증한다.

실험 결과

연구 질문

  • RQ1행동 레이블이나 픽셀 수준 예측과 비교해 볼 때, 손 궤적과 상호작용 핫스팟을 동시 예측하는 것이 에고세트릭 비디오에서 향후 상호작용 예측 성능을 향상시키는가?
  • RQ2확률적 딥러닝 프레임워크를 통해 향후 손-물체 상호작용의 불확실성을 효과적으로 모델링할 수 있는가?
  • RQ3손 궤적과 핫스팟에 대한 대규모 자동 데이터 수집이 비용이 많이 드는 인간 레이블 기반 데이터셋을 대체할 수 있는가, 성능 저하 없이?
  • RQ4궤적과 핫스팟 예측이 행동 예측과 같은 후행 작업에 얼마나 기여하는가?
  • RQ5손의 운동과 상호작용 핫스팟 간의 조건부 종속성을 모델링하면 예측 정확도가 얼마나 향상되는가?

주요 결과

  • OCT 모델은 Epic-Kitchens-55, Epic-Kitchens-100, EGTEA Gaze+ 데이터셋 전반에서 최신 기준(SOTA) 기법들을 압도적으로 뛰어넘는 성능을 보였다. 특히 손 궤적 및 상호작용 핫스팟 예측에서 뛰어난 성능을 기록했다.
  • 행동 예측 작업에 미세조정한 결과, EK55에서 동사 예측에 4.3%p, 행동 예측에 4.4%p 향상되었고, EK100에서는 동사 예측에 2.9%p, 행동 예측에 2.6%p 향상되었다.
  • C-VAE를 통한 확률적 모델링 덕분에 다양한 불확실성 인식 예측이 가능했으며, 여러 가지 가능한 미래 시나리오의 정성적 시각화 결과에서 이를 확인할 수 있었다.
  • 자동 데이터 수집 파이프라인은 인간 레이블 없이도 대규모 고품질 레이블을 성공적으로 생성하여, 확장 가능한 학습을 가능케 했다.
  • 궤적 추정이 상호작용 핫스팟 예측 성능을 향상시키며, 더 많은 학습 데이터가 성능 향상에 기여함을 보여주어 강력한 데이터 효율성을 입증했다.
  • 궤적과 핫스팟 예측에 사전 훈련된 OCT 모델을 미세조정하면, 무작위 초기화에서 훈련하는 것보다 훨씬 뛰어난 행동 예측 성능을 달성했으며, 이는 학습된 표현의 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.