Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Human Hands in Contact at Internet Scale

Dandan Shan, Jiaqi Geng|arXiv (Cornell University)|2020. 06. 11.
Human Pose and Action Recognition참고 문헌 32인용 수 7
한 줄 요약

이 논문은 인터넷 스케일 비디오에서 RGB 영상에서 풍부한 손 접촉 상태—손 위치, 측면(좌/우), 접촉 유형(없음, 자기 자신, 다른 사람, 비이동식 물체, 이동식 물체), 그리고 물체 경계 상자—를 추론하기 위한 다중 작업 딥러닝 모델을 제안한다. 새로운 10만 프레임 데이터셋(100DOH)과 131일 분량의 원시 영상으로 훈련된 모델은 VOC AP 90%를 달성하며, 후속 3D 메시 재구성과 자기지도 기반 메시 품질 평가(90% AUROC)를 가능하게 하여 대규모 인간-물체 상호작용 분석의 실현 가능성을 입증한다.

ABSTRACT

Hands are the central means by which humans manipulate their world and being able to reliably extract hand state information from Internet videos of humans engaged in their hands has the potential to pave the way to systems that can learn from petabytes of video data. This paper proposes steps towards this by inferring a rich representation of hands engaged in interaction method that includes: hand location, side, contact state, and a box around the object in contact. To support this effort, we gather a large-scale dataset of hands in contact with objects consisting of 131 days of footage as well as a 100K annotated hand-contact video frame dataset. The learned model on this dataset can serve as a foundation for hand-contact understanding in videos. We quantitatively evaluate it both on its own and in service of predicting and learning from 3D meshes of human hands.

연구 동기 및 목표

  • 인터넷 스케일 비디오 데이터를 활용해 인간의 손이 물체와 접촉하는 상황을 대규모로 이해할 수 있도록 하는 것.
  • 소비자 영상에서 극한의 시점 및 맥락 다양성이 존재하는 문제를 해결하여 기존 실험실 기반 손 분석 방법의 한계를 극복하는 것.
  • 3D 메시 재구성과 같은 후속 작업에 활용 가능한 풍부한 손 상태 표현(위치, 측면, 접촉 상태, 물체 상자)을 추론할 수 있는 강력하고 일반화 능력이 뛰어난 시스템을 개발하는 것.
  • 훈련 및 평가를 지원하기 위해 대규모, 다양한, 풍부하게 애너테이션된 데이터셋(100DOH)을 구축하는 것.
  • 실제 유튜브 영상에서 3D 메시 재구성과 품질 평가를 가능하게 하는 시스템의 유용성을 입증하는 것.

제안 방법

  • 손 경계 상자, 손 측면(좌/우), 접촉 상태(5개 클래스), 그리고 접촉 중인 물체의 경계 상자를 예측하는 다중 작업 딥러닝 모델을 제안한다.
  • 장르 태그 기반 웹 스크래핑을 통해 수집한 131일 분량의 영상 데이터셋의 10만 프레임 서브셋(100DOH)을 사용해 모델을 훈련하며, 손 상태 및 접촉에 대한 풍부한 인간 애너테이션을 활용한다.
  • 예측된 손 측면과 위치를 기반으로 최신 기술(예: [21])을 활용해 비정형 인터넷 영상에서의 3D 메시 재구성 가능성을 높인다.
  • 자기지도 기반 메시 품질 평가 방법을 도입하여, 메시 생성의 자기 일관성에서 유도된 양/음성 레이블을 기반으로 다층퍼셉트론(MLP)을 훈련하며, 인간 애너테이션 데이터 기반으로 90% AUROC를 달성한다.
  • 메시의 타당성과 향후 예측 성능 평가를 위해 사전 검증 및 감시자(센티넬)를 포함한 이중 선택 인간 평가 프로토콜을 활용한다.
  • 도메인 외부 영상에서의 일반화 성능을 검증하며, 인간 평가에서 예측된 그립 방식이 무작위 그립보다 72%의 선호도를 확보함으로써 복잡한 시나리오에서 실제 신호를 효과적으로 추출함을 입증한다.

실험 결과

연구 질문

  • RQ1극한의 시점 및 스케일 변화가 존재하는 다양한 인터넷 영상에서 딥러닝 모델이 높은 일반화 성능(예: 90% VOC AP)을 달성할 수 있는가?
  • RQ2예측된 손 상태(위치, 측면, 접촉 유형)가 비정형 실생활 영상에서 3D 메시 재구성에 신뢰할 수 있는 기초가 될 수 있는가?
  • RQ3자기지도 기반 방법이 정답 메시가 없이도 예측의 일관성만으로 타당한 3D 손 메시 재구성을 효과적으로 식별할 수 있는가?
  • RQ4시스템의 출력이 정적 이미지에서 향후 인간-물체 상호작용을 예측하는 등 의미 있는 후속 학습을 가능하게 하는가?
  • RQ5인간 평가에서 모델의 예측이 랜덤 그립보다 얼마나 높은 선호도를 확보하는가? 이는 복잡한 시나리오에서 실제 신호를 효과적으로 추출했음을 시사한다.

주요 결과

  • 제안된 모델은 손 검출 및 접촉 상태 예측에서 VOC AP 90%를 달성하며, 다양한 데이터셋에서 잘 일반화되며, 때로는 도메인 내 훈련 및 테스트 성능을 초월한다.
  • 시스템은 정확한 손 측면과 위치 예측을 통해 유튜브 영상에 3D 메시 재구성 기법(예: [21])을 적용할 수 있도록 하여, 정확한 메시 생성에 필수적인 요소를 제공한다.
  • 자기지도 기반 메시 품질 평가 방법은 90% AUROC를 달성하며, 기준 다변량 정규분포 가능성 방법(60% AUROC)보다 뚜렷이 뛰어나, 양/음성 예측 예측의 레이블이 가치가 있음을 입증한다.
  • 군중 평가자들은 두 가지 선택 평가에서 예측된 메시가 랜덤 메시보다 72%의 선호도를 보였으며, 이는 모델이 이미지에서 의미 있고 타당한 손 구성을 효과적으로 추출했음을 시사한다.
  • 모델은 영상 시퀀스에서 접촉 상태 변화를 성공적으로 식별하며, 3,000개의 타당한 손-물체 상호작용 예시를 재구성할 수 있었으며, 정성적 결과는 다양한 상황에서 정확한 그립 각도 예측이 가능함을 보여준다.
  • 131일 분량의 다양한 영상 자료와 10만 개의 애너테이션 프레임을 포함하는 100DOH 데이터셋은 고성능 훈련을 지원하며, 대규모 인간-물체 상호작용 이해 분야의 새로운 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.