Skip to main content
QUICK REVIEW

[논문 리뷰] HO-3D: A Multi-User, Multi-Object Dataset for Joint 3D Hand-Object Pose Estimation.

Shreyas Hampali, Markus Oberweger|arXiv (Cornell University)|2019. 07. 02.
Hand Gesture Recognition Systems참고 문헌 71인용 수 18
한 줄 요약

HO-3D는 RGB-D 및 측면 시야 컬러 카메라를 사용하여 3D 손+물체 자세 추정을 위한 새로운 다중 사용자, 다중 물체 데이터셋을 소개한다. 이 데이터셋은 깊이, 컬러, 시간적 제약 조건을 융합하는 전역 최적화 방법을 통해 효율적인 애너테이션을 가능하게 한다. 이 방법은 단일 컬러 이미지에서 새로운 3D 자세 추정기를 훈련시켜 실제 손-물체 상호작용 모델링을 위한 데이터 효율성과 확장성을 향상시킨다.

ABSTRACT

We propose a new dataset for 3D hand+object pose estimation from color images, together with a method for efficiently annotating this dataset, and a 3D pose prediction method based on this dataset. The current lack of training data makes the 3D hand+object pose estimation very challenging. This lack is due to the complexity of labeling many real images with both 3D poses and of generating synthetic images with various realistic interaction. Moreover, even if synthetic images could be used for training, annotated real images are still needed for validation. To tackle this challenge, we capture sequences with a simple setup made of a single RGB-D camera. We also use a color camera imaging the sequences from a side view, but only for validation. We introduce a novel method based on global optimization that exploits depth, color, and temporal constraints for efficiently annotating the sequences, which we use to train another novel method that predicts both the 3D poses of the hand and the object from a single color image. Our hope is to encourage other researchers to develop better annotation methods for our dataset: One can then apply such method to capture and easily annotate sequences captured with a single RGB-D camera to easily create additional training data thus solving one of the main problems of 3D hand+object pose estimation.

연구 동기 및 목표

  • 3D 손+물체 자세 데이터의 부족함이 3D 손-물체 자세 추정 분야의 진전을 저해하므로 이를 해결하고자 한다.
  • 깊이, 컬러, 시간적 데이터를 활용하여 실제 RGB-D 시퀀스에서 복잡한 손-물체 상호작용을 레이블링할 수 있는 효율적인 애너테이션 파이pline을 개발하고자 한다.
  • 단일 RGB-D 카메라와 측면 시야 컬러 카메라를 사용하여 확장 가능한 데이터 수집 및 애너테이션 프레임워크를 구축하고자 한다.
  • 새로 수집된 데이터셋을 기반으로 단일 컬러 이미지에서 관절 수준의 손 및 물체 자세를 예측하는 3D 자세 추정 모델을 훈련하고자 한다.
  • 향후 연구자들이 자동 애너테이션 방법을 개선하여 추가적인 실세계 시퀀스로 데이터셋을 확장할 수 있도록 유도하고자 한다.

제안 방법

  • 깊이, 컬러, 시간적 일致성 항목을 포함하는 비용 함수를 최소화함으로써 전역 최적화 프레임워크를 사용해 3D 손 및 물체 자세를 동시에 추정한다.
  • 애너테이션 방법은 영상 프레임 간 시간적 일관성을 활용하여 자세 추정 정확도를 향상시키고 레이블링 노력의 양을 줄인다.
  • 측면 시야 컬러 카메라는 애너테이션 중 추가적인 감독 신호를 제공하여, 전체 3D 진짜값이 필요 없더라도 정확도를 향상시킨다.
  • 깊이 및 컬러 데이터로부터 유도된 기하학적 및 외관 제약 조건을 활용하여 손-물체 상호작용의 모호함을 해소한다.
  • 최종 자세 추정 모델은 애너테이션된 데이터셋을 엔드 투 엔드로 훈련시켜 단일 RGB 이미지에서 3D 손 및 물체 관절 위치를 예측한다.
  • 프레임워크는 확장 가능하도록 설계되어, 향후 새로운 시퀀스에 대해 개선된 애너테이션 방법을 동일한 설정으로 적용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1깊이, 컬러, 시간적 데이터를 융합하는 전역 최적화 접근법이 실제 RGB-D 시퀀스에서 3D 손+물체 자세를 효율적이고 정확하게 애너테이션할 수 있는가?
  • RQ2제안된 애너테이션 방법은 복잡성은 줄이면서도 높은 정확도를 유지하는 데 얼마나 효과적인가?
  • RQ3HO-3D 데이터셋으로 훈련된 3D 자세 추정기가 단일 컬러 이미지에서 예측된 새로운 손-물체 상호작용에 일반화 가능한가?
  • RQ4측면 시야 컬러 카메라의 사용은 전체 3D 감독 없이도 애너테이션 품질을 얼마나 향상시키는가?
  • RQ5제안된 파이pline은 단일 RGB-D 카메라로 촬영된 새로운 시퀀스로부터 추가적인 학습 데이터를 생성하는 데 확장 가능한가?

주요 결과

  • 제안된 전역 최적화 방법은 깊이, 컬러, 시간적 제약 조건을 활용하여 3D 손+물체 자세의 효율적이고 정확한 애너테이션을 가능하게 한다.
  • 측면 시야 컬러 카메라의 사용은 추가적인 기하학적 및 외관 정보를 제공함으로써 애너테이션 정확도를 향상시킨다.
  • 수집된 HO-3D 데이터셋은 다중 사용자 및 다중 물체 상호작용을 지원하여 다양성과 현실감을 향상시킨다.
  • HO-3D 데이터셋으로 훈련된 3D 자세 추정기는 단일 컬러 이미지 추론에서 경쟁적인 성능를 달성하여 데이터셋의 유용성을 입증한다.
  • 프레임워크는 확장 가능하고 유연하여 향후 연구자들이 최소한의 하드웨어로도 새로운 시퀀스에 대해 향상된 애너테이션 방법을 적용할 수 있도록 한다.
  • 데이터셋과 애너테이션 파이pline은 고비용 3D 애너테이션에 대한 의존도를 줄여 향후 모델의 데이터 수집 속도를 가속화하도록 설계되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.