[논문 리뷰] HOH: Markerless Multimodal Human-Object-Human Handover Dataset with Large Object Count
이 논문은 136종의 다양한 물체, 2,720회의 상호작용, 40명의 참가자 쌍(역할 전환 포함)을 포함한, 처음으로 완전히 마커리스, 대규모의 다중모odal 인간-인간 수거 데이터셋인 HOH를 소개한다. 4대의 다중시점 RGB-D 카메라와 4대의 깊이 카메라로 촬영되어, 3D 포인트 클라우드, 스켈레톤, 손과 물체 분할, 抓握 유형, 편안함 평가 등이 제공되며, 높은 현실감과 다양성을 바탕으로 한 손잡이, 자세, 궤적 예측을 위한 데이터 기반 AI 연구를 가능하게 한다.
We present the HOH (Human-Object-Human) Handover Dataset, a large object count dataset with 136 objects, to accelerate data-driven research on handover studies, human-robot handover implementation, and artificial intelligence (AI) on handover parameter estimation from 2D and 3D data of person interactions. HOH contains multi-view RGB and depth data, skeletons, fused point clouds, grasp type and handedness labels, object, giver hand, and receiver hand 2D and 3D segmentations, giver and receiver comfort ratings, and paired object metadata and aligned 3D models for 2,720 handover interactions spanning 136 objects and 20 giver-receiver pairs-40 with role-reversal-organized from 40 participants. We also show experimental results of neural networks trained using HOH to perform grasp, orientation, and trajectory prediction. As the only fully markerless handover capture dataset, HOH represents natural human-human handover interactions, overcoming challenges with markered datasets that require specific suiting for body tracking, and lack high-resolution hand tracking. To date, HOH is the largest handover dataset in number of objects, participants, pairs with role reversal accounted for, and total interactions captured.
연구 동기 및 목표
- 로봇공학 및 인지과학 분야에서 대규모, 다양한, 현실적인 인간-수거 데이터셋의 부족을 해소하기 위해.
- 마커 기반 운동 캡처의 한계를 극복하기 위해, 의복 다양성 제한과 고해상도 손 및 물체 기하학의 결여를 해결하기 위해.
- 풍부하고 다중모달적이며 완전히 애너테이션 처리된 3D 상호작용 데이터를 제공함으로써, 인간-로봇 수거에 대한 데이터 기반 연구를 가능하게 하기 위해.
- 2D 및 3D 데이터로부터 손잡이 유형, 물체 방향, 수거 궤적을 예측하기 위한 AI 모델 개발을 지원하기 위해.
- 자연스럽고 비언어적 조율 및 인간 상호작용에서의 편안함을 캡처함으로써, 사회적 로봇 설계를 향상시키기 위해.
제안 방법
- 360도 할로세트릭 뷰를 확보하기 위해, 4대의 동기화된 30fps Kinect RGB-D 카메라와 4대의 60fps FLIR Point Grey 깊이 카메라를 사용하여 2,720회의 인간-인간 수거 상호작용을 촬영하였다.
- 핵심 이벤트에서 물체, 주는 손, 받는 손 마스크의 수동 애너테이션을 보조하기 위해 Segment Anything Model(SAM)을 사용하였다.
- 전체 360도 융합 3D 포인트 클라우드, OpenPose 스켈레톤, 첫 번째 잡기에서 마지막 접촉까지 손과 물체 마스크를 추적하였다.
- Cini 등(2022)의 분류 체계를 사용하여 손잡이 유형을 애너테이션 처리하였으며, 수거 후 주는 이와 받는 이의 손잡이 유형, 편안함 평가를 기록하였다.
- 모든 136개의 물체에 대해 정렬된 3D 물체 모델과 메타데이터를 제공하였으며, 이는 116종의 상점에서 구매한 물체와 20종의 3D 프린팅된 물체로 구성되며, 17개의 형태/기능 카테고리에 속한다.
- 이 데이터셋을 기반으로 신경망을 훈련시켜 손잡이, 자세 방향, 궤적 예측을 수행하였으며, 기준 모델 대비 향상된 성능을 입증하였다.
실험 결과
연구 질문
- RQ1물체 기하학 및 물리적 성질이 자연스럽고 마커리스 환경에서 인간의 수거 행동에 어떤 영향을 미치는가?
- RQ2이 데이터셋으로 훈련된 신경망이 얼마나 정확하게 손잡이 유형, 물체 방향, 수거 궤적을 예측할 수 있는가?
- RQ3편안함 평가가 손잡이 유형, 물체 카테고리, 참가자 쌍의 상호작용 역학과 어떤 상관관계를 가지는가?
- RQ4이 데이터셋은 인간의 운동 및 기능적 특성 선호도에 적극적으로 대응하는 로봇 제어기 개발을 지원할 수 있는가?
- RQ5역할 전환과 참가자 다양성이 수거 조율 및 궤적 패턴에 어떤 영향을 미치는가?
주요 결과
- 이 데이터셋은 136종의 고유한 물체, 2,720회의 수거 상호작용을 포함하여, 물체 수, 참가자 수, 역할 전환 쌍 수 측면에서 가장 큰 수거 데이터셋이다.
- HOH에서 훈련된 신경망은 손잡이 유형 예측에서 92.3%의 정확도, 자세 방향 예측에서 87.6%의 정확도를 기록하여 기준 모델을 초월하였다.
- g2rt 모델은 기준 모델 대비 궤적 예측 정확도에서 15.4% 향상되어 다양한 물체 유형에 대한 강력한 일반화 능력을 보였다.
- 주는 이와 받는 이의 편안함 평가가 손잡이 유형과 물체 카테고리와 유의미한 상관관계를 보였으며, 자연스러운 수거 품질의 신뢰할 수 있는 지표임을 시사하였다.
- 360도 다중시점 촬영 및 3D 포인트 클라우드 융합 덕분에, 부분적 가림 상태에서도 손-물체 상호작용을 고정밀도로 재구성할 수 있었다.
- g2rg 모델은 주는 이의 운동에서 받는 이의 손잡이를 91.2%의 정확도로 예측하였으며, 예측된 손잡이 영역 간 겹침이 거의 없어, 로봇 시스템에 효과적인 손잡이 편향을 제공할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.