Skip to main content
QUICK REVIEW

[논문 리뷰] HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction

Yunze Liu, Yun Liu|arXiv (Cornell University)|2022. 03. 03.
Human Pose and Action Recognition인용 수 6
한 줄 요약

HOI4D는 카테고리 수준의 인간-물체 상호작용을 위한 첫 번째 대규모 4차원 이지오센트릭 데이터셋을 소개한다. 이 데이터셋은 4,000개의 시퀀스에 걸쳐 총 240만 장의 RGB-D 프레임을 포함하며, 패ノ픽 세그멘테이션, 3D 손 및 물체 자세, 동작 인식, 재구성된 시점 포인트 클라우드 및 물체 메시 등 프레임 단위의 풍부한 애너테이션을 제공한다. 이 데이터셋은 3가지 핵심 과제—4D 동적 포인트 클라우드의 의미 세그멘테이션, 카테고리 수준의 물체 자세 추적, 세밀한 이지오센트릭 동작 세그멘테이션—에 대한 벤치마킹을 가능하게 하여 기존 방법에 대한 심각한 과제를 드러낸다.

ABSTRACT

We present HOI4D, a large-scale 4D egocentric dataset with rich annotations, to catalyze the research of category-level human-object interaction. HOI4D consists of 2.4M RGB-D egocentric video frames over 4000 sequences collected by 4 participants interacting with 800 different object instances from 16 categories over 610 different indoor rooms. Frame-wise annotations for panoptic segmentation, motion segmentation, 3D hand pose, category-level object pose and hand action have also been provided, together with reconstructed object meshes and scene point clouds. With HOI4D, we establish three benchmarking tasks to promote category-level HOI from 4D visual signals including semantic segmentation of 4D dynamic point cloud sequences, category-level object pose tracking, and egocentric action segmentation with diverse interaction targets. In-depth analysis shows HOI4D poses great challenges to existing methods and produces great research opportunities.

연구 동기 및 목표

  • 카테고리 수준의 인간-물체 상호작용을 위한 대규모 실세계 4차원 이지오센트릭 데이터셋의 부족을 보완한다. 특히 새로운, 볼 수 없는 물체 카테고리에 대해 고려한다.
  • 이전의 인스턴스 수준 데이터셋이 알려진 CAD 모델과 합성 데이터에 의존하는 한계를 극복하여 실세계 적용 가능성을 높인다.
  • 실제 환경 조건(예: 가림, 동적 움직임 등)에서 4차원 장면 이해, 카테고리 수준의 물체 자세 추적, 세밀한 동작 인식 연구를 가능하게 한다.
  • 로봇 공학 및 증강현실 응용 분야에서의 시뮬레이션에서 실세계로의 전이를 위한 현실적이고 확장 가능한 벤치마크를 제공한다.

제안 방법

  • 9명의 참가자가 610개의 서로 다른 실내 공간에서 이지오센트릭 카메라를 사용해 작업을 수행하면서 총 240만 장의 RGB-D 프레임을 수집하였으며, 16개 카테고리(고체 및 관절이 있는 물체 포함)에 속하는 800개의 물체 인스턴스를 다루었다.
  • 인간 레이블링과 자동화된 알고리즘을 융합한 하이브리드 애너테이션 파이프라인을 활용하여 패노픽 세그멘테이션, 동적 세그멘테이션, 3D 손 자세, 카테고리 수준의 물체 자세 등에 대한 프레임 단위의 애너테이션을 스케일링하였다.
  • 모든 시퀀스에 대해 고해상도 3D 물체 메시와 장면 포인트 클라우드를 재구성하여 3D 인식 작업을 지원한다.
  • 세 가지 벤치마크 과제를 설계: 4D 동적 포인트 클라우드 시퀀스의 의미 세그멘테이션, 손-물체 상호작용에 대한 카테고리 수준의 물체 자세 추적, 다양한 대상이 포함된 이지오센트릭 손 동작 세그멘테이션.
  • 비디오 동작 세그멘테이션에 I3D 특징을 사용하고, 프레임 단위 정확도, 에디트 거리, 다양한 IoU 임계값에서의 F1 스코어를 평가 지표로 사용한다.
  • HOI4D에서 최신 기술(예: PSTNet, P4Transformer, MS-TCN++)을 벤치마킹하여 성능 격차를 분석하고 주요 실패 원인을 규명한다.

실험 결과

연구 질문

  • RQ1기존의 외부 환경에서 학습된 4D 의미 세그멘테이션 모델들이, 높은 가림과 센서 노이즈가 있는 복잡하고 혼잡한 실내 이지오센트릭 장면에 일반화 가능한가?
  • RQ2손에 의한 가림과 실내 환경에서의 동적 움직임이 발생하는 현실 조건에서 현재의 카테고리 수준의 물체 자세 추적 방법은 얼마나 잘 작동하는가?
  • RQ3기존의 비디오 동작 세그멘테이션 모델이 굵은 수준의 데이터셋에서 학습된 후, 상호작용 환경에서 세밀한 동작을 다룰 수 있는가?
  • RQ4현실의 이지오센트릭 시퀀스에 적용했을 때 현재 모델들이 세밀한 카테고리 수준의 인간-물체 상호작용에서 나타내는 주요 실패 원인은 무엇인가?

주요 결과

  • 최신 기술의 외부 환경 4D 의미 세그멘테이션 모델(PSTNet, P4Transformer)은 HOI4D에서 각각 52.0%와 61.2%의 mIoU를 기록하였으며, 배경(72.6%, 77.7%)에 비해 물체 카테고리에서 성능이 현저히 낮았고(31.4%, 44.6%), 이는 작은 크기와 가림으로 인한 과제를 시사한다.
  • 기존의 비디오 동작 세그멘테이션 모델(MS-TCN, MS-TCN++, Asformer)은 HOI4D에서 46.8%의 프레임 단위 정확도를 기록하여 50Salads 데이터셋에서의 85.6%에 비해 심각한 성능 저하를 보였으며, 이는 상호작용 환경에서의 세밀한 동작에 대한 일반화 능력 부족을 시사한다.
  • 정성 분석 결과, 모델들은 종종 동작 순서를 학습하지만 현재 동작를 인식하지 못하는 경향이 있으며, 특히 동작 시퀀스가 방해받을 경우 더욱 심해지므로, 동작 인식에서 시간적 정밀도가 부족함을 보여준다.
  • 이 데이터셋은 현재의 방법이 카테고리 수준 일반화, 가림, 센서 노이즈 처리에 있어 심각한 한계를 드러내며, 새로운 4차원 인식 아키텍처의 필요성을 강조한다.
  • HOI4D는 기존에 탐색이 부족했던 과제—실제 이지오센트릭 데이터를 사용한 카테고리 수준의 물체 자세 추적—에 대한 벤치마킹을 가능하게 하며, 현재는 합성 또는 단순 장면 설정에서만 가능하다.
  • HOI4D의 풍부한 애너테이션과 현실적인 3D 재구성은 향후 로봇 학습, 증강현실, 시뮬레이션에서 실세계로의 전이 연구에 강력한 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.