Skip to main content
QUICK REVIEW

[논문 리뷰] Hand-Object Interaction Image Generation

Hezhen Hu, Weilun Wang|arXiv (Cornell University)|2022. 11. 28.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 손과 물체의 정체성, 자세, 상호작용 상태를 조건으로 삼는 새로운 작업인 수동-물체 상호작용 이미지 생성(HOIG)을 소개한다. 제안된 HOGAN 프레임워크는 모델 인식 손-물체 표현을 사용하여 통합된 표면 공간을 구축하고, 자가 및 상호 음영을 명시적으로 모델링하며, 분할-통합 전략을 통해 이미지를 생성하여 HO3Dv3 및 DexYCB 데이터셋에서 품질과 구조적 정확성 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this work, we are dedicated to a new task, i.e., hand-object interaction image generation, which aims to conditionally generate the hand-object image under the given hand, object and their interaction status. This task is challenging and research-worthy in many potential application scenarios, such as AR/VR games and online shopping, etc. To address this problem, we propose a novel HOGAN framework, which utilizes the expressive model-aware hand-object representation and leverages its inherent topology to build the unified surface space. In this space, we explicitly consider the complex self- and mutual occlusion during interaction. During final image synthesis, we consider different characteristics of hand and object and generate the target image in a split-and-combine manner. For evaluation, we build a comprehensive protocol to access both the fidelity and structure preservation of the generated image. Extensive experiments on two large-scale datasets, i.e., HO3Dv3 and DexYCB, demonstrate the effectiveness and superiority of our framework both quantitatively and qualitatively. The project page is available at https://play-with-hoi-generation.github.io/.

연구 동기 및 목표

  • 손, 물체 및 그들의 상호작용 상태를 조건으로 삼는 새로운 수동-물체 상호작용 이미지 생성(HOIG) 작업의 수립 및 탐구.
  • 이완하는 손과 물체 간의 복잡한 자가 및 상호 음영 문제를 이미지 합성 과정에서 해결.
  • 생성된 손-물체 이미지의 외관 충실도와 구조적 정확도(예: 자세 및 형태)를 유지.
  • 손과 물체의 고유한 외관 특성을 고려한 통합된 표현 및 합성 파이프라인 개발.
  • 정량적 지표와 사용자 연구를 포함한 종합적인 평가를 통해 제안된 방법의 평가 수행.

제안 방법

  • HOGAN은 모델 인식 손-물체 메쉬 표현을 사용하여 토폴로지와 공간적 관계를 인코딩하는 통합된 표면 공간을 구축한다.
  • 가시성 맵과 토폴로지 인식 전환을 사용하여 손의 자가 음영과 손-물체 간의 상호 음영을 명시적으로 모델링한다.
  • 이 프레임워크는 원본 자세와 대상 자세 간의 유동장(field)을 계산하여 이미지 합성을 유도하며, 정체성과 구조를 유지한다.
  • 이미지 합성은 분할-통합 방식으로 수행된다: 손과 물체는 각각의 고유한 외관 특성에 따라 별도로 생성된 후 융합된다.
  • 고정밀도 결과를 얻기 위해 조건부 GAN 기반 생성기와 적대적 및 인지적 손실 성분을 활용한다.
  • 종합적인 평가 프로토콜은 FID, LPIPS, AUC, PA-MPJPE, ADD-0.1D 및 사용자 연구를 포함하여 충실도와 구조 보존 성능 평가.

실험 결과

연구 질문

  • RQ1주어진 자세 조건 하에서 실제적인 수동-물체 상호작용 이미지를 효과적으로 합성할 수 있는 조건부 이미지 생성 프레임워크는 원본 외관을 유지할 수 있는가?
  • RQ2이완하는 손과 물체 간의 복잡한 자가 및 상호 음영을 이미지 합성 과정에서 어떻게 명시적으로 모델링할 수 있는가?
  • RQ3각각의 시각적 및 구조적 특성에 기반해 손과 물체의 생성을 분리하는 것이 어떤 영향을 미치는가?
  • RQ4실제 세계 데이터셋에서 제안된 방법은 이미지 충실도와 구조적 정확성 측면에서 기존 방법보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ5생성된 이미지는 수동-물체 자세 추정 모델의 성능 향상에 있어 데이터 증강으로 효과적으로 활용될 수 있는가?

주요 결과

  • HOGAN은 HO3Dv3 및 DexYCB 데이터셋에서 FID, LPIPS, AUC, PA-MPJPE, ADD-0.1D 지표에서 기존 방법을 능가하는 최신 기술 수준의 성능을 달성한다.
  • HO3Dv3에서 HOGAN은 합성 데이터로 미세조정한 후 AUC 78.0과 ADD-0.1D 76.8을 기록하여 기존 방법보다 뚜렷이 향상된 성능을 보였다.
  • 물체에 텍스트(예: 이름)를 편집한 이미지를 생성함으로써 물체의 질감 세부 정보를 성공적으로 유지함을 입증했다.
  • 실제 손 이미지에 적용했을 때 HOGAN은 원본 손 정체성을 유지하면서도 정확한 목표 자세를 생성하였으며, 정성적 결과에서 이를 확인할 수 있었다.
  • HOGAN이 생성한 합성 데이터는 최신 기술 수준의 HOPE 모델 성능을 향상시켜 데이터 증강의 유용성을 입증했다.
  • 사용자 연구 결과, HOGAN이 생성한 이미지는 기존 방법 대비 더 현실적으로 느껴지고 구조적으로 더 정확하다고 평가되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.