Skip to main content
QUICK REVIEW

[논문 리뷰] Interacting Attention Graph for Single Image Two-Hand Reconstruction

Mengcheng Li, Liang An|arXiv (Cornell University)|2022. 03. 17.
Anatomy and Medical Technology인용 수 13
한 줄 요약

이 논문은 단일 RGB 이미지에서 두 손의 3D 메시를 복원하기 위한 그래프 컬러션 네트워크(GCN)-기반 방법인 IntagHand를 제안한다. 이는 정점-이미지 특징 정렬을 위한 피라미드 이미지 특징 주의(PIFA) 모듈과 손 간 상호작용을 모델링하기 위한 크로스핸드 주의(CHA) 모듈을 도입하여, InterHand2.6M 벤치마크에서 8.79 mm MPJPE 및 9.03 mm MPVPE를 기록하며 기존 방법보다 뚜렷하게 뛰어난 성능을 달성한다.

ABSTRACT

Graph convolutional network (GCN) has achieved great success in single hand reconstruction task, while interacting two-hand reconstruction by GCN remains unexplored. In this paper, we present Interacting Attention Graph Hand (IntagHand), the first graph convolution based network that reconstructs two interacting hands from a single RGB image. To solve occlusion and interaction challenges of two-hand reconstruction, we introduce two novel attention based modules in each upsampling step of the original GCN. The first module is the pyramid image feature attention (PIFA) module, which utilizes multiresolution features to implicitly obtain vertex-to-image alignment. The second module is the cross hand attention (CHA) module that encodes the coherence of interacting hands by building dense cross-attention between two hand vertices. As a result, our model outperforms all existing two-hand reconstruction methods by a large margin on InterHand2.6M benchmark. Moreover, ablation studies verify the effectiveness of both PIFA and CHA modules for improving the reconstruction accuracy. Results on in-the-wild images and live video streams further demonstrate the generalization ability of our network. Our code is available at https://github.com/Dw1010/IntagHand.

연구 동기 및 목표

  • 서로 겹치는 손의 상호작용을 고려한 단일 RGB 이미지에서 두 손의 3D 메시를 복원하는 문제를 해결하기 위해, 특히 심한 가림과 외관 혼동 상황에서도 성능을 유지하는 것.
  • 기존 GCN 기반 방법들이 손 간 상호작용과 정점-이미지 특징 정렬을 효과적으로 모델링하지 못하는 한계를 극복하기 위해.
  • 정점-이미지 정렬 및 일반화 능력을 향상시키기 위해 주의 메커니즘을 통합한 새로운 GCN 프레임워크를 개발하기 위해.

제안 방법

  • IntagHand는 두 손 상황으로 확장된 코arse-to-fine GCN 디코더를 사용하여 각 손의 3D 메시 정점들을 회귀한다.
  • 피라미드 이미지 특징 주의(PIFA) 모듈은 이미지 패치에 대한 전역 주의를 통해 다중 해상도 이미지 특징과 메시 정점 간의 정렬을 수행하는 트랜스포머 인코더를 사용한다.
  • 크로스핸드 주의(CHA) 모듈은 두 손의 정점 간에 조밀한 크로스-주의를 수행하여, 가림 영역을 해소하기 위해 상호작용 맥락을 모델링한다.
  • 업샘플링 단계마다 고해상도 특징을 제공하기 위해 피라미드 이미지 특징 추출 모듈을 설계하였다.
  • 모든 GCN 업샘플링 블록에 PIFA 및 CHA 모듈을 통합하여 정점-이미지 정렬 및 손 간 일관성을 향상시켰다.
  • 프레임워크는 InterHand2.6M 데이터셋에서 엔드 투 엔드로 훈련되었으며, 벤치마크 및 실생활 이미지 데이터에서 평가되었다.

실험 결과

연구 질문

  • RQ1GCN 기반 아키텍처가 상호작용하는 두 손을 단일 RGB 이미지에서 효과적으로 복원할 수 있는가? 특히 상호 가림과 외관 혼동 상황에서도 성능을 유지할 수 있는가?
  • RQ2명시적인 관절점 감독 없이 메시 회귀 프레임워크에서 정점-이미지 특징 정렬을 어떻게 향상시킬 수 있는가?
  • RQ3손 정점 간의 크로스-주의가 얼마나 손 간 상호작용을 모델링하고, 가림 영역의 복원 오차를 줄일 수 있는가?
  • RQ4다중 해상도 이미지 특징의 통합이 3D 손 메시 복원 정확도를 향상시키는가?
  • RQ5기존 최신 기술(SOTA) 방법과 비교해 실제 실생활 이미지 및 라이브 영상 스트림에 대해 어떻게 일반화되는가?

주요 결과

  • IntagHand는 InterHand2.6M 벤치마크에서 8.79 mm MPJPE 및 9.03 mm MPVPE를 기록하여 이전 SOTA 방법보다 MPJPE에서 4.7 mm 향상된 성능을 달성했다.
  • 제거 실험 결과, PIFA 및 CHA 모듈이 각각 유의미하게 기여하는 것으로 확인되었으며, PIFA는 정렬 성능 향상에, CHA는 가림 관련 오차 감소에 기여했다.
  • PIFA 모듈을 제거하면 MPJPE가 0.89 mm 증가하고, CHA 모듈을 제거하면 MPJPE가 0.63 mm 증가하여 각각의 효과성을 입증했다.
  • 피라미드 구조의 이미지 특징은 단일 해상도 특징보다 성능 향상을 이끌었으며, IFA-32 및 IFA-8는 피라미드가 아닌 기반 모델보다 더 우수한 성능을 보였다.
  • 실생활 이미지 및 라이브 영상 스트림에 대한 정성적 결과는 도무지 구부정하거나 가려진 손 자세의 강건한 복원을 보여주었다.
  • 실생활 시나리오에 대해 잘 일반화되며, 실시간으로 고품질이고 시간적으로 일관된 메시 복원을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.