[논문 리뷰] ACR: Attention Collaboration-based Regressor for Arbitrary Two-Hand Reconstruction
ACR는 단일 RGB 이미지에서 임의의 두 손 3D 재구성에 대해 주목사의 협업 기반 회귀기를 제안하며, 중심과 부분 기반 주목을 사용하여 손 표현을 분리하고, 가림과 잘린 손에 대한 민감도를 감소시킵니다. InterHand2.6M에서 최신 기술(SOTA)을 초월하며(8.49 MPJPE), FreiHand에서 단일 손 SOTA와 유사한 성능을 달성하여 실제 및 도전적인 상황에서도 강건함을 입증합니다.
Reconstructing two hands from monocular RGB images is challenging due to frequent occlusion and mutual confusion. Existing methods mainly learn an entangled representation to encode two interacting hands, which are incredibly fragile to impaired interaction, such as truncated hands, separate hands, or external occlusion. This paper presents ACR (Attention Collaboration-based Regressor), which makes the first attempt to reconstruct hands in arbitrary scenarios. To achieve this, ACR explicitly mitigates interdependencies between hands and between parts by leveraging center and part-based attention for feature extraction. However, reducing interdependence helps release the input constraint while weakening the mutual reasoning about reconstructing the interacting hands. Thus, based on center attention, ACR also learns cross-hand prior that handle the interacting hands better. We evaluate our method on various types of hand reconstruction datasets. Our method significantly outperforms the best interacting-hand approaches on the InterHand2.6M dataset while yielding comparable performance with the state-of-the-art single-hand methods on the FreiHand dataset. More qualitative results on in-the-wild and hand-object interaction datasets and web images/videos further demonstrate the effectiveness of our approach for arbitrary hand reconstruction. Our code is available at https://github.com/ZhengdiYu/Arbitrary-Hands-3D-Reconstruction.
연구 동기 및 목표
- 가림, 잘림, 상호 혼동이 발생하는 임의의 상황에서 3D 손 재구성 문제를 해결하기 위해.
- 표현 분리로 손과 신체 부위 간 의존도를 줄여, 완전하지 않거나 손상된 입력에 대한 강건성을 향상시키기 위해.
- 상호의존도가 감소함에도 불구하고 손 간 상호작용 모델링을 유지하여 상호 작용하는 손의 정확한 재구성을 보장하기 위해.
- 제약 없는 두 손 입력을 초월해 일반화할 수 있는 방법을 개발하여 실세계 환경(예: 자연계 이미지 및 영상)에서의 실용적 구현을 가능하게 하기 위해.
제안 방법
- ACR는 교차 손 사전 지식을 사용하여 손 중심 및 각 부위별 주목 맵을 생성하는 주목 인코더(AE)를 활용하여 가시성 추정 및 특징 학습 가이드를 수행합니다.
- 전역(G), 부분 기반(P), 교차 손 주목 사전(C) 표현을 융합하는 새로운 주목 협업 기반 특징 융합기(ACFA)를 사용하여 공동 손 회귀를 수행합니다.
- 상호작용 영역을 갖춘 교차 손 사전 지식 추론 모듈이 손 간 의존성 강도를 동적으로 조정하여 상호 상호작용 모델링을 향상시킵니다.
- 모델은 엔드 투 엔드로 훈련 가능하며, 손 경계 상자나 진짜 척도 정보가 필요 없어 실제 환경에서의 구현이 가능합니다.
- 3D 메esh 회귀를 위해 매개변수 기반 손 모델(MANO 등)을 활용하며, 3D 관절 및 메쉬 애너테이션을 기반으로 supervision을 제공합니다.
- 다양한 상황에서의 데이터셋을 사용하여 표준 3D 손 재구성 손실(MPJPE, MPVPE 등)을 기반으로 네트워크를 훈련합니다.
실험 결과
연구 질문
- RQ1두 손 간 상호작용이 입력으로 제공되지 않더라도, 잘린 손, 별개의 손, 가려진 손을 포함한 임의의 손 구성에 대해 3D 손 재구성 방법이 일반화될 수 있는가?
- RQ2손 간 상호의존성과 손 부위 간 의존성을 명시적으로 줄여 부분적인 가림과 잘림에 대한 강건성을 향상시킬 수 있는가?
- RQ3교차 손 사전 지식 추론이 감소한 상호의존성 보완에 얼마나 효과적으로 작용하여 복잡한 상황에서도 정확한 상호작용 모델링을 유지할 수 있는가?
- RQ4통합 특징 학습과 비교할 때, 제안된 주목 협업 메커니즘은 다양한 데이터셋에서 성능과 일반화 능력 측면에서 어떤가?
주요 결과
- ACR는 InterHand2.6M의 상호작용 손(IH) 서브셋에서 8.49 MPJPE로 가장 낮은 성능을 기록하며 이전 SOTA인 IntagHand를 능가합니다.
- FreiHand 단일 손 벤치마크에서 ACR는 6.91 MPJPE를 기록하여 최신 기술의 단일 손 방법과 유사한 성능을 보이며 강력한 일반화 능력을 입증합니다.
- 절단 실험 결과는 부분 기반 및 교차 손 사전 지식 표현이 성능 향상에 크게 기여하며, 특히 상호작용 손 시나리오에서 교차 손 사전 지식이 더 큰 성과를 내는 것으로 확인됩니다.
- 자연계 이미지, 영상, 손-물체 상호작용 데이터셋에 대한 정성적 결과는 심한 가림과 비표준 자세에서도 정확한 재구성을 보여줍니다.
- 단일 손, 자기 시점, 잘린 손과 같은 입력 변형에 대해 강건하여 실세계 적용의 실용성을 입증합니다.
- 전체 InterHand2.6M 데이터셋에서 전역, 부분, 교차 손 사전 지식 표현을 융합한 결과, 5.21 PAMPJPE를 기록하여 강력한 종합 성능을 보입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.