Skip to main content
QUICK REVIEW

[논문 리뷰] MobRecon: Mobile-Friendly Hand Mesh Reconstruction from Monocular Image

Xingyu Chen, Yufeng Liu|arXiv (Cornell University)|2021. 12. 06.
Human Pose and Action Recognition인용 수 7
한 줄 요약

MobRecon는 단일 뷰 손 메시 재구성에 적합한 모바일 최적화 프레임워크를 제안하며, 경량화된 스택형 2D 인코딩, 3D 복원을 위한 깊이 분리형 나선형 합성곱, 그리고 지도 기반 위치 회귀와 자세에서 정점으로의 특징 이면 모듈을 조합한다. 이는 Apple A14 CPU에서 83 FPS로 추론하면서 FreiHAND에서 5.7mm의 PAMPJPE로 최신 기술 수준의 정확도를 달성하며, Mult-Adds는 123M, 파라미터 수는 5M에 불과하다.

ABSTRACT

In this work, we propose a framework for single-view hand mesh reconstruction, which can simultaneously achieve high reconstruction accuracy, fast inference speed, and temporal coherence. Specifically, for 2D encoding, we propose lightweight yet effective stacked structures. Regarding 3D decoding, we provide an efficient graph operator, namely depth-separable spiral convolution. Moreover, we present a novel feature lifting module for bridging the gap between 2D and 3D representations. This module begins with a map-based position regression (MapReg) block to integrate the merits of both heatmap encoding and position regression paradigms for improved 2D accuracy and temporal coherence. Furthermore, MapReg is followed by pose pooling and pose-to-vertex lifting approaches, which transform 2D pose encodings to semantic features of 3D vertices. Overall, our hand reconstruction framework, called MobRecon, comprises affordable computational costs and miniature model size, which reaches a high inference speed of 83FPS on Apple A14 CPU. Extensive experiments on popular datasets such as FreiHAND, RHD, and HO3Dv2 demonstrate that our MobRecon achieves superior performance on reconstruction accuracy and temporal coherence. Our code is publicly available at https://github.com/SeanChenxy/HandMesh.

연구 동기 및 목표

  • 고정확도, 빠른 추론, 시간적 일관성을 동시에 확보하는 모바일 친화적인 손 메시 재구성 시스템을 개발하는 것.
  • 기존 방법들이 모바일 플랫폼에서 비효율적인 점을 보완하기 위해 2D 인코딩과 3D 복원을 위한 경량 구성 요소를 설계하는 것.
  • 2D에서 3D로의 특징 매핑을 향상시키기 위해 정확도와 시간적 일관성을 모두 향상시키는 새로운 이면 모듈을 개발하는 것.
  • 모바일 CPU에서 정확도를 희생시키지 않고도 실시간 성능(83 FPS)을 달성하는 것.
  • 모바일 환경 제약 조건 하에서 FreiHAND, RHD, HO3Dv2 데이터셋에서 최신 기술 수준의 결과를 입증하는 것.

제안 방법

  • 시계열 구조를 모방한 경량 스택형 2D 인코딩 아키텍처를 제안하여 효율성과 정확도를 향상시킨다.
  • 스피ral 샘플링 기반의 깊이 분리형 나선형 합성곱(DSConv)을 도입하여 효율적인 3D 메시 복원을 위한 새로운 그래프 연산자를 제안한다.
  • 지도 기반 위치 회귀(MapReg), 자세 풀링, 자세에서 정점으로의 특징 이면(PVL)를 조합한 특징 이면 모듈을 설계하여 2D 자세 특징과 3D 정점 표현 간의 연결을 구축한다.
  • 핫스팟과 위치 회귀를 통합한 하이브리드 2D 자세 표현(MapReg)을 사용하여 2D 정확도와 시간적 일관성을 향상시킨다.
  • 시간적 안정성과 성능 향상을 위해 3D/2D 일致성 손실을 도입한다.
  • 일관된 손 자세와 시야각 분포를 가진 합성 데이터셋을 사용하여 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1경량 2D 인코딩 아키텍처가 모바일 CPU에서 실시간 추론를 유지하면서도 고정확도를 달성할 수 있는가?
  • RQ2재구성 정확도를 훼손하지 않으면서 3D 메시 복원을 어떻게 효율적으로 구현할 수 있는가?
  • RQ3순차적 모델 대비 비순차적 방법이 손 메시 재구성에서 더 높은 시간적 일관성을 달성할 수 있는가?
  • RQ4하이브리드 2D 자세 표현(MapReg)이 2D 정확도와 3D 재구성 일관성 양면에서 얼마나 향상되는가?
  • RQ5통합된 특징 이면 모듈이 모델 크기를 줄이면서도 3D 정점 특징 품질을 향상시킬 수 있는가?

주요 결과

  • MobRecon는 FreiHAND 데이터셋에서 최신 기술 수준의 PAMPJPE 5.7mm를 달성하여 이전의 최고 기록을 초월한다.
  • Apple A14 CPU에서 123M Mult-Adds와 5M 파라미터로 83 FPS로 실행되어 실시간 모바일 배포가 가능하다.
  • DSConv는 SpiralConv++ 대비 3D 디코더의 Mult-Adds와 파라미터를 줄이며 성능을 유지하거나 향상시킨다.
  • MapReg 기반의 특징 이면 모듈은 2D 자세 정확도와 시간적 일관성을 향상시키며, 더 나은 3D 재구성에 기여한다.
  • 막힘 현상이 뚜렷한 HO3Dv2 데이터셋에서 9.2mm PJ와 0.538 F@5를 기록하여 기존 방법을 능가한다.
  • 일致성 학습을 통해 시간적 일관성이 크게 향상되었으며, FreiHAND에서 F@15가 0.986으로 상승했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.