Skip to main content
QUICK REVIEW

[論文レビュー] MobRecon: Mobile-Friendly Hand Mesh Reconstruction from Monocular Image

Xingyu Chen, Yufeng Liu|arXiv (Cornell University)|Dec 6, 2021
Human Pose and Action Recognition被引用数 7
ひとこと要約

MobRecon は、軽量なスタックド2Dエンコーディング、3Dデコード用の深さ分離スパイラル畳み込み、マップベースの位置回帰とポーズから頂点への変換を組み合わせた新規特徴リフトモジュールを統合した、モバイル最適化フレームワークを提案する。FreiHANDで5.7mmのPAMPJPEという最先端の精度を達成し、Apple A14 CPUで83 FPSの推論速度、Mult-Addsが123M、パラメータ数が5Mにとどめる。

ABSTRACT

In this work, we propose a framework for single-view hand mesh reconstruction, which can simultaneously achieve high reconstruction accuracy, fast inference speed, and temporal coherence. Specifically, for 2D encoding, we propose lightweight yet effective stacked structures. Regarding 3D decoding, we provide an efficient graph operator, namely depth-separable spiral convolution. Moreover, we present a novel feature lifting module for bridging the gap between 2D and 3D representations. This module begins with a map-based position regression (MapReg) block to integrate the merits of both heatmap encoding and position regression paradigms for improved 2D accuracy and temporal coherence. Furthermore, MapReg is followed by pose pooling and pose-to-vertex lifting approaches, which transform 2D pose encodings to semantic features of 3D vertices. Overall, our hand reconstruction framework, called MobRecon, comprises affordable computational costs and miniature model size, which reaches a high inference speed of 83FPS on Apple A14 CPU. Extensive experiments on popular datasets such as FreiHAND, RHD, and HO3Dv2 demonstrate that our MobRecon achieves superior performance on reconstruction accuracy and temporal coherence. Our code is publicly available at https://github.com/SeanChenxy/HandMesh.

研究の動機と目的

  • 高精度、高速推論、時間的整合性を両立するモバイルフレンドリーな手メッシュ再構成システムの開発。
  • モバイルプラットフォームにおける従来手法の非効率性を解消するため、2Dエンコーディングおよび3Dデコード用の軽量コンポーネントの設計。
  • 2Dから3Dへの特徴マッピングを向上させる新規リフトモジュールの導入により、精度と時間的整合性の両方を向上。
  • 推論品質を損なわせることなく、モバイルCPU上でリアルタイム性能(83 FPS)を達成すること。
  • モバイル制約下でFreiHAND、RHD、HO3Dv2データセットにおいて最先端の結果を示すこと。

提案手法

  • 時計型構造を模倣した軽量なスタックド2Dエンコーディング構造を提案し、効率性と精度の両立を図る。
  • スパイラルサンプリングに基づく、3Dメッシュデコードのための新規グラフ演算子である深さ分離スパイラル畳み込み(DSConv)を導入する。
  • マップベースの位置回帰(MapReg)、ポーズプーリング、ポーズから頂点への変換(PVL)を統合した特徴リフトモジュールを設計し、2Dポーズ特徴と3D頂点表現の橋渡しを実現する。
  • ヒートマップと位置回帰を統合したハイブリッド2Dポーズ表現(MapReg)を採用し、2D精度と時間的整合性の両方を向上。
  • 時間的安定性とパフォーマンスの向上を図るため、3D/2D整合性損失を活用する。
  • 一般化能力を向上させるため、一様に分布した手のポーズと視点を持つ合成データセットで学習を実施する。

実験結果

リサーチクエスチョン

  • RQ1軽量な2Dエンコーディングアーキテクチャは、モバイルCPU上でリアルタイム推論を維持しながらも高精度を達成できるか?
  • RQ2再構成品質を損なわず、3Dメッシュデコードをどのように効率化できるか?
  • RQ3順次処理モデルと比較して、非順次的手法が手メッシュ再構成においてより優れた時間的整合性を達成できるか?
  • RQ4ハイブリッド2Dポーズ表現(MapReg)は、2D精度と3D再構成の一貫性の両方をどの程度向上できるか?
  • RQ5統一された特徴リフトモジュールは、モデルサイズを削減しながらも3D頂点特徴の品質を向上できるか?

主な発見

  • MobRecon は FreiHAND データセットで5.7mmという最先端のPAMPJPEを達成し、以前の最先端手法を上回った。
  • Apple A14 CPU で123M Mult-Adds、5Mパラメータで83 FPSの推論速度を達成し、リアルタイムのモバイルデプロイメントを可能にした。
  • DSConv は SpiralConv++ と比較して、Mult-Adds やパラメータ数を削減しながらも、性能を維持または向上させた。
  • MapReg を活用した特徴リフトモジュールは、2Dポーズ精度と時間的整合性を向上させ、より良い3D再構成に寄与した。
  • オクルージョンが強いとされる HO3Dv2 データセットでも、PJが9.2mm、F@5が0.538を達成し、先行手法を上回った。
  • 整合性学習により時間的整合性が顕著に向上し、FreiHAND における F@15 は 0.986 まで上昇した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。