[論文レビュー] Neural Pose Transfer by Spatially Adaptive Instance Normalization
本論文は、対応関係や補助入力を必要とせずに、ソースの人物メッシュのポーズをターゲットのアイデンティティメッシュに転送する、最初のエンド・ツー・エンドのニューラルポーズ転送モデルを提案する。空間的適応的インスタンス正規化(SPAdaIN)を活用することで、アイデンティティを「スタイル」とし、ポーズを「コンテンツ」とみなすことで、順列不変で、ロバストかつ汎用的な変形転送を実現し、未学習のアイデンティティやノイズの多い幾何構造に対しても対応可能である。
Pose transfer has been studied for decades, in which the pose of a source mesh is applied to a target mesh. Particularly in this paper, we are interested in transferring the pose of source human mesh to deform the target human mesh, while the source and target meshes may have different identity information. Traditional studies assume that the paired source and target meshes are existed with the point-wise correspondences of user annotated landmarks/mesh points, which requires heavy labelling efforts. On the other hand, the generalization ability of deep models is limited, when the source and target meshes have different identities. To break this limitation, we proposes the first neural pose transfer model that solves the pose transfer via the latest technique for image style transfer, leveraging the newly proposed component -- spatially adaptive instance normalization. Our model does not require any correspondences between the source and target meshes. Extensive experiments show that the proposed model can effectively transfer deformation from source to target meshes, and has good generalization ability to deal with unseen identities or poses of meshes. Code is available at https://github.com/jiashunwang/Neural-Pose-Transfer .
研究の動機と目的
- 顕著に異なるアイデンティティを持つ人物メッシュ間で、点対応が存在しない状況でのポーズ転送の課題を解決すること。
- 形状のギャップを埋めるために高コストな手動アノテーションや補助メッシュに依存しないようにすること。
- 微調整なしで未学習のアイデンティティやポーズに一般化可能なディープラーニングモデルを開発すること。
- 順列不変なメッシュ処理を実現し、入力頂点の順序に柔軟に対応できるようにすること。
提案手法
- 2次元画像からのスタイル転送技術を3次元点群へ応用するため、空間的適応的インスタンス正規化(SPAdaIN)を導入する。
- ソースポーズメッシュとターゲットアイデンティティメッシュを独立して処理する、PointNetに類似したエンコーダ・デコーダアーキテクチャを用いる。
- すべての頂点にわたるインスタンス正規化を適用することで、頂点順序の順列変更に対して不変な特徴を実現する。
- ターゲットメッシュの頂点から、ソースメッシュの特徴を変調するためのアフィン変換を学習し、アイデンティティに依存するポーズ転送を可能にする。
- 個々の頂点を処理するための1×1畳み込みフィルタを用い、局所的な幾何的コンテキストを維持する。
- アブレーションのベースラインとして、最大プーリングによるコンactなポーズ特徴を用いるが、より優れた性能を得るためには、全頂点特徴の学習を推奨する。
実験結果
リサーチクエスチョン
- RQ1ソースメッシュとターゲットメッシュの間で明示的な対応関係がなくても、ニューラルポーズ転送を達成できるか?
- RQ2微調整なしで、未学習のアイデンティティやポーズに一般化可能なディープラーニングモデルは構築できるか?
- RQ3ポーズ転送モデルは、入力メッシュの頂点順序に対して不変であるか?
- RQ4SPAdaINは、3次元メッシュ変形における従来の正規化法やスタイル転送手法と比較してどのように優れているか?
- RQ5ドメイン特化の訓練を経て、非ヒトメッシュ(例:動物)に対しても一般化可能か?
主な発見
- 提案モデルは、学習済みポーズではPM D 1.1×10⁻⁴、未学習ポーズでは9.3×10⁻⁴を達成し、スケルトンベースおよび最大プーリングベースラインを上回る性能を示した。
- 頂点順序にかかわらず、視覚的に一貫性のある結果を生成しており、完全な順列不変性を示している。
- FAUSTおよびMG-datasetの非-SMPLメッシュに対しても、顔のひげや衣類の細部を保持したままポーズを正しく転送できた。
- ドメインシフトが生じても、わずかなアーチファクトを除き、ラクダから馬への転送など、非ヒトメッシュに対しても一般化可能であった。
- メッシュノイズに対してもロバストであり、入力ポーズメッシュが汚損されていても、正しいポーズを維持した。
- アブレーションの結果、ポーズ特徴のグローバルプーリングは、全頂点特徴の学習に比べて性能が劣ることから、細粒度のポーズ情報が損なわれていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。