[論文レビュー] TransMoMo: Invariance-Driven Unsupervised Video Motion Retargeting
TransMoMoは、不変性駆動型損失関数を用いて2次元スケルトン系列から動き、構造、視点角度の不変潜在要因に分離する教師なし動画モーショントランスファーメソッドを提案する。3Dの監督なしに、ペairedでないウェブ動画のみで訓練され、多様なボディ構造や視点に対して複雑な動きを転送するというSOTA性能を達成し、NKN、EDN、LCMなどの手法を定量的指標および視覚的品質の両面で上回る。
We present a lightweight video motion retargeting approach TransMoMo that is capable of transferring motion of a person in a source video realistically to another video of a target person. Without using any paired data for supervision, the proposed method can be trained in an unsupervised manner by exploiting invariance properties of three orthogonal factors of variation including motion, structure, and view-angle. Specifically, with loss functions carefully derived based on invariance, we train an auto-encoder to disentangle the latent representations of such factors given the source and target video clips. This allows us to selectively transfer motion extracted from the source video seamlessly to the target video in spite of structural and view-angle disparities between the source and the target. The relaxed assumption of paired data allows our method to be trained on a vast amount of videos needless of manual annotation of source-target pairing, leading to improved robustness against large structural variations and extreme motion in videos. We demonstrate the effectiveness of our method over the state-of-the-art methods. Code, model and data are publicly available on our project page (https://yzhq97.github.io/transmomo).
研究の動機と目的
- ペアのない訓練データを用い、構造的・視点的変化が大きい個体間で現実的な動画モーショントランスファーを可能にすること。
- 3Dポーズ推定やペアドされた動き-スケルトンアノテーションに依存せずに、2次元空間におけるモーショントランスファーの学習に挑戦すること。
- 時間的系列における不変性の性質を活用することで、極端な動きや未学習のボディタイプに対しても一般化性とロバスト性を向上させること。
- 豊富な未加工の屋外動画データ上で軽量で即席可能なモジュールを訓練し、データ効率性とスケーラビリティを向上させること。
提案手法
- 本手法は、2次元スケルトン抽出、スケルトン系列上のモーショントランスファー、画像変換を用いたスケルトンから動画へのレンダリングという3段階に分ける。
- 自己符号化器アーキテクチャを用い、不変性制約を用いて潜在表現を直交する要因(動き、構造、視点角度)に分離する。
- 不変性駆動型損失関数を導出し、動きが構造的および視点角度の変化に対して不変であるように、構造が視点角度のシフトに対して不変であるように、視点角度が構造の変化に対して不変であるように制約を課す。
- 分離とリアルな新規視点角度系列の生成を保証するため、クロス再構成損失、トリプレット損失、 adversarial損失を用いる。
- 多様なボディ構造をシミュレートし、極端なボディタイプへの一般化を向上させるために、リムスケーリングのデータ拡張戦略を導入する。
- ペアのない屋外動画上でエンドツーエンドに訓練され、3Dの監督なし、もしくは動き-スケルトンのペアリングなしに教師なし学習が可能になる。
実験結果
リサーチクエスチョン
- RQ13Dポーズ推定やペアデータに依存せずに、2次元空間でモーショントランスファーを効果的に学習できるか?
- RQ2動き、構造、視点角度の間の不変性をどのように活用して、動画系列における教師なし分離を実現できるか?
- RQ3未加工の屋外動画で学習したモデルは、合成されたペアデータで学習した教師ありモデルよりも一般化性能が優れているか?
- RQ4各損失成分(クロス再構成、トリプレット、adversarial)が最終的な分離と生成品質に果たす寄与度は何か?
主な発見
- Mixamoデータセットにおいて、本手法は最低の関節位置誤差(MSE: 0.0131、MAE: 0.0673)を達成し、NKN、EDN、LCMを上回った。
- 屋外データのみで訓練されたモデル(Solo-Dancer Dataset)が最も低い誤差を記録し、多様で現実的な動きデータの利点を示した。
- 除去実験では、クロス再構成損失を除くとMSEが100%以上増加し、分離に果たすその重要性が明確になった。
- トリプレット損失は分離に顕著な貢献を示し、除去するとMSEが16%増加した。一方、adversarial損失は指標スコアに大きな影響を及ぼさずに視覚的リアリズムを向上させた。
- リムスケーリングの拡張機構により、極端なボディ構造への一般化が向上し、多様で未学習のボディタイプに対しても安定した性能を発揮した。
- 高多様性の屋外動画で学習されたため、本手法は複雑で極端な動きに対しても良好に一般化可能であり、合成された動きデータセットに限定された教師あり手法とは対照的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。