Skip to main content
QUICK REVIEW

[論文レビュー] PhysDiff: Physics-Guided Human Motion Diffusion Model

Ye Yuan, Jiaming Song|arXiv (Cornell University)|Dec 5, 2022
Human Pose and Action Recognition被引用数 12
ひとこと要約

PhysDiffは、ノイズ除去プロセス中に繰り返し物理ベースの運動投影を適用することで物理的整合性を確保する、物理学的ガイド付き拡散モデルを提案する。各ステップで物理シミュレータ内での運動模倣ポリシーを用いてノイズ除去された運動を補正することで、データセット全体で物理的誤差を78%以上削減し、SOTAの運動品質を達成した。後処理や標準的な拡散モデルを上回る性能を発揮した。

ABSTRACT

Denoising diffusion models hold great promise for generating diverse and realistic human motions. However, existing motion diffusion models largely disregard the laws of physics in the diffusion process and often generate physically-implausible motions with pronounced artifacts such as floating, foot sliding, and ground penetration. This seriously impacts the quality of generated motions and limits their real-world application. To address this issue, we present a novel physics-guided motion diffusion model (PhysDiff), which incorporates physical constraints into the diffusion process. Specifically, we propose a physics-based motion projection module that uses motion imitation in a physics simulator to project the denoised motion of a diffusion step to a physically-plausible motion. The projected motion is further used in the next diffusion step to guide the denoising diffusion process. Intuitively, the use of physics in our model iteratively pulls the motion toward a physically-plausible space, which cannot be achieved by simple post-processing. Experiments on large-scale human motion datasets show that our approach achieves state-of-the-art motion quality and improves physical plausibility drastically (>78% for all datasets).

研究の動機と目的

  • 既存の運動拡散モデルには物理的整合性が欠けていることが多く、浮遊、足のスライド、床貫通などのアーティファクトが生じることを是正する。
  • 後処理ではなく、拡散プロセスに直接物理的制約を統合することで、運動品質と物理的リアリズムを向上させる。
  • 物理シミュレータ内での運動模倣を用いて、各拡散ステップでノイズ除去された運動を補正する物理ベースの運動投影モジュールを開発する。
  • 物理的整合性と運動品質のバランスをとるために、物理的投影ステップの最適スケジューリングを調査する。
  • 拡散と物理の繰り返し結合が、最終段階での後処理に比べて優れていることを実証する。後処理は運動の安定性を損なうか、品質を低下させることがある。

提案手法

  • 学習済み運動模倣ポリシーを用いて物理エンジン内でノイズ除去された運動をシミュレート・補正する物理ベースの運動投影モジュールを導入する。
  • 複数の拡散ステップで投影モジュールを適用し、データ分布の整合性を保ちながら、物理的に整合性のある空間へ段階的に運動を改善する。
  • 大規模なモーショングラフデータで訓練された微分可能運動模倣ポリシーを用い、シミュレータ内でのキャラクターエージェントを制御し、接触、バランス、動的特性を強制する。
  • 各ノイズ除去ステップの後に物理的投影を適用する拡散プロセスを採用し、物理的制約を生成プロセス全体に埋め込む。
  • 物理的投影の適用タイミングを異なるタイムステップ(例:最終段階、均等、間隔開け)に設定し、物理的整合性と運動品質のトレードオフを調査する。
  • 既存のノイズ除去ネットワーク(例:MDM、MotionDiffuse)と互換性を保ち、再訓練なしにSOTAモデルを即座に改善可能である。

実験結果

リサーチクエスチョン

  • RQ1拡散プロセス中に繰り返し物理的投影を適用することで、後処理に比べて物理的整合性が著しく向上するか?
  • RQ2物理的整合性と運動品質のバランスをとるために、物理的投影の適用スケジュールは最適化可能か?
  • RQ3拡散プロセスに物理的制約を統合することで、浮遊や足のスライドなどのアーティファクトが減少し、運動品質が維持または向上するか?
  • RQ4物理的投影ステップの数が、物理的リアリズムと自然な運動品質のトレードオフにどのように影響するか?
  • RQ5物理的ガイド付き拡散モデルは、HumanML3D や HumanAct12 といった標準ベンチマークでSOTA性能を達成できるか?

主な発見

  • PhysDiffは、テキストから運動への生成のためのHumanML3Dベンチマークにおいて、物理的誤差を86%以上削減し、ベースラインの拡散モデルを著しく上回った。
  • HumanAct12およびUESTCデータセットでは、それぞれ物理的誤差指標を78%および94%改善したが、FIDスコアは競争力のある水準を維持した。
  • End 4, Space 1スケジュール(最終段階で4回連続して物理的投影を適用し、1ステップ間隔を開ける)が、物理的整合性と運動品質の最良なトレードオフを達成した。
  • 最終段階での物理的投影による後処理は、運動品質の向上に失敗し、むしろ劣化させる傾向にあり、最終的な運動が安定なシミュレーションに耐えられないほど不自然な場合が多い。
  • 物理的投影ステップを増やすことで物理的整合性は向上するが、一定の点を超えると運動品質が低下する傾向にあり、明確なトレードオフが存在することが示された。
  • 物理シミュレーションのため、MDMより2.5倍遅いが、バッチサイズ256では推論速度の差が1.7倍に縮まり、並列化による性能向上の可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。