Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Warping for Animation with Image Sets

Arun Mallya, Ting-Chun Wang|arXiv (Cornell University)|Oct 4, 2022
Human Pose and Action Recognition被引用数 8
ひとこと要約

本稿では、ドライブ動画との対応関係に基づき、複数のソース画像から特徴を選び、ワープするための暗黙的ワープフレームワークを提案する。1つのクロスモodalアテンション層を用いることで、明示的なフローパラメータ推定を回避し、動的な特徴選択を可能にし、単一および複数ソース画像アニメーションの両方で最先端の結果を達成した。

ABSTRACT

We present a new implicit warping framework for image animation using sets of source images through the transfer of the motion of a driving video. A single cross- modal attention layer is used to find correspondences between the source images and the driving image, choose the most appropriate features from different source images, and warp the selected features. This is in contrast to the existing methods that use explicit flow-based warping, which is designed for animation using a single source and does not extend well to multiple sources. The pick-and-choose capability of our framework helps it achieve state-of-the-art results on multiple datasets for image animation using both single and multiple source images. The project website is available at https://deepimagination.cc/implicit warping/

研究の動機と目的

  • 明示的な各ソースごとのワープ依存に起因する、複数のソース画像を扱う際に困難をきたす既存のフローベースの画像アニメーション手法の限界を解消すること。
  • 複数の視点における外見的およびポーズ情報の相補的特徴を活用することで、セットとしてのソース画像を用いて高忠実度の画像アニメーションを実現すること。
  • アーキテクチャの再設計や特段の修正なしに、単一から複数のソース画像へ自然にスケーリング可能な統合フレームワークを構築すること。
  • 複数のソースからのワープ特徴を平均化する際の特徴のずれや一貫性の欠如といった問題を克服すること。
  • 動的な特徴選択により、同一アイデンティティおよびクロスアイデンティティのモーショントランスファーにおいて、優れた視覚的品質を達成すること。

提案手法

  • ドライブ画像からクエリを、ソース画像からキーと値を計算する1つのクロスモダラー・アテンション層を採用し、特徴の統合的選択とワープを可能にする。
  • アテンションスコアを用いて、ソース画像とドライブ画像間の対応関係を暗黙的に特定し、明示的なフローエstimatationを回避する。
  • アテンション重みに基づき、複数のソース画像からの特徴を選択・統合することで、複数の視点間での「ピックアンドチーズ」メカニズムを実現する。
  • ワープされた特徴とアテンションモジュールの間に残差接続を統合し、構造的詳細の保持と訓練安定性の向上を図る。
  • 特定のソース特徴が欠落または隠蔽されている場合の特徴共有を向上させるために、学習可能なキー・バリュー変換を導入する。
  • キーポイントの位置とその可視性の強度をスカラー値として表現し、フル・ジャコビアン行列と比較して表現の複雑さを低減する。

実験結果

リサーチクエスチョン

  • RQ1明示的なフローパラメータ推定を一切行わないフレームワークとして、単一および複数ソース画像設定の両方で優れた画像アニメーション品質を達成できるか?
  • RQ2クロスモダラー・アテンションによる暗黙的特徴選択は、明示的なフローベースのワープと比較して、視覚的忠実度および遮蔽に対するロバストネスにおいてどのように優れているか?
  • RQ3複数のソース画像を用いることで、目の色や背景テクスチャといった複雑な外見を扱う際に、どの程度アニメーション品質が向上するか?
  • RQ41つのアテンション層が、各画像のフローサポートなしに、多様なソース画像間での対応関係学習と特徴ワープを効果的に処理できるか?
  • RQ5外見とモーションが分離されたクロスアイデンティティのモーショントランスファーにおいて、本手法はどのように性能を発揮するか?

主な発見

  • 本手法は、単一および複数ソース画像アニメーションの両方において、複数のデータセットで最先端のパフォーマンスを達成し、複数ソース設定ではユーザープreferencesスコアが91.4%に達した。
  • 256×256解像度のTalkingHead-1KHデータセットにおいて、ベースラインのFOMMに比べてPSNRが0.329向上、FIDが1.726低下し、LPIPSは0.009低下した。
  • アブレーションスタディにより、残差接続および学習可能なキー/バリューの追加がすべての指標を向上させ、FIDが19.978から18.252に低下したことが確認された。
  • 視覚的分析の結果、本手法は適切なソース画像からの特徴選択により、目の色や背景テクスチャを正しく保持しているのに対し、先行手法は幻覚的またはぼやけた出力を生成していた。
  • ネットワークは可視性やポーズに応じてキーポイント強度値を調整し、遮蔽や極端な角度下でもロバストな特徴表現を学習している。
  • 複数の視点からの相補的特徴を活用することで、幻覚的出力を減らしており、図4の特徴借用パターンから、複数のソース領域が出力に寄与していることが一貫して示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。