[論文レビュー] Face-to-Parameter Translation for Game Character Auto-Creation
本稿では、1枚の顔写真から自動的にゲームキャラクターを生成するための顔からパラメータ(F2P)翻訳手法を提案する。非微分可能なゲームエンジンレンダリングに対しても勾配ベースの最適化を可能にするために、微分可能生成イミテーターを用いる。この手法により、全体的な外観と局所的な顔の細部の両方において高い類似度が達成され、ユーザースタディーでは50.26%の選択率を示し、100万人以上のユーザーが利用するライブゲームに導入された。
Character customization system is an important component in Role-Playing Games (RPGs), where players are allowed to edit the facial appearance of their in-game characters with their own preferences rather than using default templates. This paper proposes a method for automatically creating in-game characters of players according to an input face photo. We formulate the above "artistic creation" process under a facial similarity measurement and parameter searching paradigm by solving an optimization problem over a large set of physically meaningful facial parameters. To effectively minimize the distance between the created face and the real one, two loss functions, i.e. a "discriminative loss" and a "facial content loss", are specifically designed. As the rendering process of a game engine is not differentiable, a generative network is further introduced as an "imitator" to imitate the physical behavior of the game engine so that the proposed method can be implemented under a neural style transfer framework and the parameters can be optimized by gradient descent. Experimental results demonstrate that our method achieves a high degree of generation similarity between the input face photo and the created in-game character in terms of both global appearance and local details. Our method has been deployed in a new game last year and has now been used by players over 1 million times.
研究の動機と目的
- RPGにおける手作業によるキャラクターカスタマイズの時間的負担を軽減するため、プレイヤーの顔写真からゲーム内での自動キャラクター生成を可能にすること。
- 物理的に意味のある顔パラメータの空間上で、キャラクター生成をパラメータ探索問題として定式化し、ゲームエンジンとの互換性を保証すること。
- ゲームエンジンレンダリングの非微分性を克服するため、レンダリングプロセスを模倣するトレーナブルな生成イミテーターを導入すること。
- 生成品質の向上のため、グローバルな外観を最適化するための識別的損失と、局所的細部を保全するための顔のコンテンツ損失を設計すること。
- 生成後におけるパラメータの微調整を可能にするユーザーアクセスを可能にすること。
提案手法
- 本手法は、入力された顔写真に一致させるために、物理的に意味のある顔パラメータの多数の集合上で最適化問題としてゲームキャラクター自動生成を定式化する。
- 生成ネットワーク $ G $ が非微分可能なゲームエンジンレンダリングを模倣する「イミテーター」として機能し、エンドツーエンドのバックプロパゲーションと勾配降下最適化を可能にする。
- 二つの損失関数を導入する:グローバルな顔の外観類似度を最適化するための識別的損失 $ \mathcal{L}_1 $ と、局所的細部の保持を目的とした顔のコンテンツ損失 $ \mathcal{L}_2 $ で、両者とも深層畳み込みニューラルネットワーク(CNN)特徴に基づく。
- 全パイプラインは、マルチタスク学習を用いてエンドツーエンドで訓練され、入力画像から直接顔パラメータを最適化可能となる。
- 本手法は、生成後の初期自動生成段階の後、パラメータのオプションによる微調整を可能にするユーザーアクセスをサポートする。
- イミテーターは、入力顔写真とそれに対応するレンダリング済みゲームキャラクター画像のデータセット上で学習され、パラメータから視覚的出力へのマッピングを学習する。
実験結果
リサーチクエスチョン
- RQ1非微分可能なゲームエンジンレンダリングプロセスを、トレーナブルなイミテーターネットワークを用いて深層学習によって効果的に最適化できるか?
- RQ2物理的に意味がありゲームエンジンと互換性のあるパラメータ空間において、顔の類似度をどのように測定・最適化できるか?
- RQ3識別的損失と顔のコンテンツ損失は、生成されたゲームキャラクターのリアリズムと細部の忠実度をどの程度向上させるか?
- RQ4本手法は、スケッチやコマーシャル風の絵など、非フォトグラフィックな入力に対しても一般化可能であり、顔の意味論的特徴を保持できるか?
- RQ5既存のニューラルスタイル転送および3次元顔再構築技術と比較して、本手法の品質と効率性はどの程度か?
主な発見
- 本手法は、代替手法と比較してユーザープ references レビューで50.26%の選択率を達成し、1つの損失関数のみを用いた手法を著しく上回った。
- アブレーションスタディーにより、識別的損失 $ \mathcal{L}_1 $ と顔のコンテンツ損失 $ \mathcal{L}_2 $ の両方が不可欠であることが確認され、併用した損失関数が最も高いユーザーライク度を示した。
- 定量的評価では、本手法はモードスコア1.1418 ± 0.0049およびFrechet Inception Distance(FID)0.0390 ± 0.0018を達成し、グローバルスタイル(FID: 0.0677)およびローカルスタイル(FID: 0.0554)手法を上回った。
- TITAN Xpで16秒の実行時間で動作し、ローカルスタイル転送(43秒)を上回り、より高速な手法と同等の性能を示しながらも、優れたスタイル類似度を達成した。
- 本手法は、画像のぼやけや照明の変動に対してもロバストであり、多様な入力条件下でも高品質な生成を維持した。
- 本手法は、スケッチやコマーシャル風のアートポートレートからも、現実的なゲームキャラクターを生成でき、意味論的類似度測定のおかげで非フォトグラフィック入力への強い一般化能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。