[論文レビュー] Diverse Semantic Image Synthesis via Probability Distribution Modeling
本稿では、クラスごとのモジュレーションパラメータを連続確率分布としてモデル化することで、インスタンスレベルおよびセマンティックレベルの多様性を実現する、新しいフレームワークである INADE を提案する。インスタンスに適応する確率的サンプリングとプライオリティノイズの再マッピングを用いることで、同等または優れた画像品質を維持しつつ、最先端の多様性を達成し、複数のデータセットにおいて定量的指標および定性的な結果の両面で、既存手法を上回る性能を発揮する。
Semantic image synthesis, translating semantic layouts to photo-realistic images, is a one-to-many mapping problem. Though impressive progress has been recently made, diverse semantic synthesis that can efficiently produce semantic-level multimodal results, still remains a challenge. In this paper, we propose a novel diverse semantic image synthesis framework from the perspective of semantic class distributions, which naturally supports diverse generation at semantic or even instance level. We achieve this by modeling class-level conditional modulation parameters as continuous probability distributions instead of discrete values, and sampling per-instance modulation parameters through instance-adaptive stochastic sampling that is consistent across the network. Moreover, we propose prior noise remapping, through linear perturbation parameters encoded from paired references, to facilitate supervised training and exemplar-based instance style control at test time. Extensive experiments on multiple datasets show that our method can achieve superior diversity and comparable quality compared to state-of-the-art methods. Code will be available at \url{https://github.com/tzt101/INADE.git}
研究の動機と目的
- セマンティックレイアウトから、特にインスタンスレベルにおいて、多様で高精細なフォトリアリスティックな画像を生成する課題に対処すること。
- 従来手法がグローバルまたはセマンティックレベルの多様性に限定され、計算コストが高くなる問題を克服すること。
- 連続確率分布としてのモジュレーションパラメータにより、細かく制御可能な多様性を実現すること。
- 推論時におけるリファレンスベースのスタイル制御を可能とするために、プライオリティノイズの再マッピングを活用すること。
提案手法
- 固定値ではなく、連続確率分布としてクラスごとの条件付き正規化パラメータを表現する変分的モジュレーションモデルを提案する。
- 一貫したランダム性と学習可能な変換を備えた、インスタンスに適応するモジュレーションパラメータの確率的サンプリングを導入する。
- ペアドリファレンス画像から符号化された線形摂動パラメータを用いたプライオリティノイズの再マッピングを採用し、教師あり学習の効率を向上させるとともに、推論時におけるリファレンスベースのスタイル制御を可能にする。
- インスタンスに意識的な正規化を組み込んだ条件付き GAN フレームワークにこの手法を統合し、INADE(インスタンスに適応する DE 正規化)と命名する。
- 各正規化層に対して学習可能な変換を導入し、ネットワーク全体にわたる確率的サンプリングの整合性を保ち、安定した生成を実現する。
- ペアドリファレンスを活用して摂動パラメータを符号化し、ノイズサンプルを再マッピングすることで、推論時にエグジンプレアベースのスタイル変換を可能にする。
実験結果
リサーチクエスチョン
- RQ1モジュレーションパラメータを連続確率分布としてモデル化することで、インスタンスレベルにおけるより柔軟で多様な画像合成が可能になるか?
- RQ2深層ネットワーク全体にわたり、一貫性があり、整合性のある確率的サンプリングをどのように達成できるか? これにより、画像品質を維持しつつ多様性を実現できるか?
- RQ3リファレンス画像からのプライオリティノイズの再マッピングは、訓練効率の向上と、追加の推論ブランチを必要としないテスト時スタイル制御の実現に寄与するか?
- RQ4複雑なデータセットにおいて、本手法は、多様性、品質、計算効率の観点から、既存の最先端手法と比較してどの程度優れているか?
- RQ5本手法は、複雑なシーンにおけるセマンティックレベルおよびインスタンスレベルのマルチモーダル生成を、どの程度サポートできるか?
主な発見
- INEA は、Cityscapes、ADE20K、CelebAMask-HQ、DeepFashion データセットにおいて、多様性と品質の両面で、すべての指標で最先端の手法を上回る、包括的な性能を達成した。
- Cityscapes および ADE20K において、FID と LPIPS の両面で GroupDNet を顕著に上回り、推論時間は 59% から 79% 減少し、FLOPs も 82% から 89% 減少した。
- アブレーションスタディの結果、インスタンスごとのサンプリング(US)を削除すると手法が失敗し、プライオリティノイズの再マッピング(PNR)を削除すると画像品質が著しく低下することが確認された。
- 定性的な結果から、BicycleGAN や DSCGAN、VSPADE、GroupDNet よりも、特に複数の相互作用するインスタンスを含む複雑なシーンにおいて、より現実的で多様な画像を生成していることが示された。
- 本手法は、セマンティックレベルおよびインスタンスレベルの編集を両方サポートし、特定のオブジェクト(例:ヘアスタイル、上着、パンツ)に対してリファレンスベースの外観転送を可能にする。
- FID スコアが、追加のリファレンス入力を使用する SOTA 手法と同等またはそれ以上である一方で、高品質な生成を維持しつつ、細かく制御可能な多様性を実現している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。