Skip to main content
QUICK REVIEW

[論文レビュー] TcGAN: Semantic-Aware and Structure-Preserved GANs with Individual Vision Transformer for Fast Arbitrary One-Shot Image Generation

Yunliang Jiang, Lili Yan|arXiv (Cornell University)|Feb 16, 2023
Image Processing Techniques and Applications被引用数 4
ひとこと要約

TcGAN は、長距離依存関係をモデル化するための個別 Vision Transformer (ViT) を統合することで、受容 field が限られる CNN に起因する課題を克服し、高速かつ任意の one-shot 画像生成を実現する意味的注意型で構造を保持する GAN を提案する。SIFID が 0.0117、LPIPS が 0.0560、SSIM が 0.8449 という最先端の性能を達成しており、学習時間は約 10 分で、ConSinGAN より 1.6 倍速く、SinGAN より 6.5 倍速い。

ABSTRACT

One-shot image generation (OSG) with generative adversarial networks that learn from the internal patches of a given image has attracted world wide attention. In recent studies, scholars have primarily focused on extracting features of images from probabilistically distributed inputs with pure convolutional neural networks (CNNs). However, it is quite difficult for CNNs with limited receptive domain to extract and maintain the global structural information. Therefore, in this paper, we propose a novel structure-preserved method TcGAN with individual vision transformer to overcome the shortcomings of the existing one-shot image generation methods. Specifically, TcGAN preserves global structure of an image during training to be compatible with local details while maintaining the integrity of semantic-aware information by exploiting the powerful long-range dependencies modeling capability of the transformer. We also propose a new scaling formula having scale-invariance during the calculation period, which effectively improves the generated image quality of the OSG model on image super-resolution tasks. We present the design of the TcGAN converter framework, comprehensive experimental as well as ablation studies demonstrating the ability of TcGAN to achieve arbitrary image generation with the fastest running time. Lastly, TcGAN achieves the most excellent performance in terms of applying it to other image processing tasks, e.g., super-resolution as well as image harmonization, the results further prove its superiority.

研究の動機と目的

  • CNN に基づく one-shot 画像生成 (OSG) 法の限界に対処する。特に、グローバル構造の保持と長距離依存関係のモデル化に課題を抱える。
  • Vision Transformer のアテンションメカニズムを活用することで、既存の OSG モデルにおける一般化性能の低さと構造的不一致を克服する。
  • 限られたデータで実用的応用に適した、スケーラブルで高速学習可能な、任意の画像生成フレームワークを開発する。
  • 追加のラベルなしで高精細な画像超解像と画像ハーモナイズ化を可能にするスケール不変スケーリングを活用する。
  • SinGAN や ConSinGAN、PetsGAN などの最先端 OSG 法と比較して、より高速な学習と優れた画像品質を達成する。

提案手法

  • 長距離依存関係をモデル化し、グローバル画像構造を保持するための個別 Vision Transformer (ViT) を統合した新しい TcGAN フレームワークを導入する。
  • 画像超解像においても意味的整合性を維持できるスケール不変スケーリング式を設計し、再トレーニングやラベルなしで高忠実度の生成を可能にする。
  • OSG における標準的な CNN ベースの特徴抽出器を、グローバルコンテキストモデリングを強化し、構造アーチファクトを低減する ViT ベースのエンコーダに置き換える。
  • SinGAN に類似したマルチスケール・パッチベースのトレーニング戦略を採用するが、ViT を用いた特徴学習により、局所的ディテールとグローバルレイアウトの両方を保持する。
  • 敵対的訓練の安定性を向上させ、より現実的なテクスチャーや構造を生成するために、自己注意機構を備えたディスクラミネータを実装する。
  • 超解像や画像ハーモナイズ化などのダウンストリームタスクへのゼロショット適応を可能にする TcGAN コンバータフレームワークを統合する。

実験結果

リサーチクエスチョン

  • RQ1Vision Transformer をベースとするジェネレータは、one-shot 画像生成において、CNN ベースのジェネレータよりもグローバル構造と意味的整合性をより効果的に保持できるか?
  • RQ2提案されたスケール不変スケーリング式は、追加ラベルを必要とせずに画像超解像品質をどのように向上させるか?
  • RQ3ジェネレータに個別 ViT を統合することで、one-shot 画像生成における学習速度と推論品質にどのような影響を与えるか?
  • RQ4TcGAN は微調整なしで、超解像や画像ハーモナイズ化などのダウンストリームタスクに効果的に一般化できるか?
  • RQ5SinGAN や ConSinGAN、PetsGAN などの既存の最先端 OSG 法と比較して、TcGAN は学習効率と画像品質において優れているか?

主な発見

  • TcGAN は Places50 データセットで SIFID スコアが 0.0117 と最低を記録し、すべてのベースラインと比較して優れた画像品質と多様性を示している。
  • CelebA50 データセットでは、SSIM が 0.8882 を達成しており、元画像との強い構造的類似性を示しながら多様なサンプルを生成している。
  • TcGAN は平均学習時間を約 10 分にまで短縮し、ConSinGAN より 1.6 倍、ExSinGAN より 2.8 倍、SinGAN や SinDiffusion より 6.5 倍速い。
  • Places50 では LPIPS が 0.0560 を達成しており、生成画像の知覚的多様性が高く、冗長性が最小限に抑えられていることを示している。
  • TcGAN は超解像と画像ハーモナイズ化タスクに効果的に一般化でき、追加のラベルなしで意味的整合性と構造的忠実度を維持している。
  • アブレーションスタディにより、ViT コンponent がグローバル構造の保持に不可欠であることが確認され、削除すると性能が著しく低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。