[論文レビュー] Object-driven Text-to-Image Synthesis via Adversarial Training
Obj-GANはオブジェクト駆動の注意生成とオブジェクトごとの識別を導入し、テキストから複雑な場面を合成し、COCOの結果を従来手法より改善します。
In this paper, we propose Object-driven Attentive Generative Adversarial Newtorks (Obj-GANs) that allow object-centered text-to-image synthesis for complex scenes. Following the two-step (layout-image) generation process, a novel object-driven attentive image generator is proposed to synthesize salient objects by paying attention to the most relevant words in the text description and the pre-generated semantic layout. In addition, a new Fast R-CNN based object-wise discriminator is proposed to provide rich object-wise discrimination signals on whether the synthesized object matches the text description and the pre-generated layout. The proposed Obj-GAN significantly outperforms the previous state of the art in various metrics on the large-scale COCO benchmark, increasing the Inception score by 27% and decreasing the FID score by 11%. A thorough comparison between the traditional grid attention and the new object-driven attention is provided through analyzing their mechanisms and visualizing their attention layers, showing insights of how the proposed model generates complex scenes in high quality.
研究の動機と目的
- 複雑なテキスト記述から高品質かつ意味的に意味のある画像を生成する動機。
- COCOスケールの場面を扱うために、オブジェクトとそれらの関係を明示的にモデル化する必要性。
- 生成時に語彙レベルとオブジェクトレベルの情報を活用するオブジェクト駆動の注意機構を開発。
- レイアウトに沿ったオブジェクトごとの識別器を提案し、フィードバックをオブジェクトレベルで提供する。
提案手法
- 二段階生成: セマンティックレイアウト(境界ボックスと形状)を生成し、それを基に画像を合成。
- 各オブジェクト領域のクラスラベルを用いて語彙コンテキストを照会する、オブジェクト駆動の注意付き画像生成器。
- テキストとレイアウトに対して各境界ボックスを評価する、オブジェクト単位のFast R-CNNベース識別器。
- 各オブジェクトの語彙コンテキストを計算し、オブジェクト領域にわたってコンテキストを分配する、オブジェクト駆動の注意機構。
- パッチ単位の識別器は無条件およびテキスト条件付きのフィードバックを提供; 最終段のオブジェクト単位識別器はオブジェクト固有のフィードバックを提供。
- 損失はGAN目的に加え、DAMSMの語彙レベルのテキスト–画像整合性損失を組み合わせる。
実験結果
リサーチクエスチョン
- RQ1オブジェクト駆動の注意は、説明的なテキストからの細粒度で複数オブジェクトの画像合成を改善できるか?
- RQ2オブジェクトごとの識別とレイアウト条件付けを取り入れると、COCO規模の場面で現実感とレイアウト忠実性が向上するか?
- RQ3オブジェクト駆動の注意は高品質な生成を導く際、グリッド注意と比較してどうか?
- RQ4正解レイアウトと予測レイアウトを使用する場合、合成品質にどのような影響があるか?
- RQ5提案された要素は新規で珍しい場面記述に一般化できるか?
主な発見
- Obj-GANは従来手法よりもCOCOテキスト-画像合成の性能を大幅に向上させる。
- オブジェクト駆動の注意を使用すると、グリッド注意バリアントよりInceptionスコアが高く、FIDが低くなる。
- 正解のレイアウトを用いたObj-GANは最高の定性的・定量的結果を達成し、レイアウト品質の影響を示す。
- アブレーションは、オブジェクト駆動の注意がグリッド注意よりも、前景と背景のテクスチャの一貫性を生むことを示す。
- Obj-GAN-SOTAバリアントは本研究でCOCOベンチマークの最良の指標を達成。
- 定性的結果は、オブジェクト忠実度と場面の一貫性が改善され、新規記述を含む。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。