Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Globally Edit Images with Textual Description

Hai Wang, J. D. Williams|arXiv (Cornell University)|Oct 13, 2018
Multimodal Machine Learning Applications参考文献 55被引用数 17
ひとこと要約

本稿では、GANとRNNベースのテキストエンコーダーを活用して、自由形式のテキスト記述を用いたエンドツーエンドで学習可能な深層学習フレームワークを、グローバル画像編集のために提案する。フィルターバンクモデルがパフォーマンスと効率性の最良のバランスを達成しており、RNNをGraph RNNに置き換えることでさらなる性能向上が得られ、事前に定義されたルールに依存せずに完全にテキスト駆動のグローバル画像編集を可能にする最初の研究である。

ABSTRACT

We show how we can globally edit images using textual instructions: given a source image and a textual instruction for the edit, generate a new image transformed under this instruction. To tackle this novel problem, we develop three different trainable models based on RNN and Generative Adversarial Network (GAN). The models (bucket, filter bank, and end-to-end) differ in how much expert knowledge is encoded, with the most general version being purely end-to-end. To train these systems, we use Amazon Mechanical Turk to collect textual descriptions for around 2000 image pairs sampled from several datasets. Experimental results evaluated on our dataset validate our approaches. In addition, given that the filter bank model is a good compromise between generality and performance, we investigate it further by replacing RNN with Graph RNN, and show that Graph RNN improves performance. To the best of our knowledge, this is the first computational photography work on global image editing that is purely based on free-form textual instructions.

研究の動機と目的

  • 手作業で定義されたルールやAPIに依存せずに、任意のテキスト指示を用いたグローバル画像編集を可能にすること。
  • 学習用に、対応する自由形式のテキスト記述を伴う大規模な画像変換ペアデータセットを収集すること。
  • 複雑さと専門知識のエンコードの程度を変化させた3つのトレーニング可能なモデル(バケット、フィルターバンク、エンドツーエンド)の設計と比較を行うこと。
  • 画像編集におけるテキストエンコーディングとしてGraph RNNの有効性を検証し、標準的なRNNよりも優れた性能を示すこと。
  • 学習された変換が、グローバル編集の学習にもかかわらず局所的変換を可能にしていることの証明を行い、豊富な非線形マッピング能力を示すこと。

提案手法

  • 本システムは、テキスト記述をRNNまたはGraph RNNで埋め込み、生成器に条件付けた、条件付きGANアーキテクチャを採用。エンコーダ・デコーダ構造を有する。
  • 3つのモデルを提案:手作業で定義されたフィルタを用いたバケットベースモデル、学習可能なフィルタを有するフィルターバンクモデル、事前構造を持たない完全なエンドツーエンドモデル。
  • フィルターバンクモデルは、テキストエンコーダーによって動的に選択されるトレーニング可能なフィルタの集合を用い、柔軟で効率的な変換学習を可能にする。
  • 長距離依存性や語の関係をモデル化するため、テキストエンコーダーにGraph RNNを適用し、曖昧または長い記述に対しても性能が向上する。
  • アマゾンMechanical Turkを用いて、明るさ、コントラスト、色調調整などの多様なグローバル編集操作をカバーする約2,000組の画像-テキストペアのカスタムデータセットを収集。
  • 生成の現実性と忠実性を確保するため、 adversarial loss、perceptual loss、L1 lossを用いて訓練を行う。

実験結果

リサーチクエスチョン

  • RQ1事前に定義されたルールに依存せずに、自由形式のテキスト記述からグローバル画像編集を学習できる深層学習モデルは存在するか?
  • RQ2バケット、フィルターバンク、エンドツーエンドの各モデルアーキテクチャの、品質、メモリ使用量、トレーニング効率という観点での性能比較は?
  • RQ3特に長いまたは曖昧な指示において、標準的なRNNと比較してGraph RNNはテキストエンコーディングにおいて画像編集で優れた性能を示せるか?
  • RQ4グローバル編集の学習で訓練されたモデルが、局所的変換をどの程度学習できるか、また専門家のアノテーションと比較してどうなるか?
  • RQ5実世界の多様なテキスト記述を用いて、完全にエンドツーエンドのシステムを学習することは可能か?

主な発見

  • フィルターバンクモデルがパフォーマンスと効率性の最良のトレードオフを達成しており、K_bバケットを必要とするバケットモデルに比べて、メモリ使用量が1/K_bにまで削減される。
  • Graph RNNは、スタンドアロン評価およびペairwise評価の両方で標準的なGRUを上回り、スタンドアロンスコアは3.35 ± 1.24(Graph RNN)対3.31 ± 1.22(GRU)であった。
  • モデルは複雑で非グローバルなマッピングを学習している:RGBリマップの出力範囲は専門家Aよりも広く、局所的変換を示している。
  • フィルターバンク内の各学習済みフィルタは、明るさの増加・減少といった特定の編集タイプに対応しており、フィルタ関数に明示的な監視がなくても同定可能である。
  • 本システムは、未観測の指示に対しても一般化がうまくいくことが示され、実データにおけるエンドツーエンド学習が、堅牢なテキストから画像への編集を可能にしている。
  • 特にGraph RNNの構造的認識のおかげで、長く曖昧なテキスト指示に対しても編集を適切に適用することが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。