Skip to main content
QUICK REVIEW

[論文レビュー] Generating Images with Sparse Representations

Charlie Nash, Jacob Menick|arXiv (Cornell University)|Mar 5, 2021
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 9
ひとこと要約

本稿では、量子化されたDCT係数のスパース表現をモデル化することで、高解像度画像を生成するTransformerベースの自己回帰的モデル、DCTransformerを提案する。画像を非ゼロのDCTチャネル、空間的位置、係数値の三つ組として扱うことで、ImageNetやその他のデータセットにおいて競争力のあるサンプル品質と多様性を達成するとともに、最小限のアーキテクチャ変更で効率的なスーパーサンプルリゾリューションとカラー化を実現する。

ABSTRACT

The high dimensionality of images presents architecture and sampling-efficiency challenges for likelihood-based generative models. Previous approaches such as VQ-VAE use deep autoencoders to obtain compact representations, which are more practical as inputs for likelihood-based models. We present an alternative approach, inspired by common image compression methods like JPEG, and convert images to quantized discrete cosine transform (DCT) blocks, which are represented sparsely as a sequence of DCT channel, spatial location, and DCT coefficient triples. We propose a Transformer-based autoregressive architecture, which is trained to sequentially predict the conditional distribution of the next element in such sequences, and which scales effectively to high resolution images. On a range of image datasets, we demonstrate that our approach can generate high quality, diverse images, with sample metric scores competitive with state of the art methods. We additionally show that simple modifications to our method yield effective image colorization and super-resolution models.

研究の動機と目的

  • 画像のピクセルベース自己回帰的生成モデルにおける高次元性と計算コストの問題に対処すること。
  • 古典的な画像圧縮技術、例えばDCT量子化を活用して、尤度ベースの生成モデルに適したコンパクトでスパースな表現を構築すること。
  • 高解像度画像生成に適したスケーラブルな自己回帰的Transformerアーキテクチャを構築すること。
  • スパースDCT表現が、再トレーニングを伴わずに効果的な画像スーパーサンプルリゾリューションおよびカラー化を可能にすることを示すこと。
  • 最先端のGANと同等のサンプル品質と多様性を達成するとともに、トレーニングの安定性と完全なデータ分布カバレッジを維持すること。

提案手法

  • 8×8ピクセルブロックとジグザグ順序を用いて、画像を量子化されたDCT係数の3次元テンソルに変換する。
  • 非ゼロのDCT係数をスパースな3つ組(チャネル、空間的位置、係数値)として表現し、自己回帰的モデリング用のシーケンスを形成する。
  • 自己回帰的モデリングのために、次の要素を過去の要素に条件づけて予測する、DCTransformerと呼ばれるTransformerベースのアーキテクチャを訓練する。
  • 長大なシーケンスを効率的に処理するため、チャンク化されたトレーニング制御を採用し、画像サイズに関係なく一定のメモリと計算コストを維持する。
  • 生成プロセスは粗いものから細かいものへと順序付けられており、低周波成分から始まり、高周波成分の詳細へと進行する。
  • 後続タスクでは、モデルをファインチューニングまたは条件付けするために、入力シーケンスの構造を変更する——例えば、カラー化の場合は色チャネルを最後に配置する。

実験結果

リサーチクエスチョン

  • RQ1スパースDCT表現は、高解像度での効率的かつ効果的な自己回帰的画像生成を可能にするか?
  • RQ2ピクセルベースまたはVQ-VAEベースの表現と比較して、DCT係数の量子化表現による画像モデリングは、サンプル品質と多様性の観点でどのように異なるか?
  • RQ3同じスパースDCTベースのモデルを、最小限のアーキテクチャ変更でスーパーサンプルリゾリューションおよびカラー化タスクに適応可能か?
  • RQ4DCTのような古典的圧縮技術の使用は、GANと比較してサンプル多様性とトレーニング安定性を向上させるか?
  • RQ5標準の自己回帰的モデルと比較して、スパース表現は推論コストとメモリコストをどの程度削減するか?

主な発見

  • DCTransformerは、256×256解像度のImageNetにおいて、最先端のGANと同等のサンプル指標スコアを達成し、サンプル多様性が向上している。
  • 植物の葉データセットにおいて、2048×2048解像度で高品質で多様な画像を生成したが、これは神経ネットワークを用いた同解像度での非条件的生成の初の例である。
  • 画像アップサンプリングのタスクでは、DCTransformerでアップサンプリングされた画像は、元の検証セットの画像と同等またはそれ以上のスコアを達成しており、精度指標を除いては同様である。
  • 画像カラー化のタスクでは、モデルのサンプル指標は真値に非常に近く、トレーニングデータの分布と強く一致していることを示している。
  • 同じアーキテクチャとトレーニング手順を用いて、低周波成分から高周波成分の詳細を生成することで、ゼロショットスーパーサンプルリゾリューションを効果的に実現している。
  • 大規模なモデルと多数の計算資源を要するが、尤度最大化目的関数のおかげで完全なデータ分布カバレッジを達成し、多様性の高い出力を得ている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。