Skip to main content
QUICK REVIEW

[論文レビュー] Locally Masked Convolution for Autoregressive Models

Ajay N. Jain, Pieter Abbeel|ArXiv.org|Jun 22, 2020
Generative Adversarial Networks and Image Synthesis参考文献 45被引用数 7
ひとこと要約

本論文では、局所的マスクを特徴マップに適用することで、1つの深層ニューラルネットワークが任意の自己回帰的生成順序をサポートできるようにする、2次元畳み込みの単純だが効果的な変更であるローカルマスク付き畳み込み(LMConv)を提案する。複数の順序に対して重みを共有することで、タスク固有の訓練なしに、無条件画像生成(CIFAR-10で2.89ビット/次元)およびグローバルに一貫性のある画像補完で最先端の性能を達成する。

ABSTRACT

High-dimensional generative models have many applications including image compression, multimedia generation, anomaly detection and data completion. State-of-the-art estimators for natural images are autoregressive, decomposing the joint distribution over pixels into a product of conditionals parameterized by a deep neural network, e.g. a convolutional neural network such as the PixelCNN. However, PixelCNNs only model a single decomposition of the joint, and only a single generation order is efficient. For tasks such as image completion, these models are unable to use much of the observed context. To generate data in arbitrary orders, we introduce LMConv: a simple modification to the standard 2D convolution that allows arbitrary masks to be applied to the weights at each location in the image. Using LMConv, we learn an ensemble of distribution estimators that share parameters but differ in generation order, achieving improved performance on whole-image density estimation (2.89 bpd on unconditional CIFAR10), as well as globally coherent image completions. Our code is available at https://ajayjain.github.io/lmconv.

研究の動機と目的

  • 自己回帰的モデルが、レクタスキャンのような単一の固定された生成順序に制限されることで、画像補完などのタスクにおける効果的な文脈の活用が妨げられるという制限に対処すること。
  • 別々のパラメータ化や計算コストを追加せずに、1つの畳み込みニューラルネットワークが複数の自己回帰的生成順序をサポートできること。
  • 共有された重みを用いて複数の順序にわたるベイズ的モデル平均化を可能にすることで、尤度推定と生成品質を向上させること。
  • 観測された文脈に基づいて推論時に最適な生成順序を動的に選択することにより、グローバルに一貫性のある画像補完を実現すること。
  • 従来の畳み込みアーキテクチャに効率的でスケーラブルかつモジュール的な拡張を提供し、インダクティブバイアスを保持しながら柔軟な順序制御を可能にすること。

提案手法

  • 局所的マスク付き畳み込み(LMConv)を導入し、各空間的位置で学習可能な空間的に変化するマスクを特徴マップに適用することで、任意の自己回帰的順序を可能にする。
  • 入力や重みではなく、特徴マップのレベルでマスクを適用することで、異なる生成順序においても同じネットワークパラメータを再利用可能にする。
  • 標準的な畳み込み操作におけるim2colとcol2im変換にマスクを統合することで、行列乗算に基づく効率的な実装を実現する。
  • マスクをかけた特徴マップを用いて因果関係を強制するように、複数の順序で同時に条件付き確率を計算する1回の順方向伝搬により、モデルをエンドツーエンドで訓練する。
  • 同じネットワーク重みセットを用いて、結合分布の異なる自己回帰的分解に対応する複数のグラフィカルモデルを推定する。
  • 観測された文脈に基づいて、例えば画像補完タスクで可視化された文脈を最大化するような順序を選択することで、推論時に順序選択を可能にする。

実験結果

リサーチクエスチョン

  • RQ11つの畳み込みニューラルネットワークが、別々のパラメータ化なしに、複数の自己回帰的生成順序をサポートできるか?
  • RQ2計算効率を維持しながら、畳み込みアーキテクチャに任意の生成順序を効率的に実装する方法は何か?
  • RQ3共有された重みを用いて複数の順序をサポートすることで、画像モデリングにおける尤度推定と生成品質が向上するか?
  • RQ4局所的マスク付き畳み込みは、インpaintingタスクでの明示的訓練なしに、グローバルに一貫性のある画像補完を可能にするか?
  • RQ5LMConvによる順序に依存しない訓練は、CIFAR-10のような標準ベンチマークでどの程度性能を向上させるか?

主な発見

  • 提案されたローカルマスク付き畳み込み(LMConv)は、特徴マップに位置に依存するマスクを適用することで、1つのネットワークが任意の自己回帰的生成順序をサポート可能にする。
  • LMConvは、無条件CIFAR-10データセットで2.89ビット/次元という最先端のテストセット尤度を達成し、PixelCNN++を上回る。
  • 推論時に観測された文脈に基づいて最適な生成順序を動的に選択することで、グローバルに一貫性のある画像補完を実現する。
  • 1回の順方向伝搬で複数の順序にわたる並列な密度推定を可能にし、行列乗算に基づく実装により計算効率を維持する。
  • 画像補完の結果から、インpaintingマスクの特別な訓練なしに、文脈に適応した順序選択を活用することで、一貫性のある出力を生成できることを示す。
  • このアプローチは、MADEを畳み込みアーキテクチャに一般化しつつ、局所的受容 field のインダクティブバイアスを保持し、より良い長距離依存性モデリングを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。