Skip to main content
QUICK REVIEW

[論文レビュー] Structured Output Learning with Conditional Generative Flows

You Lü, Bert Huang|arXiv (Cornell University)|May 30, 2019
Generative Adversarial Networks and Image Synthesis参考文献 48被引用数 6
ひとこと要約

本稿では、構造予測タスクにおける条件付き尤度 $p(y|x)$ の正確かつ効率的な計算を可能にする正規化フローに基づくモデル、条件付きGlow(c-Glow)を提案する。入力に依存する結合層を備えた可逆フローを活用することで、補助的目的関数や変分推論に依存せずに、最大尤度に基づくエンドツーエンド学習が可能となり、画像セグメンテーション、ノイズ除去、インpaintingを含む5つの多様な構造予測タスクで最先端または競争力のある性能を達成した。

ABSTRACT

Traditional structured prediction models try to learn the conditional likelihood, i.e., p(y|x), to capture the relationship between the structured output y and the input features x. For many models, computing the likelihood is intractable. These models are therefore hard to train, requiring the use of surrogate objectives or variational inference to approximate likelihood. In this paper, we propose conditional Glow (c-Glow), a conditional generative flow for structured output learning. C-Glow benefits from the ability of flow-based models to compute p(y|x) exactly and efficiently. Learning with c-Glow does not require a surrogate objective or performing inference during training. Once trained, we can directly and efficiently generate conditional samples. We develop a sample-based prediction method, which can use this advantage to do efficient and effective inference. In our experiments, we test c-Glow on five different tasks. C-Glow outperforms the state-of-the-art baselines in some tasks and predicts comparable outputs in the other tasks. The results show that c-Glow is versatile and is applicable to many different structured prediction problems.

研究の動機と目的

  • 構造予測モデルにおける尤度計算の非可解性という課題に対処すること。これは、効果的な学習と推論を妨げる。
  • 補助的目的関数や近似推論に依存せずに、$p(y|x)$ の正確で効率的かつ微分可能な計算を可能にする条件付き生成モデルの開発。
  • 学習後、真の条件付き分布 $p(y|x)$ からの直接的かつ効率的なサンプリングを可能にすること。これにより、多様で高品質な予測が可能になる。
  • 離散的および連続的出力を有する多様な構造予測タスクにおける、提案手法の汎用性と性能を評価すること。

提案手法

  • c-Glowは、入力に依存する結合層を導入することで、Glow正規化フローのアーキテクチャを拡張し、変換が入力特徴 $x$ に依存可能にする。
  • 入力特徴 $x$ に基づいて結合パラメータを生成するコンディショナー・ネットワークを備えた、可逆的で自己回帰的スタイルの結合層を採用。これにより、変数変換の公式を用いて正確な尤度計算が可能になる。
  • 対数尤度 $\log p(y|x)$ は、可逆変換のヤコビ行列式の行列式を用いて正確に計算され、直接的な最大尤度学習が可能になる。
  • 推論時に学習済み分布から多様な条件付きサンプルを効率的に生成できる、サンプルベースの予測手法を開発した。
  • アーキテクチャは、コンディショナー・ネットワークの幅と深さ、および潜在空間の次元をタスクに応じて調整することで、タスク間で一貫したフレームワークを維持する。
  • 入力に対して構造的出力の正確な対数尤度を最大化するように、確率的勾配降下法を用いてエンドツーエンドで学習した。

実験結果

リサーチクエスチョン

  • RQ1高次元出力を有する構造予測タスクに、正確な条件付き尤度計算を可能にするフローに基づくモデルを効果的に適応できるか?
  • RQ2正規化フローを用いた正確な尤度による学習が、補助的目的関数や変分推論に基づく手法を上回るか、同等の性能を発揮するか?
  • RQ3c-Glowは反復的推論手順を必要とせず、多様で高品質な条件付きサンプルを効率的に生成できるか?
  • RQ4c-Glowは、離散的と連続的出力の異なるタイプを持つ多様な構造予測タスクで、どのように性能を発揮するか?

主な発見

  • 深度リファインメントタスクにおいて、c-GlowはPSNR 36.53を達成し、ProximalNet(36.31)をわずかに上回り、フィルタベースのベースラインを顕著に上回った。
  • 画像インpaintingにおいて、c-GlowはPSNR 24.88を達成し、DCGANインpainting(23.65)とDCGANにポissonブレンドを適用した手法(22.73)を上回った。
  • バイナリおよびマルチクラスセグメンテーションにおいて、c-GlowはDVN や NLStruct といった最先端の深層構造予測モデルと同等またはそれ以上の性能を示した。
  • c-Glowは、単一のアーキテクチャを用いて、最小限のハイパーパramータチューニングで、セグメンテーション、ノイズ除去、インpaintingの5つの異なるタスクに強く一般化した。
  • BM3D や DnCNN よりもわずかにPSNRが低かったが、特にインpaintingにおける顔の特徴の保存において、より構造的に正確な結果を生成した。
  • 学習済み分布から直接多様で高品質なサンプルを生成できる能力は、CRF やエネルギーベースモデルにおける反復的推論手法と比較して顕著な利点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。