Skip to main content
QUICK REVIEW

[論文レビュー] Implicit MLE: Backpropagating Through Discrete Exponential Family Distributions

Mathias Niepert, Pasquale Minervini|arXiv (Cornell University)|Jun 3, 2021
Machine Learning and Algorithms被引用数 16
ひとこと要約

本稿では、損失関数と最も確率の高い状態に基づいて導かれる目的分布を用いて勾配を近似することで、勾配を離散的な指数型分布にバックプロパゲートする一般化されたフレームワーク、暗黙の最尤推定(I-MLE)を提案する。I-MLEは、ストレートスラッシュ推定器などのベースライン手法を上回り、特に摂動とMAP推定(perturb-and-MAP)サンプリングに新たな和のガンマ(Sum-of-Gamma, SoG)ノイズ分布を用いることで、リラクゼーションに基づく手法と同等の性能を発揮する。

ABSTRACT

Combining discrete probability distributions and combinatorial optimization problems with neural network components has numerous applications but poses several challenges. We propose Implicit Maximum Likelihood Estimation (I-MLE), a framework for end-to-end learning of models combining discrete exponential family distributions and differentiable neural components. I-MLE is widely applicable as it only requires the ability to compute the most probable states and does not rely on smooth relaxations. The framework encompasses several approaches such as perturbation-based implicit differentiation and recent methods to differentiate through black-box combinatorial solvers. We introduce a novel class of noise distributions for approximating marginals via perturb-and-MAP. Moreover, we show that I-MLE simplifies to maximum likelihood estimation when used in some recently studied learning settings that involve combinatorial solvers. Experiments on several datasets suggest that I-MLE is competitive with and often outperforms existing approaches which rely on problem-specific relaxations.

研究の動機と目的

  • 離散的潜在変数や組合せ最適化コンponentsを含むニューラルネットワークの学習に取り組むこと。標準的なバックプロパゲーションは、非微分可能または不連続な出力のため失敗する。
  • 問題固有のリラクゼーションを回避し、完全な確率的推論や忠実なサンプリングを必要としない一般化された学習フレームワークの開発。
  • 離散的指数型分布と微分可能なニューラルコンponentsを組み合わせたモデルのエンドツーエンド学習を可能にすること。特に、組合せソルバーまたは離散的潜在変数を含む設定において有効である。
  • 最も確率の高い状態(MAP推論)の計算能力に依存するだけで勾配計算を簡素化することで、スケーラブルかつ広範に適用可能な手法を実現すること。

提案手法

  • I-MLEは、順伝播処理中に観測された最も確率の高い状態の経験的分布を近似する目的分布 $ q $ を構築することで勾配を計算する。
  • 本フレームワークは、パrameterにノイズを追加してサンプルを生成し、摂動とMAP推定(perturb-and-MAP)戦略を用いて勾配を推定する、摂動に基づく暗黙の微分法を用いる。
  • Gumbel-maxサンプリングにおける周辺分布の近似を改善するために、新しい和のガンマ(SoG)ノイズ分布の族を導入する。
  • 2種類の目的分布を提案する:1つはMAP解に基づく(M-M)、もう1つは損失重み付き分布の平均に基づく(μ-μ)。両者とも暗黙の勾配推定器を定義するために用いられる。
  • 滑らかなリラクゼーションを回避し、確率分布の完全なアクセスを必要とせず、MAP推論と損失フィードバックにのみ依存する。
  • I-MLEは、組合せソルバーを含む特定の設定では、標準的な最尤推定に簡略化され、理論的整合性が確認される。

実験結果

リサーチクエスチョン

  • RQ1問題固有の滑らかなリラクゼーションや勾配近似に依存せずに、離散的要素を含むハイブリッドニューラルモデルを学習可能か?
  • RQ2勾配がほとんど至るところでゼロとなる離散的指数型分布に、効果的に勾配をバックプロパゲートする方法は?
  • RQ3離散的潜在変数モデルにおける摂動とMAP推定サンプリングにおいて、より良い勾配推定をもたらすノイズ分布は何か?
  • RQ4I-MLEは、Gumbel-Softmaxのようなリラクゼーションベースの手法と同等またはそれ以上の性能を発揮できるか?
  • RQ5I-MLEは、最短経路計算のようなブラックボックスの組合せソルバーを含むモデルの効果的なエンドツーエンド学習を可能にするか?

主な発見

  • I-MLEは、10サブセットおよび1サブセットタスクにおいて、ストレートスラッシュ推定器(STE)を著しく上回り、より低いテスト損失を達成する。
  • I-MLEに和のガンマ(SoG)ノイズ分布を用いることで、10サブセットVAEにおいてGumbel-Softmaxよりも低いテスト損失を達成するが、サンプルの分散は高くなる。
  • ウォーラード最短経路タスクでは、μ-μ目的分布を用いたI-MLEがK=12で97.2%の正確度を達成し、BBおよびDPO手法を上回る。
  • μ-μ設定のI-MLEはK=30で93.7%の正確度を達成し、すべてのグリッドサイズでBBおよびDPOと同等またはそれ以上の性能を示す。
  • トレーニングダイナミクスにおいて収束が速く、ベースライン手法と比較して最適化の安定性が向上していることが示唆される。
  • 組合せソルバーを含む設定では、I-MLEが明示的な最尤推定に簡略化され、理論的整合性が裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。