Skip to main content
QUICK REVIEW

[論文レビュー] Augment and Reduce: Stochastic Inference for Large Categorical Distributions

Francisco J. R. Ruiz, Michalis K. Titsias|arXiv (Cornell University)|Feb 12, 2018
Bayesian Methods and Mixture Models参考文献 41被引用数 5
ひとこと要約

本稿では、大規模なカテゴリカル分布に対する一般化された確率的変分ベイズ推論手法であるAugment and Reduce (a&r) を提案する。この手法は潜在変数を導入し、周辺尤度の下界を最適化することで、計算コストを低減する。OVSや正確なソフトマックスと比較して、よりタイトな下界と優れた予測性能を達成しており、最大13,000クラスを含む大規模分類タスクにおいて顕著な効果を示す。

ABSTRACT

Categorical distributions are ubiquitous in machine learning, e.g., in classification, language models, and recommendation systems. However, when the number of possible outcomes is very large, using categorical distributions becomes computationally expensive, as the complexity scales linearly with the number of outcomes. To address this problem, we propose augment and reduce (A&R), a method to alleviate the computational complexity. A&R uses two ideas: latent variable augmentation and stochastic variational inference. It maximizes a lower bound on the marginal likelihood of the data. Unlike existing methods which are specific to softmax, A&R is more general and is amenable to other categorical models, such as multinomial probit. On several large-scale classification problems, we show that A&R provides a tighter bound on the marginal likelihood and has better predictive performance than existing approaches.

研究の動機と目的

  • カテゴリカル分布の適合に伴う計算コストの高さ(クラス数Kに線形に増加)に対処すること。
  • ソフトマックスに限らない、多項プロビットやロジスティック回帰モデルなどに一般化可能な手法の開発。
  • 変分推論を可能にする周辺尤度のタイトな下界の提供。これにより、確率的変分EMや他の最適化フレームワークへの統合が可能。
  • 大規模分類タスクにおける予測性能の向上を図りつつ、計算コストを低く抑えること。
  • 画像分類の多数クラスや推薦システムの膨大なアイテム集合を含む、非常に大きな出力空間を持つモデルのスケーラブルな学習を可能にすること。

提案手法

  • カテゴリカル分布を p(y|ψ) = ∫ p(y,ε|ψ) dε として再パrameter化するため、潜在変数 ε を導入し、変分推論を可能にする。
  • 周辺尤度の下界を最大化するための確率的変分ベイズ推論を用い、分割関数の直接計算を回避する。
  • 局所最適化とグローバル最適化の2段階推論手順を採用:局所ステップでは ε に関する変分近似を最適化し、グローバルステップでは ψ を更新する。
  • 局所ステップで指数関数の再利用を活用することで、計算効率を維持し、OVE(one-vs-all estimation)と同等の計算コストを維持する。
  • ソフトマックスおよび多項プロビットモデルの両方に対して、下界(ELBO)を定式化。後者では積分を近似するために重要度サンプリングを用いる。
  • 大規模データセットにおけるスケーラブルな学習を可能にするために、確率的変分ベイズEMフレームワークに本手法を統合する。

実験結果

リサーチクエスチョン

  • RQ1ソフトマックスモデルを超えて、大規模なカテゴリカル分布の推論をスケーラブルに扱える一般化された手法を開発することは可能か?
  • RQ2提案手法a&rは、OVSなどの既存手法と比較して、周辺尤度の下界をよりタイトにできるか?
  • RQ3大規模分類タスクにおいて、a&rは正確なソフトマックスやOVSと比較して、尤度と正答率の両面で優れた予測性能を示せるか?
  • RQ4多項プロビットおよび多項ロジスティックモデルにおいて、a&rは最大13,000クラスのデータセット上で、どのような性能を示すか?
  • RQ5a&rは、OVEや正確なソフトマックスと比較して、特に1エポックあたりの実行時間(wall-clock time)において、どの程度の計算効率を示すか?

主な発見

  • ソフトマックスa&rは、Bibtexを除く全データセットでOVSよりもタイトな尤度下界(ELBO)を達成した。Bibtexでは正確なソフトマックスとほぼ同等のタイトさを示した。
  • MNISTおよびBibtexの両データセットにおいて、a&rのELBOは、最尤推定による正確な周辺尤度とほとんど区別がつかないほどに近い値を達成した。
  • EURLex-4Kを除く全データセットで、a&rはテスト尤度と正答率の両面でOVSを上回った。EURLex-4KではOVSがわずかに優れていた。
  • 多項プロビットおよびロジスティックモデルにおいて、OmniglotおよびBibtexではa&rがOVSを上回る予測性能を示した。特に、多項プロビットa&rはEURLex-4KおよびAmazonCat-13Kで全手法を上回った。
  • ソフトマックスモデルではa&rの1エポックあたりの実行時間はOVEとほぼ同等であり、多項モデルでもわずかに長いにとどまり、高い計算効率を示した。
  • AmazonCat-13Kのような13,000クラスに達するような大規模な語彙を持つタスクにおいても、a&rは高い予測精度を維持しており、現実の大規模語彙タスクへのスケーラビリティを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。