Skip to main content
QUICK REVIEW

[論文レビュー] Extreme Stochastic Variational Inference: Distributed and Asynchronous

Jiong Zhang, Parameswaran Raman|arXiv (Cornell University)|May 31, 2016
Gaussian Processes and Bayesian Inference参考文献 20被引用数 3
ひとこと要約

本稿では、同時にデータ並列性とモデル並列性を達成することで、大規模な混合モデルにおけるスケーラブルな変分推論を可能にする分散型、非同期的、ロックフリーなアルゴリズムである極端な確率的変分インファレンス(ESVI)を提案する。ESVIは、UMBC-3B(30億トークン、300万語彙)のような大規模データセットにおいて、壁時計時間と解の品質の両面でVIおよびSVIを上回る性能を発揮する。また、高トピック数モデルにおける計算速度の向上とメモリ使用量の削減を図るためのTOPK変種を導入している。

ABSTRACT

Stochastic variational inference (SVI), the state-of-the-art algorithm for scaling variational inference to large-datasets, is inherently serial. Moreover, it requires the parameters to fit in the memory of a single processor; this is problematic when the number of parameters is in billions. In this paper, we propose extreme stochastic variational inference (ESVI), an asynchronous and lock-free algorithm to perform variational inference for mixture models on massive real world datasets. ESVI overcomes the limitations of SVI by requiring that each processor only access a subset of the data and a subset of the parameters, thus providing data and model parallelism simultaneously. We demonstrate the effectiveness of ESVI by running Latent Dirichlet Allocation (LDA) on UMBC-3B, a dataset that has a vocabulary of 3 million and a token size of 3 billion. In our experiments, we found that ESVI not only outperforms VI and SVI in wallclock-time, but also achieves a better quality solution. In addition, we propose a strategy to speed up computation and save memory when fitting large number of topics.

研究の動機と目的

  • 単一マシンのメモリ容量を超えるパラメータ数を有する、数十億ドキュメントを含むデータセットを処理する際の、従来の変分推論(VI)および確率的変分推論(SVI)のスケーラビリティ制限を解消すること。
  • プロセッサがすべてのパラメータを同期的に更新するのではなく、ローカルおよびグローバル変数のサブセットのみを更新することで、混合モデルにおけるデータ並列性とモデル並列性を両立すること。
  • マルチコアおよび分散環境におけるコストの高い同期化オーバーヘッドを回避するため、ロックフリーで非同期的なアルゴリズムを設計し、計算効率を向上させること。
  • UMBC-3B、PubMed、NY Timesといった実世界の大規模データセットにおいて、従来の手法がメモリ制限およびスケーラビリティ制限により失敗する状況でも、ESVIの有効性を実証すること。

提案手法

  • ESVIは、各プロセッサがデータのサブセットとパラメータのサブセットのみにアクセスする独自の更新戦略を導入し、同時にデータ並列性とモデル並列性を実現する。
  • グローバル同期化を不要とするために、所有者-計算(owner-computes)パラダイムを採用し、通信オーバーヘッドを低減する。
  • グローバルパラメータがワーカー間を「ノマド的に移動」することを許容することで、部分的更新であってもパラメータの混合と収束を保証する。
  • 各ワーカーがトピックごとに上位k個のトピックのみを格納するTOPK戦略を採用し、大規模トピック数モデルにおけるメモリ使用量の大幅な削減と計算速度の向上を実現する。
  • ガウス混合モデル(GMM)および代表的ディリクレ配分(LDA)に適用し、UMBC-3Bを含む実世界のデータセットを用いた実験的評価を実施する。
  • 局所的変分更新の分離構造を活用し、データおよびパラメータのサブセットに対して確率的最適化を実行可能にする。

実験結果

リサーチクエスチョン

  • RQ1数十億トークンと数百万語彙を有するデータセットにおいて、パラメータ数が単一マシンのメモリ容量を超える状況でも、変分推論をスケーラブルに実行できるか?
  • RQ2同期化ボトルneckを引き起こさずに、確率的変分推論においてデータ並列性とモデル並列性を効率的に統合できるか?
  • RQ3非同期的・ロックフリーなアルゴリズムは、分散システムにおける高いスループットを達成しつつ、収束性と解の品質を維持できるか?
  • RQ4大規模LDAモデルにおいて、トピックおよびパラメータのサブセットのみを更新することで、どの程度の性能向上が達成できるか?
  • RQ5TOPK戦略は、高トピック数LDA推論において、メモリ効率と計算速度をどのように向上させるか?

主な発見

  • UMBC-3B(30億トークン、300万語彙)データセットにおいて、ESVI-LDAは分散VIを上回るELBOを達成し、著しく高速であった。これは、産業スケールのデータにまでスケーラブルであることを示している。
  • PubMedおよびUMBC-3Bにおけるマルチマシン・マルチコア環境の実験では、ESVI-LDAは収束速度および最終的なELBOの両面で分散VIを上回った。特にESVI-LDA-TOPKが最良のパフォーマンスを示した。
  • EnronおよびNY Timesデータセットでは、ESVI-LDAはVIと同等のテストパープレキシティを達成したが、特にコア数が増加するにつれて著しく短い壁時計時間で実行された。
  • TOPK変種は、特に大規模トピック数モデルにおいて、メモリ使用量の削減と計算速度の向上を実現し、すべてのマルチコアおよびマルチマシン設定で最も速い収束を達成した。
  • 単一マシン環境でも、ESVI-GMMは中程度のデータサイズであっても、VIおよびSVIを上回るELBOの向上を時間経過とともに達成した。
  • ESVIの非同期的・ロックフリー設計により、32ノードおよび512コアの環境でも高いスループットとスケーラビリティを達成し、極大規模推論における実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。