Skip to main content
QUICK REVIEW

[論文レビュー] Model-Parallel Inference for Big Topic Models

Xun Zheng, Jin K. Kim|arXiv (Cornell University)|Nov 10, 2014
Topic Modeling参考文献 23被引用数 6
ひとこと要約

この論文は、LDAなどの大規模トピックモデルのためのモデル並列推論フレームワークを提案している。モデルを互いに排他的なブロックに分割し、並列に更新することで、超高次元モデルを扱う際のデータ並列性の限界を克服する。このアプローチにより、リソースが限られたクラスタ上でも効率的な学習が可能となり、2000億パラメータを超えるモデルでの収束を達成し、Yahoo!LDAのようなデータ並列ベースラインと比較して収束が速く、スケーラビリティに優れている。

ABSTRACT

In real world industrial applications of topic modeling, the ability to capture gigantic conceptual space by learning an ultra-high dimensional topical representation, i.e., the so-called "big model", is becoming the next desideratum after enthusiasms on "big data", especially for fine-grained downstream tasks such as online advertising, where good performances are usually achieved by regression-based predictors built on millions if not billions of input features. The conventional data-parallel approach for training gigantic topic models turns out to be rather inefficient in utilizing the power of parallelism, due to the heavy dependency on a centralized image of "model". Big model size also poses another challenge on the storage, where available model size is bounded by the smallest RAM of nodes. To address these issues, we explore another type of parallelism, namely model-parallelism, which enables training of disjoint blocks of a big topic model in parallel. By integrating data-parallelism with model-parallelism, we show that dependencies between distributed elements can be handled seamlessly, achieving not only faster convergence but also an ability to tackle significantly bigger model size. We describe an architecture for model-parallel inference of LDA, and present a variant of collapsed Gibbs sampling algorithm tailored for it. Experimental results demonstrate the ability of this system to handle topic modeling with unprecedented amount of 200 billion model variables only on a low-end cluster with very limited computational resources and bandwidth.

研究の動機と目的

  • 中央集権的なモデル依存関係と高いメモリオーバーヘッドにより、大規模トピックモデルの学習におけるデータ並列性の非効率性を解消すること。
  • ノードごとの利用可能メモリを超えるモデルサイズにおいて、データ並列システムのスケーラビリティの限界を克服すること。
  • 低性能クラスタ上でも、超高次元表現(例:10^5トピック、10^7語彙)を持つトピックモデルの学習を可能にすること。
  • 同期のオーバーヘッドと通信コストを低減することで、収束速度とシステムスケーラビリティを向上させること。
  • アルゴリズムの大幅な見直しを伴わずに、大規模および中規模モデルの両方を効果的に処理できるモデル並列性の有効性を示すこと。

提案手法

  • 単語-トピック行列をブロックに分割し、各ブロックを異なるワーカーに割り当て、独立した更新を可能にする。
  • モデル並列性とデータ並列性を統合し、分散ワーカーがローカルデータに関連するみたてモデルブロックのみにアクセスできるようにする。
  • モデル並列実行に適応したcollapsed Gibbsサンプリングの変種を採用し、正しさを保つためにオンデマンド同期を実施する。
  • 動的モデル分割を用いて、ノードあたりのメモリ使用量を最小化し、負荷をバランスさせる。1/Mのメモリトレンドに従う。
  • ネットワークトラフィックを削減するため、オンデマンド通信戦略を採用し、データ並列手法のO(M²)の同期コストを回避する。
  • モデルブロックをマシン間でシャーディングし、ローカルデータサブセットに存在するキーワードのみを格納することで、メモリフットプリントを削減する。

実験結果

リサーチクエスチョン

  • RQ1モデル並列性は、個々のノードのメモリ容量を超えるスケーリングを実現できるか?
  • RQ2モデル並列推論は、Yahoo!LDAのようなデータ並列ベースラインと比較して収束が速いか?
  • RQ3低性能クラスタ上でも、2000億パラメータを超えるモデルをモデル並列性で処理できるか?
  • RQ4非同期的かつブロック単位の更新において、システムは正しさと一貫性をどのように維持するか?
  • RQ5動的モデル分割は、メモリ効率とシステムスケーラビリティをどの程度向上させるか?

主な発見

  • モデル並列システムは、64台の低性能マシンを用いて、個々のノードのメモリ容量を超える2000億パラメータを超えるトピックモデルの推論を成功させた。
  • 5000トピックのユニグラムモデルでは、収束時間がYahoo!LDAの11.8時間から2.3時間に短縮され、収束速度の向上が明確に示された。
  • マシン数が増加するにつれて、マシンあたりのメモリ使用量は約1/Mの傾向に従い、ほぼ理想のスケーラビリティを示した。
  • 収束時間のスピードアップは、理想のトレンドに近く、Yahoo!LDAはネットワーク混雑のためマシン数増加に伴い性能が低下した。
  • オンデマンド同期により正しさを維持し、データ並列手法のO(M²)通信オーバーヘッドを回避した。
  • モデル並列推論は計算リソースの利用効率を高め、時間的・メモリ的効率の両面でデータ並列ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。