[論文レビュー] A Distributed Algorithm for Training Nonlinear Kernel Machines
本稿では、基底カーネル行列の疑似逆行列の計算を回避する再定式化されたノイストローム近似を用いた、非線形カーネルマシンを分散して学習するアルゴリズムを提案する。Hadoop上でのAllReduceベースの通信を活用した勾配ベース最適化により、効率的でスケーラブルな学習が実現され、MNIST8mでP-packsvmを上回る性能を示した(8779秒 vs. 12880秒、200ノードで高い精度)。
This paper concerns the distributed training of nonlinear kernel machines on Map-Reduce. We show that a re-formulation of Nyström approximation based solution which is solved using gradient based techniques is well suited for this, especially when it is necessary to work with a large number of basis points. The main advantages of this approach are: avoidance of computing the pseudo-inverse of the kernel sub-matrix corresponding to the basis points; simplicity and efficiency of the distributed part of the computations; and, friendliness to stage-wise addition of basis points. We implement the method using an AllReduce tree on Hadoop and demonstrate its value on a few large benchmark datasets.
研究の動機と目的
- Map-Reduceを用いたコンmodityクラスタ上で、非線形カーネルマシンのスケーラブルで効率的な分散学習を可能にすること。
- 大規模カーネル手法における正確なカーネル行列計算の高い計算コストとストレージコストを解決すること。
- 高価な疑似逆行列計算を回避し、基底点の段階的追加をサポートする手法を開発すること。
- HadoopのAllReduceと互換性がある通信効率の良い反復的最適化フレームワークを設計すること。
- P-packsvmのような既存の並列ソルバーと比較して、ベンチマークデータセットで優れた性能を示すこと。
提案手法
- 基底カーネル行列の疑似逆行列の計算を回避するように、カーネルマシンのためのノイストローム近似を再定式化する。
- 関数、勾配、ヘッセ行列を分散行列-ベクトル積により計算する勾配ベース最適化(例:L-BFGS)を用いてモデルを学習する。
- 反復処理間の通信オーバーヘッドを最小限に抑えるために、Hadoop上でのAllReduceツリーを実装する。
- 基底点の数が少ない場合には分散K-meansクラスタリングを用い、そうでない場合にはランダムサンプリングを行う。
- 段階的基底点追加を可能にするように最適化を構造化し、再訓練なしにモデルを段階的に改善できるようにする。
- 最適化を統計クエリモデルにマッピングすることで、反復的Map-Reduceフレームワークと互換性を保つ。
実験結果
リサーチクエスチョン
- RQ1再定式化されたノイストローム近似は、分散環境下で非線形カーネルマシンの効率的でスケーラブルな学習を可能にするか?
- RQ2基底点を用いたカーネルマシン学習において、疑似逆行列演算の計算コストをどのように回避できるか?
- RQ3AllReduce通信を用いた勾配ベース最適化は、大規模データセットにおいて既存の反復的ソルバーを上回る性能を発揮できるか?
- RQ4本手法の性能は、大規模データセットにおいてP-packsvmと比較して、学習時間とテスト精度の点でどのように異なるか?
- RQ5再訓練を再開することなく、基底点を段階的に適応的に追加できる範囲はどの程度か?
主な発見
- 200ノードを用いてMNIST8mデータセット(800万例)で学習した結果、テスト精度が0.9963に達し、P-packsvmを精度と速度の両面で上回った。
- Hadoop上でのAllReduceを用いた学習時間は8779秒にまで短縮されたが、MPIクラスタ上で512ノードを用いたP-packsvmは12880秒を要した。
- 他の低ランクカーネル近似手法で必要な計算コストの高いSVD演算を回避しているため、大規模問題においてよりスケーラブルである。
- AllReduceベースの実装により、行列-ベクトル積のみで通信を効率化し、反復的最適化における遅延を最小限に抑えることができる。
- 基底点の段階的追加をサポートしており、完全な再訓練なしに効率的なモデル適合が可能である。
- 総学習時間においてほぼ線形のスループット向上を示しており、適切な負荷分散と低通信ボトルネックを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。