[論文レビュー] The Potential of the Intel Xeon Phi for Supervised Deep Learning
本稿では、Intel Xeon Phi コプロセッサ上でスレッドレベル並列処理とSIMD並列処理の両方を活用する並列化フレームワークCHAOSを提案する。Xeon Phi 7120Pで244スレッドを活用することで、単一スレッドCPU学習と比較して103.5倍の高速化を達成し、MNISTデータセットにおける大規模なCNNの学習時間を31時間から3時間に短縮した。また、スケーラビリティ分析のための妥当性が確認された性能モデルの構築にも成功した。
Supervised learning of Convolutional Neural Networks (CNNs), also known as supervised Deep Learning, is a computationally demanding process. To find the most suitable parameters of a network for a given application, numerous training sessions are required. Therefore, reducing the training time per session is essential to fully utilize CNNs in practice. While numerous research groups have addressed the training of CNNs using GPUs, so far not much attention has been paid to the Intel Xeon Phi coprocessor. In this paper we investigate empirically and theoretically the potential of the Intel Xeon Phi for supervised learning of CNNs. We design and implement a parallelization scheme named CHAOS that exploits both the thread- and SIMD-parallelism of the coprocessor. Our approach is evaluated on the Intel Xeon Phi 7120P using the MNIST dataset of handwritten digits for various thread counts and CNN architectures. Results show a 103.5x speed up when training our large network for 15 epochs using 244 threads, compared to one thread on the coprocessor. Moreover, we develop a performance model and use it to assess our implementation and answer what-if questions.
研究の動機と目的
- Intel Xeon Phi コプロセッサが、CNNを用いた教師ありディープラーニングの高速化にどの程度の可能性を秘めているかを調査すること。
- Xeon Phi上でのスレッドレベル並列処理とSIMD並列処理の両方を効果的に活用する並列化スキームの設計および実装を行うこと。
- MNISTデータセットを用いて、さまざまなCNNアーキテクチャとスレッド数を用いて、提案手法の性能を評価すること。
- 実装の効率性を評価できる性能モデルを構築・妥当性を検証し、現在のハードウェア仕様を超えた「仮説的」スケーラビリティ分析を支援すること。
提案手法
- CHAOSフレームワークは、スレッドレベル並列処理を用いて入力サンプルを複数のスレッドに分散させ、学習データの並列処理を可能にする。
- 畳み込み層内でSIMD並列処理を適用し、偏微分および重み勾配の計算を高速化する。
- 本アプローチは、多数のコアとベクトルユニットを備えたIntel Xeon Phi 7120Pコプロセッサ上で実装されている。
- 実測値と理論的分析に基づいて、実行時間とスケーラビリティを予測する性能モデルを構築している。
- さまざまなスレッド数とネットワークアーキテクチャを用いたMNISTデータセットでの学習実験結果を用いて、モデルの妥当性を検証している。
- 10,000枚の訓練画像と10,000枚のテスト画像を用いて、小規模および大規模なCNNアーキテクチャの両方でフレームワークを評価している。
実験結果
リサーチクエスチョン
- RQ1単一スレッドCPUと比較して、Intel Xeon Phi コプロセッサは、CNNの教師あり学習において顕著な高速化を達成できるか?
- RQ2Xeon Phiアーキテクチャ上でのCNN学習において、スレッドレベル並列処理とSIMD並列処理はどの程度効果的に活用できるか?
- RQ3特に現在のハードウェアスレッド数を超えてスレッド数を増加させた場合、CHAOSフレームワークのスケーラビリティはどの程度か?
- RQ4提案された性能モデルは、実行時間の予測および将来のXeon Phi世代における最適化の支援にどの程度有効に機能するか?
主な発見
- CHAOSフレームワークは、Xeon Phi 7120Pで244スレッドを用いて大規模なCNNを15エポック学習させた結果、CPUの単一スレッド学習と比較して103.5倍の高速化を達成した。
- Intel Xeon E5上で31時間かかっていた学習時間が、Xeon Phi 7120Pではわずか3時間に短縮され、顕著な性能向上が確認された。
- 性能モデルは実行時間を正確に予測でき、スケーラビリティの分析に成功した。その結果、固定スレッド数の下で画像数やエポック数を2倍にすると、実行時間も概ね2倍になることが示された。
- 固定エポック数および画像数の下でスレッド数を2倍にした場合、実行時間は半分にはならず、データ依存性とメモリボトルネックの影響により、収益逓減の傾向が確認された。
- モデルは、将来のXeon Phi世代でより多くのハードウェアスレッドを備えることで、さらなる高速化が可能になると予測した。これは、今後の最適化の余地があることを示唆している。
- 本研究は、Intel Xeon Phi上で教師ありCNN学習を調査した最初の研究であり、ディープラーニング分野におけるこのプラットフォームの研究ギャップを埋めた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。