[論文レビュー] Building a Shared Resource HPC Center Across University Schools and Institutes: A Case Study
本論文は、ジョージ・ワシントン大学における共有型ハイパフォーマンスコンピューティングセンター(HPCC)の構築事例を提示する。分散型のHPCリソースを統合し、中央集権的で専門的な管理が行われるクラスタに統合することで、多様な研究分野におけるコスト効率の向上、リソース利用効率の改善、ユーザー支援の強化を達成した。その結果、430人を超える研究者を支援するスケーラブルで持続可能なHPCインfra構造が実現された。
Over the past several years, The George Washington University has recruited a significant number of researchers in a wide variety of domains requiring the availability of advanced computational resources. We discuss the challenges and obstacles encountered planning and establishing a first-time high performance computing center at the university level and present a set of solutions that will be useful for any university developing a fledgling high performance computing center. We focus on justification and cost model, strategies for determining anticipated use cases, planning appropriate resources, staffing, user engagement, and metrics for gauging success.
研究の動機と目的
- 研究大学における多様な学術分野における高度な計算リソースの増大するニーズに対応すること。
- 教員所有の分散型HPCクラスタに起因する非効率性と運用負担を軽減すること。
- 持続可能な資金調達、人員配置、ガバナンスモデルを備えた中央集権的で共有型のHPCセンターを確立すること。
- 採用と影響を確保するためのユーザー参加戦略、トレーニング、パフォーマンス追跡の開発。
- 他の大学が共有HPC施設を構築または拡張するのを支援する再利用可能なフレームワークの構築。
提案手法
- Dellおよび特殊ハードウェアを組み合わせた、CPU、GPU、高メモリ構成を含む213ノードの中央集権的HPCクラスタ(コロニアルワン)を構築。
- 財務的投資に基づくオプションの優先割り当てを備えたフェアシェアスケジューリングモデルを導入し、複雑なコンドミニアム所有モデルを回避。
- 3段階のストレージアーキテクチャを導入:プライマリNFS、高速Lustreスクラッチ、Dell Compellentを用いた長期アーカイブストレージ。
- 外部のトレーニングおよびアクセスを提供するXSEDEと連携し、ワークショップや動画チュートリアルを含む内部トレーニングプログラムを開始。
- 分野特化の研究ニーズに精通したHPCスペシャリストを訓練・配置し、オンボーディングおよびアプリケーションデプロイメントを支援。
- 運用評価および的確な支援を可能にするために、ジョブ履歴、トレーニング、利用パターン、助成金成果を追跡するデータウェアハウスを構築。
実験結果
リサーチクエスチョン
- RQ1大学は、分散型のHPCリソースを、効果的に共有型で中央管理される施設に統合できるか?
- RQ2多様な学術部門にまたがる参加を促進しつつ、公平性を保ちながら、コスト共有および投資モデルをどのように設計できるか?
- RQ3多様で多様な分野のユーザー基盤を支えるために、ユーザー参加とトレーニングを体系的にスケーリングするにはどうすればよいか?
- RQ4共有型HPCセンターの成功と影響を測るのに最も効果的な指標は何か?
- RQ5大学全体のHPCインfra構造の長期的持続可能性とパフォーマンスを確保するための運用および人員配置モデルは何か?
主な発見
- GWUの共有型HPCCは、複数の学部にまたがるHPCリソースを効果的に統合し、110以上の研究グループに所属する430人を超える研究者を支援した。
- オプションの優先投資を備えたフェアシェアモデルにより、公平なアクセスが実現するとともに、高影響力のグループが計算能力を拡張できるようになった。
- 1日あたり2,000件を超えるジョブを処理し、継続的に稼働しており、高い信頼性と利用効率を示した。
- トレーニングセッションやXSEDEとの提携を通じたユーザー参加イニシアチブが、オンボーディングおよびアプリケーション支援の質を著しく向上させた。
- データウェアハウスにより、利用状況、トレーニング効果、研究のインパクト(自ら報告された助成金や論文を含む)に関する的確なレポートが可能になった。
- TerascalaからIntel Enterprise Edition Lustreへの移行により、ストレージのパフォーマンスとスケーラビリティが向上し、長期的な成長を支えることができた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。