[論文レビュー] CASTOR status and evolution
CASTOR、CERNのHEPワークロード向け階層型ストレージマネージャー(HSM)は、1999年から発展し、ピタバイト規模のデータを扱い、最大300 MB/sの高スループット転送を実現し、LHCデータチャレンジの実現を可能にした。主な進歩には、2GB以上のファイル対応と、GridFTPおよびSRMを介したGrid統合が含まれ、現在はコスト効率の良いストレージメディアへの移行と、データ分析ワークロードのパフォーマンス最適化が進行中である。
In January 1999, CERN began to develop CASTOR ("CERN Advanced STORage manager"). This Hierarchical Storage Manager targetted at HEP applications has been in full production at CERN since May 2001. It now contains more than two Petabyte of data in roughly 9 million files. In 2002, 350 Terabytes of data were stored for COMPASS at 45 MB/s and a Data Challenge was run for ALICE in preparation for the LHC startup in 2007 and sustained a data transfer to tape of 300 MB/s for one week (180 TB). The major functionality improvements were the support for files larger than 2 GB (in collaboration with IN2P3) and the development of Grid interfaces to CASTOR: GridFTP and SRM ("Storage Resource Manager"). An ongoing effort is taking place to copy the existing data from obsolete media like 9940 A to better cost effective offerings. CASTOR has also been deployed at several HEP sites with little effort. In 2003, we plan to continue working on Grid interfaces and to improve performance not only for Central Data Recording but also for Data Analysis applications where thousands of processes possibly access the same hot data. This could imply the selection of another filesystem or the use of replication (hardware or software).
研究の動機と目的
- CERNにおける増加するHEPデータ量を管理するためのスケーラブルで信頼性の高いストレージインfra構築の必要性に対応する。
- ALICE や COMPASS などの大規模実験における、高スループットのデータインジェストおよびリトリーブを支援する。
- 分散データ管理のための新興Gridコンピューティングインfraとのシームレスな統合を可能にする。
- 旧式メディア(例:9940 A)からよりコスト効率の良いソリューションへのデータ移行により、ストレージ効率を向上させる。
- ホットデータセットへの並列アクセスを伴うデータ分析ワークロードのパフォーマンス最適化を実現する。
提案手法
- ディスクとテープ間での自動データ移行を実行する階層型ストレージマネージャー(HSM)としてCASTORを導入した。
- IN2P3との協働により、2GBを超えるファイルを扱えるファイルシステムの拡張を実施した。
- Interoperabilityを実現するため、GridFTPおよびSRM(ストレージリソースマネージャー)プロトコルを用いたGridインターフェースを統合した。
- 負荷下でのパフォーマンスを検証するため、継続的なデータ転送ベンチマーク(例:1週間で300 MB/s)を実施した。
- 旧式の9940 Aテープから新しいコスト効率の良いストレージメディアへのデータ移行パイプラインを実装した。
- 最小限の設定オーバーヘッドで、複数のHEPサイトにおけるCASTORの展開を可能にした。
実験結果
リサーチクエスチョン
- RQ1階層型ストレージシステムは、どのように高エネルギー物理学実験のピタバイト規模データを効率的に管理できるか?
- RQ2大規模HEPデータワークロード向けに、テープへの継続的データ転送で達成可能なパフォーマンスレベルは何か?
- RQ3CASTORは、現代のHEPアプリケーションにとって重要な要件である2GBを超えるファイルをどのように拡張できるか?
- RQ4SRMやGridFTPなどの標準プロトコルを用いて、CASTORはどの程度Gridコンピューティングインfraに統合できるか?
- RQ5データ可用性を損なわず、過時メディアからのコスト効率の良いデータ移行を実現するための戦略は何か?
主な発見
- ALICEデータチャレンジ中に、1週間の間、300 MB/sの継続的データ転送レートを達成し、LHC規模のワークロードに対応可能であることを実証した。
- 2003年時点で、約900万ファイルにわたり、2ピタバイトを超えるデータをストレージしたことで、スケーラビリティが確認された。
- 180 TBのデータ転送が1週間、300 MB/sの速度で継続的に実行され、高スループット能力が検証された。
- IN2P3との協働により、2GBを超えるファイルの対応が成功裏に実装され、主要な技術的障壁が解消された。
- Gridインターフェース(GridFTPおよびSRM)により、分散コンピューティング環境とのシームレスな統合が実現され、相互運用性が向上した。
- 9940 Aテープから新しいストレージメディアへの継続的移行により、コスト効率が向上した一方で、データの完全性と可用性を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。