[論文レビュー] A Secure Data Enclave and Analytics Platform for Social Scientists
Cloud Kotta は、AWS を活用してストレージおよびコンピューティングリソースのプロビジョニングを自動化することで、社会科学者向けに安全でスケーラブルかつコスト効率の良いデータエナclaveを提供するクラウドベースのオープンソースプラットフォームです。5TB のデータを 1 日未塔で処理でき、10×32コアのインスタンスを用いて、通常は1か月かかるローカルワークロードを20時間で短縮できます。
Data-driven research is increasingly ubiquitous and data itself is a defining asset for researchers, particularly in the computational social sciences and humanities. Entire careers and research communities are built around valuable, proprietary or sensitive datasets. However, many existing computation resources fail to support secure and cost-effective storage of data while also enabling secure and flexible analysis of the data. To address these needs we present CLOUD KOTTA, a cloud-based architecture for the secure management and analysis of social science data. CLOUD KOTTA leverages reliable, secure, and scalable cloud resources to deliver capabilities to users, and removes the need for users to manage complicated infrastructure. CLOUD KOTTA implements automated, cost-aware models for efficiently provisioning tiered storage and automatically scaled compute resources. CLOUD KOTTA has been used in production for several months and currently manages approximately 10TB of data and has been used to process more than 5TB of data with over 75,000 CPU hours. It has been used for a broad variety of text analysis workflows, matrix factorization, and various machine learning algorithms, and more broadly, it supports fast, secure and cost-effective research.
研究の動機と目的
- 機密または特許情報の社会科学的データセットを安全に保存・分析するための、安全でスケーラブルかつコスト効率の良いインfra構築の不足を解消すること。
- 研究者が複雑なオンプレミスまたはクラウドインfraを管理せずに大規模なデータ分析を実行できるようにすること。
- コミュニティ全体でのデータ共有と、計算負荷の高いワークロードに適した高パフォーマンスでスケーラブルなコンピューティングを両立すること。
- 統合的かつ自動化されたシステムにより、データセキュリティ、プロバンス、データ利用契約の遵守を確保すること。
- ワークロードに応じたリソース割り当てと階層的プロビジョニングを用いて、ストレージおよびコンピューティングコストを最適化すること。
提案手法
- 信頼性の高い安全でスケーラブルなストレージおよびコンピューティングを実現するため、Amazon Web Services (AWS) を基盤インfraとして活用する。
- ユーザーが複数のチャネルからアクセスできるように、Web インターフェース、REST API、コマンドラインインターフェース (CLI) を提供する。
- ジョブ実行の信頼性とシステムの可観測性を確保するため、イベント駆動型の管理および監視ソフトウェアを採用する。
- ワークロードの要件に応じて、動的にコンピューティングリソースをスケーリングする、階層的ストレージプロビジョニングを自動化する。
- すべてのコンponentsにカスタマイズ可能で拡張性のあるセキュリティファブリックを統合し、認証、承認、データ隔離を強制する。
- 一貫性がありカスタマイズ可能でオープンソースなデプロイメントを実現するため、再現可能な CloudFormation 設定を採用する。
実験結果
リサーチクエスチョン
- RQ1機密性の高い社会科学的データセットをサポートするため、安全でスケーラブルかつコスト効率の良いデータエナclaveをどのようにアーキテクチャ設計できるか?
- RQ2ストレージおよびコンピューティングリソースの自動プロビジョニングが、データ集約的ワークフローの時間とコストをどの程度削減できるか?
- RQ3統合されたクラウドプラットフォームが、セキュリティを損なわず、研究コミュニティ間でのデータ共有と高パフォーマンス分析を両立できるか?
- RQ4本プラットフォームの自動化は、従来のオンプレミスまたは手動管理のクラウドソリューションと比較して、使いやすさとパフォーマンスにどの程度向上効果をもたらすか?
- RQ5本プラットフォームは、とりわけアジリティ、再現性、リソース効率の観点から、データ集約的研究のライフサイクルにどのような影響を与えるか?
主な発見
- Cloud Kotta は 6か月以上にわたり本番環境で稼働しており、現在約 10TB のデータを管理し、5TB 以上のデータ処理を実施している。
- 本プラットフォームは 75,000 以上の CPU 時間の計算をサポートしており、大規模なワークロードの処理能力を裏付けている。
- 10,000 件の助成金申請書および学術的テキストの OCR 処理を、10×32コアのインスタンスと 75GB RAM を用いて 20 時間で完了した。これは通常のローカル処理時間の 1か月以上に相当する。
- システムは 1 日で 10,000 文書の OCR ワークロードを成功裏に実行し、計算負荷の高いタスクの高速化能力を実証した。
- Cloud Kotta は、テキスト解析、行列因子分解、機械学習、画像認識、ネットワーク解析など、幅広い分析ワークロードをサポートしている。
- 本プラットフォームは何十人もの研究者、学生、教員に採用されており、IEEE や Web of Science、ACM などのプライベートデータセット、米国特許、Wikipedia などのパブリックデータセットをホスティングしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。