[论文解读] A Secure Data Enclave and Analytics Platform for Social Scientists
Cloud Kotta 是一个基于云的开源平台,利用 AWS 自动化存储和计算资源的配置,为社会科学家提供安全、可扩展且成本效益高的数据安全区。它能够快速、安全地分析敏感数据集——使用 10×32 核实例在一天内处理 5TB 数据,将原本需要一个月的本地工作负载缩短至 20 小时。
Data-driven research is increasingly ubiquitous and data itself is a defining asset for researchers, particularly in the computational social sciences and humanities. Entire careers and research communities are built around valuable, proprietary or sensitive datasets. However, many existing computation resources fail to support secure and cost-effective storage of data while also enabling secure and flexible analysis of the data. To address these needs we present CLOUD KOTTA, a cloud-based architecture for the secure management and analysis of social science data. CLOUD KOTTA leverages reliable, secure, and scalable cloud resources to deliver capabilities to users, and removes the need for users to manage complicated infrastructure. CLOUD KOTTA implements automated, cost-aware models for efficiently provisioning tiered storage and automatically scaled compute resources. CLOUD KOTTA has been used in production for several months and currently manages approximately 10TB of data and has been used to process more than 5TB of data with over 75,000 CPU hours. It has been used for a broad variety of text analysis workflows, matrix factorization, and various machine learning algorithms, and more broadly, it supports fast, secure and cost-effective research.
研究动机与目标
- 解决社会科学研究中敏感或专有数据集存储与分析缺乏安全、可扩展且成本效益高的基础设施的问题。
- 使研究人员能够在不管理复杂本地或云基础设施的情况下执行大规模数据分析。
- 同时支持研究社区范围内的数据共享以及高性能、弹性计算,以应对计算密集型工作负载。
- 通过统一、自动化的系统确保数据安全、可追溯性以及符合数据使用协议。
- 通过自动分层资源配置和基于工作负载感知的资源分配,优化存储与计算成本。
提出的方法
- 利用亚马逊网络服务(AWS)作为底层基础设施,实现可靠、安全且可扩展的存储与计算。
- 通过 Web 界面、REST API 和命令行界面(CLI)提供多通道用户访问。
- 采用事件驱动的管理与监控软件,确保作业执行的可靠性与系统可观测性。
- 自动化分层存储资源配置,并根据工作负载需求动态扩展计算资源。
- 在所有组件中集成可自定义、可扩展的安全架构,以强制实施身份验证、授权和数据隔离。
- 使用可复现的 CloudFormation 配置进行部署,确保一致、可自定义且开源的部署方式。
实验结果
研究问题
- RQ1如何设计一个安全、可扩展且成本效益高的数据安全区,以支持敏感的社会科学数据集?
- RQ2自动化存储与计算资源配置在多大程度上能够缩短数据密集型研究工作流的时间与成本?
- RQ3统一的云平台是否能够在不损害安全性的前提下,同时实现研究社区间的数据共享与高性能分析?
- RQ4与传统的本地部署或手动管理的云解决方案相比,该平台的自动化在可用性与性能方面有何提升?
- RQ5该平台对数据密集型研究的生命周期产生了何种影响,特别是在敏捷性、可复现性与资源效率方面?
主要发现
- Cloud Kotta 已在生产环境中部署超过六个月,目前管理约 10TB 数据,已处理超过 5TB 数据。
- 该平台已支持超过 75,000 CPU 小时的计算,证明其具备处理大规模工作负载的能力。
- 使用 10×32 核实例和 75GB 内存,在 20 小时内完成 10,000 份资助申请书与学术文本的 OCR 处理——相当于本地处理超过一个月的工作量。
- 系统成功在一天内完成 10,000 份文档的 OCR 工作流,展示了其加速计算密集型任务的能力。
- Cloud Kotta 支持广泛的分析工作负载,包括文本分析、矩阵分解、机器学习、图像识别和网络分析。
- 该平台已被数十名研究人员、学生和教师采用,托管包括 IEEE、Web of Science、ACM 在内的私有数据集,以及美国专利、维基百科等公共数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。