[논문 리뷰] A Secure Data Enclave and Analytics Platform for Social Scientists
Cloud Kotta는 AWS를 활용하여 스토리지 및 컴퓨팅 자원을 자동으로 프로비저닝함으로써 사회과학자들을 위한 보안성, 확장성, 비용 효율성이 뛰어난 클라우드 기반 오픈소스 데이터 에너클을 제공하는 플랫폼입니다. 이 플랫폼을 통해 5TB의 데이터를 하루 이내로 처리할 수 있으며, 10×32코어 인스턴스를 사용해 기존의 한 달이 넘는 로컬 작업을 20시간 내로 단축시켰습니다.
Data-driven research is increasingly ubiquitous and data itself is a defining asset for researchers, particularly in the computational social sciences and humanities. Entire careers and research communities are built around valuable, proprietary or sensitive datasets. However, many existing computation resources fail to support secure and cost-effective storage of data while also enabling secure and flexible analysis of the data. To address these needs we present CLOUD KOTTA, a cloud-based architecture for the secure management and analysis of social science data. CLOUD KOTTA leverages reliable, secure, and scalable cloud resources to deliver capabilities to users, and removes the need for users to manage complicated infrastructure. CLOUD KOTTA implements automated, cost-aware models for efficiently provisioning tiered storage and automatically scaled compute resources. CLOUD KOTTA has been used in production for several months and currently manages approximately 10TB of data and has been used to process more than 5TB of data with over 75,000 CPU hours. It has been used for a broad variety of text analysis workflows, matrix factorization, and various machine learning algorithms, and more broadly, it supports fast, secure and cost-effective research.
연구 동기 및 목표
- 민감하거나 기밀성이 높은 사회과학 데이터셋을 저장하고 분석하기 위한 보안성, 확장성, 비용 효율성이 뛰어난 인프라의 부족을 해결한다.
- 복잡한 현지 또는 클라우드 인프라 관리를 하지 않고도 연구자가 대규모 데이터 분석을 수행할 수 있도록 한다.
- 커뮤니티 전체의 데이터 공유와 계산이 집약적인 워크로드를 위한 고성능, 탄력적인 컴퓨팅을 동시에 지원한다.
- 통합된 자동화 시스템을 통해 데이터 보안, 기원 추적, 데이터 사용 계약 준수를 보장한다.
- 워크로드 인식 기반 자원 할당과 자동화된 계층적 프로비저닝을 통해 스토리지 및 컴퓨팅 비용을 최적화한다.
제안 방법
- 신뢰성 있고 보안성 및 확장성이 뛰어난 스토리지 및 컴퓨팅을 위해 Amazon Web Services (AWS)를 기반 인프라로 활용한다.
- 사용자에게 다중 채널 액세스를 제공하기 위해 웹 인터페이스, REST API, 명령줄 인터페이스(CLI)를 사용한다.
- 신뢰성 있는 작업 실행과 시스템 관찰성을 확보하기 위해 이벤트 기반의 관리 및 모니터링 소프트웨어를 적용한다.
- 워크로드 수요에 따라 동적으로 컴퓨팅 자원을 확장하고, 계층적 스토리지 프로비저닝을 자동화한다.
- 모든 구성 요소에 맞춤형으로 확장 가능한 보안 패브릭을 통합하여 인증, 권한 부여, 데이터 격리 기능을 강화한다.
- 일관성 있고 사용자 정의가 가능하며 오픈소스인 배포를 위해 재현 가능한 CloudFormation 구성 파일을 사용한다.
실험 결과
연구 질문
- RQ1민감한 사회과학 데이터셋을 지원하기 위해 보안성, 확장성, 비용 효율성이 뛰어난 데이터 에너클 아키텍처는 어떻게 설계할 수 있는가?
- RQ2스토리지 및 컴퓨팅 자원의 자동 프로비저닝이 데이터 집약적인 연구 워크플로우의 시간과 비용을 얼마나 줄일 수 있는가?
- RQ3통합된 클라우드 플랫폼이 보안을 해치지 않으면서도 연구 커뮤니티 간의 데이터 공유와 고성능 분석을 동시에 가능하게 할 수 있는가?
- RQ4플랫폼의 자동화 기능이 기존의 현지 인프라 또는 수동으로 관리되는 클라우드 솔루션 대비 사용성과 성능을 얼마나 향상시키는가?
- RQ5플랫폼이 데이터 집약적인 연구의 라이프사이클에 미치는 영향은 무엇인가? 특히 유연성, 재현 가능성, 자원 효율성 측면에서 살펴보면 어떻게 되는가?
주요 결과
- Cloud Kotta는 6개월 이상 생산 환경에 배포되어 약 10TB의 데이터를 관리하고 있으며, 그 중 5TB 이상이 처리된 바 있다.
- 플랫폼은 75,000시간 이상의 CPU 계산을 지원하여 대규모 워크로드 처리 능력을 입증했다.
- 10,000건의 정부 보조금 신청서 및 학술 문서의 OCR 처리를 10×32코어 인스턴스와 75GB RAM을 사용해 20시간 내로 완료했으며, 이는 현지 처리 기준로서 1개월 이상의 시간에 해당한다.
- 시스템은 단일 일일 작업으로 10,000건의 문서 OCR 워크플로우를 성공적으로 수행하여 계산 집약적인 작업을 가속화할 수 있음을 입증했다.
- Cloud Kotta는 텍스트 분석, 행렬 분해, 머신러닝, 이미지 인식, 네트워크 분석 등 다양한 분석 워크로드를 지원한다.
- 플랫폼은 수십 명의 연구자, 학생, 교사들이 도입했으며, IEEE, Web of Science, ACM 등의 기밀 데이터셋과 미국 특허, 위키백과 등의 공개 데이터셋을 호스팅하고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.