Skip to main content
QUICK REVIEW

[논문 리뷰] Serverless computing provides on-demand high performance computing for biomedical research

Dimitar Kumanov, Ling‐Hong Hung|arXiv (Cornell University)|2018. 07. 31.
Distributed and Parallel Computing Systems참고 문헌 13인용 수 11
한 줄 요약

이 논문은 AWS Lambda를 사용한 서버리스 컴퓨팅이 서버 관리 없이 자원을 동적으로 할당함으로써 생물의학 연구를 위한 수요 기반 고성능 컴퓨팅을 가능하게 한다고 보여준다. 이는 전체 대 전체 단백질 쌍 비교를 약 2분 만에 수행하고 비용은 1달러 이하로 끝내며 250배의 속도 향상을 달성하여, 대용량 생물정보학 워크로드에 대해 비용 효율적이고 즉각적인 확장성이 있음을 입증한다.

ABSTRACT

Cloud computing offers on-demand, scalable computing and storage, and has become an essential resource for the analyses of big biomedical data. The usual approach to cloud computing requires users to reserve and provision virtual servers. An emerging alternative is to have the provider allocate machine resources dynamically. This type of serverless computing has tremendous potential for biomedical research in terms of ease-of-use, instantaneous scalability and cost effectiveness. In our proof of concept example, we demonstrate how serverless computing provides low cost access to hundreds of CPUs, on demand, with little or no setup. In particular, we illustrate that the all-against-all pairwise comparison among all unique human proteins can be accomplished in approximately 2 minutes, at a cost of less than $1, using Amazon Web Services Lambda. This is a 250x speedup compared to running the same task on a typical laptop computer.

연구 동기 및 목표

  • 서버리스 컴퓨팅이 생물의학 데이터 분석을 위해 확장 가능하고, 저비용이며 고성능 컴퓨팅을 제공할 수 있는지 탐구하기.
  • 서버 프로비저닝 및 관리 오버헤드와 같은 전통적인 클라우드 컴퓨팅의 한계를 해결하기.
  • 모든 대 모든 단백질 비교와 같은 계산 집약적인 생물정보학 워크로드를 서버리스 플랫폼에서 실행할 수 있는 가능성을 입증하기.
  • 기존 랩톱 기반 계산과 비교해 서버리스 실행의 성능 및 비용 효율성을 평가하기.
  • 복잡한 생물의학 분석을 최소한의 설정과 동적 자원 할당으로 실행할 수 있음을 입증하는 개념 증명 제공하기.

제안 방법

  • 기본 인프라 관리 없이 병렬 생물정보학 워크로드를 실행하기 위해 서버리스 컴퓨팅 서비스인 AWS Lambda를 활용했다.
  • 인간 단백질의 전체 대 전체 쌍 비교를 원자적이고 상태 없는 함수로 분할하는 분산 워크플로우를 설계했다.
  • 이벤트 기반 실행을 활용해 필요에 따라 개별 비교 작업을 트리거하고, 수백 개의 동시 CPU 인스턴스로 자동 확장했다.
  • 서버리스 환경에서 지연 시간을 최소화하고 처리량을 극대화하기 위해 함수 패키징 및 입력/출력 처리를 최적화했다.
  • 표준 생물정보학 도구와의 재현 가능성 및 호환성을 보장하기 위해 컨테이너 기반 실행 환경을 사용했다.
  • 성능 및 경제적 효율성 평가를 위해 AWS 청구 및 모니터링 API를 사용해 실행 시간과 비용을 측정했다.

실험 결과

연구 질문

  • RQ1서버리스 컴퓨팅은 최소한의 설정과 관리로 생물의학 데이터 분석을 위한 고성능 컴퓨팅을 제공할 수 있는가?
  • RQ2전체 대 전체 단백질 비교에 대해 서버리스 실행 성능은 기존 랩톱 기반 계산과 비교해 어떻게 되는가?
  • RQ3AWS Lambda와 같은 서버리스 플랫폼에서 대규모 생물정보학 워크로드를 실행할 경우 비용 효율성은 어떠한가?
  • RQ4서버리스 아키텍처는 생물의학 연구에서 계산 집약적인 작업을 처리하기 위해 얼마나 동적으로 확장 가능한가?
  • RQ5서버리스 컴퓨팅은 서버 프로비저닝이나 관리 없이도 복잡한 생물학적 데이터 분석을 신속하고 수요 기반으로 실행할 수 있는가?

주요 결과

  • 고유한 인간 단백질의 전체 대 전체 쌍 비교가 AWS Lambda를 사용해 약 2분 만에 완료되었다.
  • 실행 총비용은 1달러 이하였으며, 기존 컴퓨팅 방법과 비교해 극적으로 비용 절감이 이루어졌다.
  • 일반적인 랩톱 컴퓨터에서 같은 작업을 실행한 것과 비교해 250배의 속도 향상을 달성했다.
  • 서버리스 컴퓨팅은 수백 개의 CPU를 수요에 따라 동적으로 할당할 수 있었으며, 수동 서버 프로비저닝이나 구성이 필요하지 않았다.
  • 시스템은 즉각적인 확장성과 거의 즉각적인 자원 가용성을 보였으며, 생물의학 연구에서 흔한 파동적이고 비정규적인 워크로드에 이상적이다.
  • 결과적으로 서버리스 컴퓨팅은 생물정보학 분야의 고성능 컴퓨팅을 위한 실현 가능하고 효율적이며 비용 효율적인 대안임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.