Skip to main content
QUICK REVIEW

[논문 리뷰] MICA: A fast short-read aligner that takes full advantage of Intel Many Integrated Core Architecture (MIC)

Sze-Hang Chan, Jeanno Cheung|arXiv (Cornell University)|2014. 02. 20.
Genomics and Phylogenetic Studies참고 문헌 1인용 수 13
한 줄 요약

MICA는 Intel의 Many Integrated Core(MIC) 아키텍처를 최적화하여 설계된 단일 읽기 정렬기로, 단일 MIC 보드에서 BWA-MEM 대비 4.9배 빠른 성능을 달성했으며, GPU 기반 SOAP3-dp를 능가한다. MIC의 60코어 아키텍처를 활용해 스레드 수준 및 데이터 수준의 병렬성을 모두 활용하여 초고속 유전체 분석 워크로드에 대한 효율적인 확장성을 제공한다.

ABSTRACT

Background: Short-read aligners have recently gained a lot of speed by exploiting the massive parallelism of GPU. An uprising alternative to GPU is Intel MIC; supercomputers like Tianhe-2, currently top of TOP500, is built with 48,000 MIC boards to offer ~55 PFLOPS. The CPU-like architecture of MIC allows CPU-based software to be parallelized easily; however, the performance is often inferior to GPU counterparts as an MIC board contains only ~60 cores (while a GPU board typically has over a thousand cores). Results: To better utilize MIC-enabled computers for NGS data analysis, we developed a new short-read aligner MICA that is optimized in view of MICs limitation and the extra parallelism inside each MIC core. Experiments on aligning 150bp paired-end reads show that MICA using one MIC board is 4.9 times faster than the BWA-MEM (using 6-core of a top-end CPU), and slightly faster than SOAP3-dp (using a GPU). Furthermore, MICAs simplicity allows very efficient scale-up when multiple MIC boards are used in a node (3 cards give a 14.1-fold speedup over BWA-MEM). Summary: MICA can be readily used by MIC-enabled supercomputers for production purpose. We have tested MICA on Tianhe-2 with 90 WGS samples (17.47 Tera-bases), which can be aligned in an hour less than 400 nodes. MICA has impressive performance even though the current MIC is at its initial stage of development (the next generation of MIC has been announced to release in late 2014).

연구 동기 및 목표

  • GPU 가속 정렬기와 CPU 기반 시스템 간의 성능 격차를 해소하기 위해 Intel의 Many Integrated Core(MIC) 아키텍처를 활용하는 것.
  • 높은 코어 수와 CPU 유사 프로그래밍 모델을 조합한 MIC의 특성을 최대로 활용할 수 있는 단일 읽기 정렬기를 설계하는 것.
  • 대규모 유전체 데이터 처리를 위한 다중 MIC 시스템에서 높은 성능과 효율적인 확장성을 달성하는 것.
  • Tianhe-2처럼 48,000개의 MIC 보드를 사용하는 MIC 기반 초고성능 컴퓨터에서 생산 수준의 정렬을 가능하게 하는 것.

제안 방법

  • MICA는 읽기 간의 거시적 작업 수준 병렬성과 각 MIC 코어 내의 미세한 데이터 수준 병렬성에 동시에 대응하는 하이브리드 병렬화 전략을 적용한다.
  • 60코어 아키텍처를 고려해 최적화된 MICA는 벡터화된 명령 세트와 효율적인 메모리 액세스 패턴을 사용해 지연을 최소화한다.
  • MIC의 x86 명령 세트를 활용하여 기존 CPU 최적화 코드를 최소한의 이식 노력으로 재사용할 수 있다.
  • MICA는 MIC의 스레딩 모델에 맞게 조정된 효율적인 비트 병렬 처리를 활용한 시드-확장 전략을 사용한다.
  • OpenMP와 Intel의 오프로드 프로그래밍 모델을 사용하여 MIC 카드에서의 데이터 이동 및 커널 실행을 관리한다.
  • 단일 및 다중 MIC 노드 배포를 모두 지원하여 추가 카드가 추가될수록 선형 확장이 가능하다.

실험 결과

연구 질문

  • RQ1GPU에 비해 코어 수가 적은 MIC 아키텍처에서도 단일 읽기 정렬기가 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2MICA는 각 MIC 코어 내부 및 여러 개의 MIC 보드 간에 존재하는 병렬성을 얼마나 효과적으로 활용할 수 있는가?
  • RQ3실제 유전체 워크로드에서 기존 GPU 기반 정렬기인 SOAP3-dp를 능가할 수 있는가?
  • RQ4단일 MIC 보드를 사용할 때 MICA는 기존 CPU 기반 정렬기인 BWA-MEM 대비 얼마나 빠른가?
  • RQ5단일 컴퓨팅 노드 내에서 여러 개의 MIC 카드를 사용할 경우 MICA는 어떻게 확장되는가?

주요 결과

  • 단일 MIC 보드를 사용할 때 MICA는 BWA-MEM의 6코어 CPU 실행 대비 4.9배 빠른 성능을 달성한다.
  • GPU 기반 SOAP3-dp보다 약간의 성능 우위를 확보하여 MIC에서의 경쟁력 있는 성능을 입증한다.
  • 단일 노드에 3개의 MIC 카드를 사용할 경우, MICA는 BWA-MEM 대비 14.1배 빠른 성능을 기록하여 강력한 확장성 잠재력을 보였다.
  • Tianhe-2에서 MICA는 400개 이내의 노드를 사용해 90개 전장유전체 시퀀싱 샘플(17.47테라바이트)을 한 시간 이내에 정렬했다.
  • MIC가 초기 개발 단계에 있음에도 불구하고 성능 우위가 유지되었으며, 향후 세대의 MIC는 2014년 말경 출시될 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.