Skip to main content
QUICK REVIEW

[논문 리뷰] FPGA Acceleration of Short Read Alignment

Nathaniel McVicar, Akina Hoshino|arXiv (Cornell University)|2018. 04. 30.
Genomics and Phylogenetic Studies참고 문헌 17인용 수 5
한 줄 요약

이 논문은 고성능 유전체 분석을 위한 하드웨어 가속을 활용하는 유연한 FPGA 기반 단일 서열 정렬기이다. FPGA의 병렬 처리와 호스트 소프트웨어의 유연성을 조합하여, BWA-SW 대비 5.6배 빠른 속도 향상과 21%의 에너지 절감, 잘못된 분류 수가 29% 감소하는 결과를 이끌었으며, 성능 저하 없이 다양한 게놈 크기와 변화하는 정렬 알고리즘을 지원한다.

ABSTRACT

Aligning millions of short DNA or RNA reads, of 75 to 250 base pairs each, to a reference genome is a significant computation problem in bioinformatics. We present a flexible and fast FPGA-based short read alignment tool. Our aligner makes use of the processing power of FPGAs in conjunction with the greater host memory bandwidth and flexibility of software to improve performance and achieve a high level of configurability. This flexible design supports a variety of reference genome sizes without the performance degradation suffered by other software and FPGA-based aligners. It is also better able to support the features of new alignment algorithms, which frequently crop up in the rapidly evolving field of bioinformatics. We demonstrate these advantages in a case study where we align RNA-Seq data from a hypothesized mouse / human xenograft. In this case study, our aligner provides a speedup of 5.6x over BWA-SW with energy savings of 21%, while also reducing incorrect short read classification by 29%. To demonstrate the flexibility of our system we show that the speedup can be substantially improved while retaining most of the accuracy gains over BWA-SW. The speedup can be increased to 71.3x, while still enjoying a 28% incorrect classification improvement and 52% improvement in unaligned reads.

연구 동기 및 목표

  • 유전체 분석에서 수백만 개의 단일 DNA/RNA 서열을 참조 게놈에 정렬하는 데 발생하는 계산적 병목 현상을 해결하기 위해.
  • 다양한 게놈 크기를 처리할 때 기존 FPGA 및 소프트웨어 정렬기에서 발생하는 성능 저하 문제를 해결하기 위해.
  • 높은 구성 가능성을 갖춘 하드웨어-소프트웨어 공동 설계를 통해 새로운 정렬 알고리즘의 지원을 가능하게 하기 위해.
  • 단일 서열 정렬 워크로드에서 높은 성능과 에너지 효율성을 동시에 달성하기 위해.
  • 예를 들어 샘플 이식 모델 탐지와 같은 실제 RNA-Seq 데이터 분석에서 실용적인 이점을 입증하기 위해.

제안 방법

  • 정렬기의 핵심 정렬 계산을 FPGA를 활용해 가속화하여, 단일 서열 처리에 대한 세밀한 병렬 처리를 실현한다.
  • 메모리 접근과 데이터 흐름을 관리하기 위해 호스트 소프트웨어 시스템과 통합하여, 호스트의 더 넓은 메모리 대역폭을 활용한다.
  • 다른 參照 게놈 크기와 정렬 알고리즘 변종에 대응하기 위해 구성 가능한 파라미터를 지원한다.
  • 하이브리드 아키텍처를 적용하여 FPGA는 시드 매칭과 정렬 스코어링을 담당하고, 호스트는 사전처리 및 사후처리를 담당한다.
  • 최대 처리량과 최소 지연 시간을 확보하기 위해 파ipelined, 스트리밍 데이터 플로우를 사용한다.
  • 단일 엔드 및 페어드 엔드 서열 정렬을 모두 지원하며, 감도와 속도 간의 구성 가능한 트레이드오프를 제공한다.

실험 결과

연구 질문

  • RQ1FPGA 가속이 단일 서열 정렬에서 높은 정확도를 유지하면서도 상당한 성능 향상을 달성할 수 있는가?
  • RQ2기존 솔루션 대비 제안된 FPGA 기반 정렬기가 다양한 參照 게놈 크기에서 어떻게 스케일링되는가?
  • RQ3성능 저하 없이 새로운 정렬 알고리즘의 변화를 얼마나 잘 수용할 수 있는가?
  • RQ4실제 RNA-Seq 데이터에서 속도 향상, 에너지 효율성, 정확도 간의 상호 트레이드오프는 어떠한가?
  • RQ5구성 가능성을 통해 극한의 속도 향상을 달성하면서도 높은 정확도를 유지할 수 있는가?

주요 결과

  • 마우스/인간 이식 모델 RNA-Seq 데이터셋에서 BWA-SW 대비 5.6배 빠른 속도 향상과 21% 낮은 에너지 소비를 달성했다.
  • BWA-SW 대비 잘못된 단일 서열 분류 수가 29% 감소하여 정렬 정확도가 향상되었다.
  • 다양한 게놈 크기 전반에서 높은 성능을 유지하여, 다른 FPGA 및 소프트웨어 정렬기에서 관찰되는 성능 저하 현상을 피했다.
  • 구성 설정을 조정함으로써 속도 향상은 71.3배로 증가시키면서도 잘못된 분류 수는 28% 감소시켰다.
  • 최고 성능에서 미정렬 서열 탐지 능력이 52% 향상되어 민감도 향상이 확인되었다.
  • 유연한 설계 덕분에 FPGA 논리 재설계 없이도 새로운 정렬 알고리즘에 쉽게 적응할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.