[논문 리뷰] FASTR: Reimagining FASTQ via Compact Image-inspired Representation
FASTR는 손실 없는 8-bit 인코딩으로 뉴클레오티드와 염기 품질을 단일 바이트로 결합하여 더 빠른 I/O, 더 작은 저장 공간, 압축 해제 없이 기존 도구와의 원활한 통합을 가능하게 합니다. 데이터 무결성을 유지하고 ML-ready 표현을 가능하게 하면서 FASTQ 및 관련 형식에 비해 여러 플랫폼에서 우수한 성능을 보입니다.
Motivation: High-throughput sequencing (HTS) enables population-scale genomics but generates massive datasets, creating bottlenecks in storage, transfer, and analysis. FASTQ, the standard format for over two decades, stores one byte per base and one byte per quality score, leading to inefficient I/O, high storage costs, and redundancy. Existing compression tools can mitigate some issues, but often introduce costly decompression or complex dependency issues. Results: We introduce FASTR, a lossless, computation-native successor to FASTQ that encodes each nucleotide together with its base quality score into a single 8-bit value. FASTR reduces file size by at least 2x while remaining fully reversible and directly usable for downstream analyses. Applying general-purpose compression tools on FASTR consistently yields higher compression ratios, 2.47, 3.64, and 4.8x faster compression, and 2.34, 1.96, 1.75x faster decompression than on FASTQ across Illumina, HiFi, and ONT reads. FASTR is machine-learning-ready, allowing reads to be consumed directly as numerical vectors or image-like representations. We provide a highly parallel software ecosystem for FASTQ-FASTR conversion and show that FASTR integrates with existing tools, such as minimap2, with minimal interface changes and no performance overhead. By eliminating decompression costs and reducing data movement, FASTR lays the foundation for scalable genomics analyses and real-time sequencing workflows. Availability and Implementation: https://github.com/ALSER-Lab/FASTR
연구 동기 및 목표
- FASTQ를 넘어서는 저장 용량 및 I/O 효율이 높은 시퀀싱 데이터 형식의 필요성을 제시한다.
- FASTR를 FASTQ의 손실 없는 계산 원천 기반 후속 형식으로 제안한다.
- 헤더 인코딩 및 8-bit base-quality 패킹으로 FASTR가 용량을 줄이고 압축/해제 속도를 향상시킨다는 것을 보여준다.
- 기존 도구 및 워크플로우와의 호환성과 낮은 오버헤드를 입증한다.
- FASTQ–FASTR 변환 및 다운스트림 분석 지원을 위한 확장 가능한 ML-준비 생태계를 제공한다.
제안 방법
- 암호화되지 않은 구간 분할 범위 인코딩을 통해 각 뉴클레오티드를 해당 염기 품질과 함께 하나의 8-bit 값으로 encode한다.
- 중복을 제거하기 위해 per-read 헤더의 필요를 없애는 전역 파일 헤더로 리드 메타데이터를 표현한다.
- 네 가지 FASTQ→FASTR 변환 모드를 제공하여 헤더 및 데이터 보존의 trade-off를 다르게 한다.
- 손실 없는 스트리밍 디코딩을 가능하게 하는 읽기 구분자로 sentinel 값(255)을 사용한다.
- 여러 Phred 체계로부터의 염기 품질 점수를 공통 숫자 범위로 정규화하고 스케일링한다.
- 인터페이스 변경 최소화 및 성능 저하 없이 FASTR를 다운스트림 도구(예: minimap2)와 통합한다.

실험 결과
연구 질문
- RQ1손실 없고 컴팩트한 8-bit 인코딩이 역방향 가능한지 여부를 파일 크기 감소와의 실질적 이득으로 달성할 수 있는가?
- RQ2FASTR가 FASTQ 및 다른 형식에 비해 다양한 시퀀싱 기술에서 생성, 압축, 해제를 더 빠르게 수행할 수 있는가?
- RQ3FASTR가 기존 생물정보학 도구와 최소한의 코드 변경으로 호환되는가?
- RQ4헤더 최적화가 데이터 중복성과 구문 해석 효율에 어떤 영향을 미치는가?
- RQ5FASTR가 리드에서 직접 숫자 표현을 제공함으로써 기계 학습 워크플로우를 지원할 수 있는가?
주요 결과
- FASTR는 손실 없이 다운스트림 분석에 직접 사용할 수 있을 만큼 FASTQ 대비 최소 약 2배의 파일 크기 감소를 달성한다.
- FAST R에 대한 범용 압축기는 FASTQ 대비 더 높은 압축률 및 더 빠른 압축/해제를 제공한다(예: Illumina, HiFi, ONT에서 2.47×–4.8× 더 빠른 압축; 2.34×–1.75× 더 빠른 해제).
- SAM/BAM/CRAM과 비교할 때 FASTR는 생성이 더 빠르고 크기가 작으며 레퍼런스 없이 헤더 최적화의 오버헤드가 최소화되며 FASTQ로의 변환이 효율적이다.
- FASTR는 minimap2와의 드롭인 호환성을 거의 성능 저하 없이 가능하게 하면서 I/O 및 출력 크기를 줄인다.
- 암호화되지 않은, 병렬 디코딩이 가능한 신뢰성을 위한 255를 구분자로 사용하는 암시적 분할 범위 인코딩으로 염기와 품질을 하나의 8-bit 값에 패킹한다.
- 네 가지 FASTQ→FASTR 모드는 서로 다른 워크플로에 대해 헤더 간결성 및 데이터 가용성 사이의 유연한 trade-off를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.