[논문 리뷰] Assise: Performance and Availability via NVM Colocation in a Distributed File System
Assise는 계산과 스토리지의 공치소를 통해 밀리초 이내 장애 복구, 낮은 꼬리 지연, 강력한 일致성을 달성하기 위해 노드 로컬 비버니셔블 메모리(NVM)를 활용하는 분산 파일 시스템이다. 각 I/O 작업 단위의 정합성 수준에서 NVM 캐시를 관리하는 크래시-일致성 복제 정합성 프로토콜(CC-NVM)을 사용하여, Ceph, NFS, Octopus를 초월해 최대 56배의 처리량 향상과 103배의 장애 복구 시간 단축을 달성하면서도 선형화 및 접두사 의미론을 보장한다.
The adoption of very low latency persistent memory modules (PMMs) upends the long-established model of disaggregated file system access. Instead, by colocating computation and PMM storage, we can provide applications much higher I/O performance, sub-second application failover, and strong consistency. To demonstrate this, we built the Assise distributed file system, based on a persistent, replicated coherence protocol for managing a set of server-colocated PMMs as a fast, crash-recoverable cache between applications and slower disaggregated storage, such as SSDs. Unlike disaggregated file systems, Assise maximizes locality for all file IO by carrying out IO on colocated PMM whenever possible and minimizes coherence overhead by maintaining consistency at IO operation granularity, rather than at fixed block sizes. We compare Assise to Ceph/Bluestore, NFS, and Octopus on a cluster with Intel Optane DC PMMs and SSDs for common cloud applications and benchmarks, such as LevelDB, Postfix, and FileBench. We find that Assise improves write latency up to 22x, throughput up to 56x, fail-over time up to 103x, and scales up to 6x better than its counterparts, while providing stronger consistency semantics. Assise promises to beat the MinuteSort world record by 1.5x.
연구 동기 및 목표
- 저지연 지속 메모리(NVM) 시대의 분리된 파일 시스템의 성능 및 가용성 한계를 해결하기 위해.
- NVM를 사용할 경우 전통적인 파일 시스템에서 높은 시스템 호출 오버헤드, 장기적인 복구 시간, 고정 블록 크기 기반 정합성으로 인한 문제를 극복하기 위해.
- 응용 프로그램 수준의 API 변경 없이 고성능, 크래시-일치성, 고가용성 파일 I/O를 가능하게 하기 위해.
- 로컬, 소켓 로컬, 네트워크 로컬 NVM을 활용해 캐싱과 복제를 수행하는 확장성 있고 낮은 지연의 분산 파일 시스템을 설계하기 위해.
- 고정 블록 크기 대신 I/O 작업 단위에서 정합성을 관리하여 최소한의 정합성 오버헤드로 강력한 일치성을 달성하기 위해.
제안 방법
- I/O 작업에 대한 네트워크 지연을 제거하기 위해 응용 프로그램 프로세스를 지속 메모리 모듈(PMMs)과 공치소한다.
- 리소스 임대 기반의 로깅과 함께 접두사 의미론과 선형화를 보장하는 크래시-일치성 복제 캐시 정합성 계층(CC-NVM)을 구현한다.
- RDMA와 DMA를 사용해 원격 및 소켓 간 NVM에 대한 쓰기 순서를 보장하여 커널 간섭 없이 강력한 일치성을 확보한다.
- 최소한의 꼬리 지연을 위해 승인된 로컬 및 원격 NVM 영역에 커널 바이패스 I/O를 지원한다.
- 비동기 체인 복제를 통해 낮은 쓰기 지연을 위한 옵timistic 모드를 활성화하여 접두사 크래시 일치성을 확보한다.
- 예비 복제본을 네트워크 로컬 NVM 캐시로 배포하여 사다리꼴 장애 상황에서 캐시 복제본으로 전환함으로써 근접한 즉각적인 장애 복구를 보장한다.
실험 결과
연구 질문
- RQ1분리된 모델 대비 공치소된 NVM이 분산 파일 시스템에서 I/O 지연과 장애 복구 시간을 얼마나 크게 줄일 수 있는가?
- RQ2고속 지속 캐시로 사용되는 NVM을 사용할 경우 최소한의 정합성 오버헤드로 강력한 일치성을 유지할 수 있는가?
- RQ3로컬 임대 관리와 프로세스 로컬 캐싱이 파일 시스템 워크로드에서 확장성 향상과 꼬리 지연 감소에 얼마나 기여하는가?
- RQ4크래시-일치성 복제 NVM 캐시 계층(CC-NVM)이 일치성 손실 없이 고성능과 고가용성을 동시에 제공할 수 있는가?
- RQ5LevelDB, Postfix, FileBench와 같은 실세계 워크로드에서 Assise의 설계가 Ceph, NFS, Octopus 대비 어떻게 확장되는가?
주요 결과
- Assise는 LevelDB와 FileBench 워크로드에서 Ceph/Bluestore 대비 쓰기 지연을 최대 22배 감소시키고 처리량을 최대 56배 향상시켰다.
- 크래시-일치성 복제본을 이용한 NVM 캐시의 로컬 복구 덕분에 응용 프로그램 장애 복구 시간이 최대 103배 향상되었다.
- NVM 쓰기 대역폭이 병목이 되기 전까지 프로세스 수에 비례해 선형 확장되며, Ceph 대비 6배 높은 확장성 성능을 달성했다.
- 쉐어드 디렉터리가 존재하는 상황에서도 일관성 관리의 국소화 덕분에 라운드로빈 대비 최대 20% 향상된 성능을 보인 쉐이드 구성(Assise-sharded)이 성능 향상을 이룬다.
- 개별 디렉터리 쉐이딩(Assise-private)은 최소한의 동기화 오버헤드를 보이며 쉐이딩 기반 최적화와 유사한 성능을 달성함으로써 CC-NVM의 효율성을 입증한다.
- 스케일링 시 Assise는 Orion 대비 69배, Ceph 대비 554배의 처리량 향상을 기록했으며, 저지연·고처리량 설계 덕분에 MinuteSort 세계 기록을 1.5배 빠르게 갱신했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.