Skip to main content
QUICK REVIEW

[논문 리뷰] Microsecond Consensus for Microsecond Applications

Marcos K. Aguilera, Naama Ben-David|arXiv (Cornell University)|2020. 10. 13.
Distributed systems and fault tolerance참고 문헌 59인용 수 10
한 줄 요약

Mu는 RDMA 단일 측면 쓰기와 권한 기반 액세스 제어를 활용하여 요청을 1.3 마이크로초 이내(99번째 백분위수: 1.6 μs)로 복제하는 고성능, 마이크로초 최적화된 상태 기계 복제(SMR) 시스템을 제안한다. 이로 인해 장애 복구 시간은 873μs로 단축되었으며(99번째 백분위수: 945μs), 이는 이전 시스템 대비 각각 60퍼센트 이상, 90퍼센트 이상의 지연 감소를 의미한다. 시스템은 새로운 RDMA 기반 공의 프로토콜과 풀 스코어 장애 탐지 메커니즘을 통해 마이크로초 수준의 응용 프로그램에 적합한 빠르고 안전하며 확장 가능한 복제를 가능하게 한다.

ABSTRACT

We consider the problem of making apps fault-tolerant through replication, when apps operate at the microsecond scale, as in finance, embedded computing, and microservices apps. These apps need a replication scheme that also operates at the microsecond scale, otherwise replication becomes a burden. We propose Mu, a system that takes less than 1.3 microseconds to replicate a (small) request in memory, and less than a millisecond to fail-over the system - this cuts the replication and fail-over latencies of the prior systems by at least 61% and 90%. Mu implements bona fide state machine replication/consensus (SMR) with strong consistency for a generic app, but it really shines on microsecond apps, where even the smallest overhead is significant. To provide this performance, Mu introduces a new SMR protocol that carefully leverages RDMA. Roughly, in Mu a leader replicates a request by simply writing it directly to the log of other replicas using RDMA, without any additional communication. Doing so, however, introduces the challenge of handling concurrent leaders, changing leaders, garbage collecting the logs, and more - challenges that we address in this paper through a judicious combination of RDMA permissions and distributed algorithmic design. We implemented Mu and used it to replicate several systems: a financial exchange app called Liquibook, Redis, Memcached, and HERD. Our evaluation shows that Mu incurs a small replication latency, in some cases being the only viable replication system that incurs an acceptable overhead.

연구 동기 및 목표

  • 금융, 임베디드 시스템, 마이크로서비스 등 마이크로초 수준의 응용 프로그램에 부적합한 수백 마이크로초의 오버헤드를 유발하는 전통적 SMR 시스템의 핵심 성능 격차를 해결한다.
  • 복제 및 장애 복구 지연을 마이크로초 응용 프로그램과 호환 가능한 수준으로 낮춘다. 여기서는 작은 오버헤드조차도 금기시된다.
  • 단일 라운드의 단일 측면 RDMA 작업을 통해 공의 및 복제를 달성하는 새로운 SMR 프로토콜을 설계한다. 이는 다중 라운드 통신과 이중 측면 메시징을 제거한다.
  • 네트워크 지연으로 인한 잘못된 경고를 피하기 위해 네트워크 지연에 민감하지 않은 RDMA 기반 풀 스코어 메커니즘을 사용해 신속하고 신뢰할 수 있는 장애 탐지 기능을 제공한다.
  • 빠른 공통 경로 지연과 낮은 장애 복구 시간을 동시에 달성한다. 이는 빠른 복제와 빠른 장애 복구 사이의 전통적 트레이드오프를 도전한다.

제안 방법

  • 각 레플리카의 로그에 요청을 단일 통신 라운드 내에서 직접 복제하기 위해 RDMA 단일 측면 쓰기 작업을 사용하여 팔로워와의 왕복 통신을 제거한다.
  • 각 레플리카의 로그에 대한 전용 쓰기 액세스를 RDMA 쓰기 권한으로 강제하여, 동시에 두 개 이상의 리더가 로그를 손상시키는 것을 방지한다.
  • 레플리카가 리더의 심장박동 카운터를 RDMA를 사용해 주기적으로 읽는 풀 스코어 장애 탐지 메커니즘을 구현한다. 스코어(연속적으로 동일한 읽기 횟수)가 임계값을 초과하면 장애로 간주한다.
  • 현대 RDMA 호환 NIC에서 원자적이고 효율적인 RDMA 권한 업데이트 기반의 경량 리더 전환 프로토콜을 구현한다.
  • 로깅, 상태 관리, 클라이언트 조율, 인스턴스 라이프사이클 관리 등 일반적인 애플리케이션을 지원하는 상태 기계 복제 프레임워크를 설계한다.
  • 시스템 호출 최소화 및 메모리 매핑 I/O 사용과 같은 이전 RDMA 최적화 기법을 통합하여 CPU 오버헤드를 줄이고 종단 간 지연을 향상시킨다.

실험 결과

연구 질문

  • RQ1단일 측면 RDMA 작업만을 사용하여 마이크로초 수준의 응용 프로그램에 대해 마이크로초 이하의 복제 지연을 달성할 수 있는가?
  • RQ2다중 라운드 통신이나 이중 측면 메시징 없이 RDMA 권한을 어떻게 활용하여 동시 리더 쓰기 작동을 방지할 수 있는가?
  • RQ3네트워크 타임아웃에 의존하지 않고도 마이크로초 수준의 정밀도로 신속하고 정확한 장애 탐지가 가능한가?
  • RQ4빠른 경로 성능과 느린 경로 성능 사이의 전통적 트레이드오프를 깨고, 동시에 낮은 복제 지연과 낮은 장애 복구 시간을 달성할 수 있는가?
  • RQ5단일 측면 RDMA 작업과 권한 기반 조율만을 사용하여 완전 기능을 갖춘 SMR 시스템을 구축할 수 있는 정도는 어느 정도인가?

주요 결과

  • Mu는 평균적으로 1.3 마이크로초 미만, 99번째 백분위수는 1.6 마이크로초 이내로 소형 요청을 복제한다. 이는 가장 빠른 이전 시스템 대비 복제 지연을 61퍼센트 감소시킨 것이다.
  • 장애 복구 시간은 873 마이크로초(99번째 백분위수: 945 μs)로 단축되었으며, 이는 이전 시스템의 장애 복구 시간을 최소 90퍼센트 이상 감소시킨 것이다. 가장 빠른 이전 시스템(HovercRaft)은 10밀리초가 소요되었다.
  • 시스템은 단일 라운드의 병렬 RDMA 쓰기 작업을 통해 공의 및 복제를 달성하여, 다중 통신 라운드나 이중 측면 작업이 필요 없음을 입증했다.
  • 풀 스코어 장애 탐지 메커니즘은 평균 약 600 마이크로초 내에 장애 탐지를 가능하게 하였으며, 이는 주로 프로세스 스케줄링 변동성에 의해 제한되며 네트워크 지연에 의해 영향을 받지 않는다.
  • Mu의 RDMA 권한 사용은 동시에 여러 리더가 존재하는 상황에서도 레플리카의 로그에 동시에 쓰기 작업이 일어나지 않도록 보장함으로써, 레이스 컨dition 없이 안전한 단일 라운드 복제를 가능하게 한다.
  • Liquibook, Redis, Memcached, HERD와 같은 실제 시스템에서의 평가 결과, Mu는 최소한의 오버헤드 덕분에 마이크로초 응용 프로그램에 유일하게 실현 가능한 복제 시스템임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.