Skip to main content
QUICK REVIEW

[논문 리뷰] Collie: Finding Performance Anomalies in RDMA Subsystems

Xinhao Kong, Yibo Zhu|arXiv (Cornell University)|2023. 04. 22.
Software System Performance and Reliability인용 수 6
한 줄 요약

Collie는 응용 프로그램 워크로드 공간을 탐색하고 하드웨어 카운터를 극한 값으로 유도하기 위해 시뮬레이티드 앤날링을 사용함으로써 RDMA 서브시스템의 성능 이면을 체계적으로 드러내는 도구이다. 이 도구는 이전에 알려지지 않은 15개의 이면을 발견하였으며, 그 중 7개는 연구자들이 보고한 후 제조사에서 수정하였다.

ABSTRACT

High-speed RDMA networks are getting rapidly adopted in the industry for their low latency and reduced CPU overheads. To verify that RDMA can be used in production, system administrators need to understand the set of application workloads that can potentially trigger abnormal performance behaviors (e.g., unexpected low throughput, PFC pause frame storm). We design and implement Collie, a tool for users to systematically uncover performance anomalies in RDMA subsystems without the need to access hardware internal designs. Instead of individually testing each hardware device (e.g., NIC, memory, PCIe), Collie is holistic, constructing a comprehensive search space for application workloads. Collie then uses simulated annealing to drive RDMA-related performance and diagnostic counters to extreme value regions to find workloads that can trigger performance anomalies. We evaluate Collie on combinations of various RDMA NIC, CPU, and other hardware components. Collie found 15 new performance anomalies. All of them are acknowledged by the hardware vendors. 7 of them are already fixed after we reported them. We also present our experience in using Collie to avoid performance anomalies for an RDMA RPC library and an RDMA distributed machine learning framework.

연구 동기 및 목표

  • RNIC과 서버 하드웨어 간의 복잡한 상호작용으로 인해 발생하는 RDMA 서브시스템의 성능 이면을 탐지할 긴급한 필요성을 해결한다.
  • 기본 벤치마크나 실제 응용 프로그램 워크로드와 같은 전통적 테스트 방법의 한계를 극복하여, 미세하고 워크로드에 따라 달라지는 이면을 드러내지 못하는 문제를 해결한다.
  • 시스템 관리자와 응용 프로그램 개발자가 생산 환경에 배포하기 전에 성능 이면을 사전에 식별하고 회피할 수 있도록 한다.
  • 이면의 유발 조건에 대한 실질적인 통찰을 제공하여 RDMA 기반 시스템의 응용 프로그램 수준 설계 결정을 안내한다.

제안 방법

  • 메모리 유형, 연결 수, 트랜스포트 유형과 같은 제어 가능한 파라미터에 중점을 두어 개발자의 관점에서 통합된 워크로드 탐색 공간을 구성한다.
  • 제조사가 제공하는 성능 및 진단 카운터(예: PFC 퍼지 프레임, 대역폭)를 최적화를 위한 피드백 신호로 활용한다.
  • 시뮬레이티드 앤날링을 적용하여 탐색 과정을 유도하고, 반복적으로 워크로드를 변형하여 카운터가 이면을 나타내는 극한 값으로 유도한다.
  • 발견된 이면의 유발 조건을 활용하여 중복된 테스트를 피하고, 응용 프로그램 개발자가 문제 있는 설정을 피할 수 있도록 안내한다.
  • 하드웨어 카운터 모니터링을 탐색 루프에 통합하여 고차원 워크로드 공간의 데이터 기반 탐색을 가능하게 한다.
  • 다양한 RNIC, CPU 및 서버 구성이 포함된 8종의 일반적인 RDMA 서브시스템에서 실제 환경 평가를 통해 결과를 검증한다.

실험 결과

연구 질문

  • RQ1표준 벤치마크나 실제 워크로드로는 유도되지 않는 성능 이면을 체계적이고 자동화된 접근 방식이 효과적으로 드러낼 수 있는가?
  • RQ2내부 하드웨어 설계나 소스 코드에 접근할 수 없을 때 성능 이면을 어떻게 탐지할 수 있는가?
  • RQ3하드웨어 카운터 피드백에 의해 유도되는 시뮬레이티드 앤날링이 복잡하고 고차원적인 RDMA 응용 프로그램 워크로드 공간을 얼마나 효율적으로 탐색할 수 있는가?
  • RQ4RDMA 서브시스템 이면의 가장 일반적인 유발 조건은 무엇이며, 다양한 하드웨어 구성 간에 일반화될 수 있는가?
  • RQ5식별된 이면을 활용하여 하드웨어 패치가 출시되기 전에 응용 프로그램 개발을 안내하고 성능 문제를 피할 수 있는가?

주요 결과

  • Collie는 8종의 일반적인 하드웨어 구성에서 RDMA 서브시스템의 15개 신규 성능 이면을 성공적으로 식별하였으며, 모든 이면은 하드웨어 제조사에서 확인하였다.
  • 15개 이면 중 7개는 연구자들의 보고 이후 제조사에서 수정된 버그로 확인되었다.
  • Perftest와 같은 표준 벤치마크로는 유도되지 않았던 이면을 발견하여, 기존 테스트로는 놓치는 극단적인 케이스를 찾아내는 능력을 입증하였다.
  • 이면은 특정 조합의 응용 프로그램 워크로드, NUMA 설정, 하드웨어 구성에서 예기치 않게 낮은 대역폭과 PFC 퍼지 프레임 폭증을 포함하였다.
  • Collie의 접근 방식 덕분에 개발 팀은 제조사 패치가 출시되기 전에 RDMA RPC 라이브러리와 분산 머신러닝 프레임워크를 수정하여 알려진 이면을 피할 수 있었다.
  • 하드웨어 카운터 피드백을 활용한 시뮬레이티드 앤날링은 워크로드 공간의 무작위 또는 막연한 탐색에 비해 탐색 효율을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.