Skip to main content
QUICK REVIEW

[논문 리뷰] PsPIN: A high-performance low-power architecture for flexible in-network compute

Salvatore Di Girolamo, Andreas Kurth|arXiv (Cornell University)|2020. 10. 07.
Software-Defined Networks and 5G참고 문헌 47인용 수 4
한 줄 요약

PsPIN은 400 Gbit/s에서 고성능, 저전력 패킷 처리를 위한 오픈소스이자 RISC-V 기반의 네트워크 내 컴퓨팅 가속기이다. sPIN 프로그래밍 모델을 구현하여 경량 처리 클러스터를 통해 패킷을 병렬로 처리할 수 있는 사용자 정의 C/C++ 핸들러를 실행하며, 64 B 패킷 기준 26 ns의 지연 시간을 달성했고, 면적은 18.5 mm²(22 nm FDSOI)이다.

ABSTRACT

The capacity of offloading data and control tasks to the network is becoming increasingly important, especially if we consider the faster growth of network speed when compared to CPU frequencies. In-network compute alleviates the host CPU load by running tasks directly in the network, enabling additional computation/communication overlap and potentially improving overall application performance. However, sustaining bandwidths provided by next-generation networks, e.g., 400 Gbit/s, can become a challenge. sPIN is a programming model for in-NIC compute, where users specify handler functions that are executed on the NIC, for each incoming packet belonging to a given message or flow. It enables a CUDA-like acceleration, where the NIC is equipped with lightweight processing elements that process network packets in parallel. We investigate the architectural specialties that a sPIN NIC should provide to enable high-performance, low-power, and flexible packet processing. We introduce PsPIN, a first open-source sPIN implementation, based on a multi-cluster RISC-V architecture and designed according to the identified architectural specialties. We investigate the performance of PsPIN with cycle-accurate simulations, showing that it can process packets at 400 Gbit/s for several use cases, introducing minimal latencies (26 ns for 64 B packets) and occupying a total area of 18.5 mm 2 (22 nm FDSOI).

연구 동기 및 목표

  • 현대 데이터센터에서 네트워크 속도(예: 400 Gbit/s) 증가와 CPU 처리 능력 간의 성능 격차를 해소하기 위해.
  • 애플리케이션 로직을 네트워크 인터페이스 카드(NIC)에 직접 오프로드하여 영향력 있고 고-throughput, 저지연 패킷 처리를 가능하게 하기 위해.
  • 낮은 전력 및 면적 오버헤드를 유지하면서도 사용자 정의 핸들러를 지원하는 프로그래머블 아키텍처를 설계하기 위해.
  • 모듈러하고 확장 가능한 RISC-V 기반 설계를 통해 400 Gbit/s 라인 레이트 처리의 실현 가능성을 입증하기 위해.

제안 방법

  • 패킷 핸들러를 병렬로 실행하기 위해 경량 처리 요소를 갖춘 다중 클러스터 RISC-V 아키텍처를 설계함.
  • 사용자가 특정 패킷 플로우 또는 메시지에 대해 C/C++ 핸들러를 정의할 수 있도록 sPIN 프로그래밍 모델을 구현함.
  • 패킷 버퍼와 핸들러 데이터를 별도의 메모리 뱅크로 분리하여 경쟁을 최소화하고 고-throughput를 달성하기 위해 전용 메모리 서브시스템을 통합함.
  • 다양한 워크로드(예: 직렬화, 체크섬, 키-밸류 연산)에서 성능을 평가하기 위해 사이클 정확한 시뮬레이션을 수행함.
  • 제어 논리 최소화와 FDSOI 기술(22 nm) 활용을 통해 면적 및 전력 최적화를 달성하며, 전체 면적의 87%가 메모리 서브시스템에 할당됨.
  • 모듈러 클러스터 설계를 통해 확장성을 확보하여, 추가 클러스터 또는 넓은 데이터 경로를 통해 향후 더 높은 라인 레이트 지원이 가능하도록 함.

실험 결과

연구 질문

  • RQ1RISC-V 기반의 NIC 내 가속기가 최소한의 지연 시간과 저전력 소비로 400 Gbit/s 라인 레이트 패킷 처리를 유지할 수 있는가?
  • RQ2메모리 분할, 클러스터 구성, 처리 요소 전문화와 같은 아키텍처 선택이 성능 및 효율성에 미치는 영향은 어떠한가?
  • RQ3sPIN 프로그래밍 모델이 고정 기능 또는 FPGA 기반 솔루션에 비해 얼마나 더 영향력 있고 애플리케이션 특화된 패킷 처리를 가능하게 하는가?
  • RQ4핸들러 복잡도와 패킷 크기가 성능 저하 요인으로 작용할 경우, 아키텍처 확장으로 이를 어떻게 완화할 수 있는가?
  • RQ5eBPF, P4 또는 FPGA 기반 가속기와 비교했을 때 PsPIN의 면적 및 전력 효율성은 어떠한가?

주요 결과

  • PsPIN은 직렬화, 체크섬, 키-밸류 연산 등 다양한 워크로드에서 400 Gbit/s 라인 레이트 처리를 달성함.
  • 64바이트 패킷 기준 최소 지연 시간 26 ns를 기록하여 네트워크 내 저지연 처리의 가능성을 입증함.
  • 22 nm FDSOI 기술을 사용한 설계의 총 면적은 18.5 mm²이며, 이 중 87%가 메모리 서브시스템에 할당됨.
  • 전력 소비의 52%가 메모리에 기인함을 확인하여 향후 확장에 있어 메모리 최적화가 핵심임을 시사함.
  • 다양한 패킷 크기(256 B, 1024 B, 4096 B)에 대한 핸들러 핵심 시간(HCT) 분석 결과, 코어 수와 라인 레이트 확장을 균형 있게 조정해야만 성능 저하를 방지할 수 있음.
  • 모듈러 클러스터 아키텍처는 성능 저하 없이 확장 가능한 워크로드 처리를 가능하게 하며, 더 넓은 데이터 경로 또는 다수의 가속기로 향후 1 Tbit/s 지원이 가능함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.