[논문 리뷰] The BaseJump Manycore Accelerator Network
BaseJump Manycore Accelerator Network는 RISC-V 호환 다핵 아키텍처를 위한 오픈소스이며 메esh 기반의 片上 네트워크로, 분할된 글로벌 주소공간 모델을 통해 효율적인 원격 메모리 작업을 가능하게 한다. 최소한의 하드웨어로 원격 로드, 스토어 및 원자적 스왑 작업을 지원하여 산산이 흩어진/집합된 작업 워크로드에 대해 높은 성능을 달성하고, 차원 순서 라우팅과 크레딧 기반 플로우 제어를 통해 확장 가능한 통신을 실현한다.
The BaseJump Manycore Accelerator-Network is an open source mesh-based On-Chip-Network which is designed leveraging the Bespoke Silicon Group's 20+ years of experience in designing manycore architectures. It has been used in the 16nm 511-core RISC-V compatible Celerity chip Davidson et al. (2018), forming the basis of both a 1 GHz 496-core RISC-V manycore and a 10-core always-on low voltage complex. It was also used in the 180nm BSG Ten chip, which featured ten cores and a mesh that extends over off-chip links to an FPGA. To facilitate use by the open source community of the BaseJump Manycore network, we explain the ideas, protocols, interfaces and potential uses of the mesh network. We also show an example with source code that demonstrates how to integrate user designs into the mesh network.
연구 동기 및 목표
- 최소한의 면적과 에너지 오버헤드로 다핵 가속기용 확장 가능한 오픈소스 片상 네트워크를 제공하기 위해.
- 분할된 글로벌 주소공간 모델에서 랜덤 산산이 흩어진/집합된 작업과 같은 효율적인 원격 메모리 액세스 패턴을 지원하기 위해.
- RISC-V 코어에서 DSP 및 eFPGA에 이르기까지 다양한 가속기를 통합된 메쉬 기반 통신 패브릭에 원활하게 통합할 수 있도록 하기 위해.
- 기본 로드/스토어 작업을 위한 표준 엔드포인트와 스트리밍 RPC 스타일 워크로드에 적합한 저수준 네트워크 인식 설계를 모두 제공하기 위해.
- 차원 순서 라우팅과 분할 대역폭 한계를 사용하여 균일한 무작위, 전치, 근접 이웃 트래픽 패턴 하에서 네트워크 성능을 분석하고 정량화하기 위해.
제안 방법
- 면적과 에너지 소비를 줄이기 위해 2차원 메쉬 토폴로지와 차원 순서 라우팅, 최소한의 버퍼를 사용한다.
- 작업 유형(로드, 스토어, 스왑), 소스/대상 좌표, 데이터 페이로드를 포함한 헤더 필드를 갖춘 단일 폭 32비트 패킷 포맷을 사용한다.
- 네트워크 혼잡을 관리하고 요청 및 응답 패킷의 신뢰성 있는 전달을 보장하기 위해 크레딧 기반 플로우 제어를 구현한다.
- 분할된 글로벌 주소공간 모델을 사용한 (X, Y, 로컬 주소) 주소 체계를 통해 타일 간 로드, 스토어, 비교 및 스왑을 지원함으로써 원격 메모리 작업을 실현한다.
- 기본적인 원격 메모리 액세스를 수행하는 가속기에서 네트워크 복잡성을 추상화하는 표준 엔드포인트 모듈을 제공한다.
- 직접 네트워크 인터페이스 설계를 통해 스트리밍 워크로드를 지원하며, 가속기가 들어오는 요청을 파이프라인화된 RPC로 처리할 수 있도록 한다.
실험 결과
연구 질문
- RQ1다핵 시스템에서 고성능 원격 메모리 작업을 지원하기 위해 최소 면적, 최소 에너지의 片상 네트워크를 어떻게 설계할 수 있는가?
- RQ2균일한 무작위 트래픽 하에서 최소한의 메쉬 네트워크의 성능 한계는 무엇이며, 네트워크 크기에 따라 어떻게 확장되는가?
- RQ3다양한 통신 패턴 하에서 평균 패킷 지연 측면에서 차원 순서 라우팅과 적응형 알고리즘(예: Valiant, ROMM)은 어떻게 비교되는가?
- RQ4계산 모델이 상이한 가속기—특히 스트리밍 또는 원자적 연산을 요구하는 가속기—를 공유 네트워크 패브릭에 효율적으로 통합하기 위한 메커니즘은 무엇인가?
- RQ5메쉬 토폴로지에서 분할 대역폭과 제공된 트래픽 메트릭을 사용해 네트워크 성능을 얼마나 정확히 예측할 수 있는가?
주요 결과
- 16×16 메쉬에서 균일한 무작위 트래픽 하에서 네트워크는 매 4 사이클마다 새로운 메시지 주입을 지속할 수 있으며, 이는 분할 대역폭 16개의 링크와 링크당 사이클당 최대 4개 메시지의 이론적 한계에 의해 제한된다.
- 균일한 무작위 트래픽 하에서 16×16 메쉬의 평균 순환 지연은 약 48 사이클이며, 모든 코어가 분할을 가로질러 메시지를 전송할 경우 상대적 오버헤드는 단지 3배에 불과하다.
- 차원 순서 라우팅(DOR)은 전치 트래픽 패턴 하에서 성능이 열악한 반면, 근접 이웃 통신에서는 매우 효율적인 것으로 비교 시뮬레이션을 통해 입증되었다.
- 최소한의 차단 하드웨어와 사이클당 한 워드의 원격 스토어 처리 능력 덕분에 산산이 흩어진 작업에 대해 높은 스루풋을 달성한다.
- 원격 로드 및 비교-스왑 작업은 순환 통신으로 인해 긴 지연을 유발하지만, 데이터 국소성 또는 복수 타일 간 병렬화를 통해 완화될 수 있다.
- 네트워크 성능는 분할 대역폭에 의해 제한된다: 16×16 메쉬에서는 분할을 가로질러 사이클당 최대 32개의 원격 작업만 지속 가능하며, 이는 고병렬 워크로드의 실행 효율을 제한한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.