[논문 리뷰] HERMES: A Hierarchical Broadcast-Based Silicon Photonic Interconnect for Scalable Many-Core Systems
HERMES는 1,000코어 시스템에서 고성능 통신을 위해 저지연, 에너지 확장 가능한 브로드캐스트 네트워크와 회로스위치(point-to-point) 링크를 조합한 계층적 실리콘 포토닉 인터커넥트를 제안한다. 아디아바틱 커플러와 2-ary 폴드드 버터플라이 토폴로지(2-ary folded butterfly topology)를 활용함으로써 선형 에너지 스케일링(96% 효율성)을 달성하고, 블룸 필터 기반 필터링과 게으른 워크로드 이송 기법을 통해 글로벌 트래픽를 감소시켜 스케일링, 지연, 에너지 효율성 측면에서 이전 설계를 뛰어넘는 성능을 확보한다.
Optical interconnection networks, as enabled by recent advances in silicon photonic device and fabrication technology, have the potential to address on-chip and off-chip communication bottlenecks in many-core systems. Although several designs have shown superior power efficiency and performance compared to electrical alternatives, these networks will not scale to the thousands of cores required in the future. In this paper, we introduce Hermes, a hybrid network composed of an optimized broadcast for power-efficient low-latency global-scale coordination and circuit-switch sub-networks for high-throughput data delivery. This network will scale for use in thousand core chip systems. At the physical level, SoI-based adiabatic coupler has been designed to provide low-loss and compact optical power splitting. Based on the adiabatic coupler, a topology based on 2-ary folded butterfly is designed to provide linear power division in a thousand core layout with minimal cross-overs. To address the network agility and provide for efficient use of optical bandwidth, a flow control and routing mechanism is introduced to dynamically allocate bandwidth and provide fairness usage of network resources. At the system level, bloom filter-based filtering for localization of communication are designed for reducing global traffic. In addition, a novel greedy-based data and workload migration are leveraged to increase the locality of communication in a NUCA (non-uniform cache access) architecture. First order analytic evaluation results have indicated that Hermes is scalable to at least 1024 cores and offers significant performance improvement and power savings over prior silicon photonic designs.
연구 동기 및 목표
- 대규모 다코어 시스템에서 기존 실리콘 포토닉 인터커넥트의 확장성 한계를 해결한다.
- 1,000개 이상의 코어를 가진 시스템에서 전기 및 전통적 광 인터커넥트의 에너지 비효율성과 지연 병목 현상을 극복한다.
- 글로벌 브로드캐스트에 대해 선형 에너지 스케일링과 저지연을 달성하면서도 국지적 데이터 전송에 대해 고대역폭을 유지한다.
- 데이터 및 워크로드 이동을 통한 통신 국지성 향상을 통해 글로벌 통신 트래픽을 최소화한다.
- 광망 자원을 효율적이고 공정하며 동적으로 할당할 수 있는 시스템 수준 아키텍처를 설계한다.
제안 방법
- 브로드캐스트 네트워크에서 저손실, 소형의 광전력 분배를 위한 새로운 SoI 기반 아디아바틱 커플러 설계.
- 1,024코어 레이아웃에서 최소한의 다중성 간섭과 교차선을 갖는 선형 전력 분배를 가능하게 하는 2-ary 폴드드 버터플라이 토폴로지 구현.
- 장거리 메시지의 고대역폭, 저지연 포인트투포인트 통신을 위한 회로스위치 광네트워크 통합.
- 네트워크 전반에 걸쳐 대역폭을 동적으로 할당하고 공정한 자원 사용을 보장하기 위한 흐름 제어 및 라우팅 메커니즘 개발.
- 글로벌-로컬 인터페이스에서 블룸 필터 기반 필터링을 적용하여 통신을 국지화하고 글로벌 트래픽를 감소시킴.
- NUCA(비균일 캐시 액세스) 아키텍처에서 통신 국지성을 향상시키기 위해 게으른 기반의 데이터 및 워크로드 이동 기법 도입.
실험 결과
연구 질문
- RQ1브로드캐스트 기반 광인터커넥트는 1,024코어까지 효율적으로 확장되며 저전력, 저지연을 유지할 수 있는가?
- RQ2광인터커넥트는 핵심 수에 비례해 지수적 전력 증가 없이 선형 전력 스케일링을 어떻게 달성할 수 있는가?
- RQ3다코어 시스템에서 데이터 및 워크로드 이동을 통해 통신 국지성은 어느 정도 향상될 수 있는가?
- RQ4계층적 설계가 글로벌 통신 오버헤드를 어떻게 감소시키고 네트워크 민첩성을 향상시키는가?
- RQ5최신 기술 대비 제안된 하이브리드 광-전기 네트워크의 성능 및 에너지 효율성 트레이드오프는 어떠한가?
주요 결과
- HERMES는 96% 광전력 분배 효율성으로 선형 전력 스케일링을 달성하여 핵심 수 증가에 따라 성능이 급격히 떨어지는 버스 기반 및 크로스바 설계보다 뚜렷이 뛰어난 성능을 보인다.
- 전력 오버헤드가 O(√N) 수준이므로 최소 1,024코어까지 확장 가능하여 대규모 시스템에서의 효율적 운영을 가능하게 한다.
- 계층적 설계와 최적화된 라우팅을 통해 지연이 O(√N)로 최소화되어 아이리스(Iris)와 같은 이상적 저지연 네트워크의 성능에 가까워지면서도 확장성은 유지한다.
- 전력 제약 하에서 대역폭 스케일링은 O(1) 경향을 보이며, 버스 및 크로스바 네트워크와 같은 고대역폭 설계와 비교해도 동등하거나 뛰어난 성능을 기록한다.
- 블룸 필터 기반 필터링을 통해 글로벌 트래픽가 감소하고 통신이 국지화되어 네트워크 효율성이 향상되고 경쟁이 감소한다.
- 게으운 기반의 데이터 및 워크로드 이동 기법은 통신 국지성을 크게 향상시켜 글로벌 브로드캐스트 의존도를 낮추고 전체 지연 및 에너지 소비를 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.