Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Approach for Mapping Applications to Dataflow-Based Coarse-Grained Reconfigurable Array

Andre Xian Ming Chang, Parth Khopkar|arXiv (Cornell University)|2022. 05. 26.
Parallel Computing and Optimization Techniques인용 수 4
한 줄 요약

이 논문은 코arse-grained 재구성가능 어레이(CGRA) 스트리밍 엔진에 데이터플로우 애플리케이션을 자동으로 매핑하기 위해 글로벌 그래프 어텐션(GGA)과 출력 마스킹을 통합한 강화학습(RL) 프레임워크를 제안한다. 이 방법은 Proximal Policy Optimization(PPO)를 사용하여 최적의 명령어 스케줄링을 학습하며, 마스킹을 통한 성능 향상으로 10% 향상된 클럭 사이클 성능과 20% 높은 보상 수준을 달성하여, 희소 탐색 공간에서 기준 방법들을 크게 능가한다.

ABSTRACT

The Streaming Engine (SE) is a Coarse-Grained Reconfigurable Array which provides programming flexibility and high-performance with energy efficiency. An application program to be executed on the SE is represented as a combination of Synchronous Data Flow (SDF) graphs, where every instruction is represented as a node. Each node needs to be mapped to the right slot and array in the SE to ensure the correct execution of the program. This creates an optimization problem with a vast and sparse search space for which finding a mapping manually is impractical because it requires expertise and knowledge of the SE micro-architecture. In this work we propose a Reinforcement Learning framework with Global Graph Attention (GGA) module and output masking of invalid placements to find and optimize instruction schedules. We use Proximal Policy Optimization in order to train a model which places operations into the SE tiles based on a reward function that models the SE device and its constraints. The GGA module consists of a graph neural network and an attention module. The graph neural network creates embeddings of the SDFs and the attention block is used to model sequential operation placement. We show results on how certain workloads are mapped to the SE and the factors affecting mapping quality. We find that the addition of GGA, on average, finds 10% better instruction schedules in terms of total clock cycles taken and masking improves reward obtained by 20%.

연구 동기 및 목표

  • 동기식 데이터플로우(SDF) 그래프를 아키텍처 제약 조건이 있는 스트리밍 엔진(SE) 타일에 수동으로 매핑하는 데 있어 NP-완전이고 희소적이며 복잡한 문제를 해결한다.
  • 자동화된 비지도 학습 기반 최적화를 통해 SE 애플리케이션 매핑에 필요한 전문 지식과 수동 작업을 줄인다.
  • 어텐션 메커니즘과 액션 마스킹을 통합하여 희소 탐색 공간에서 매핑 품질과 샘플 효율성을 향상시킨다.
  • 다양한 IR 그래프에서의 사전 훈련과 미세조정을 통해 다양한 워크로드 간 일반화를 가능하게 한다.
  • SE 툴체인에 RL 매핑기 통합을 통해 개발 속도를 가속화하고 스케줄링의 상호 교환 관계 탐색을 자동화한다.

제안 방법

  • SDF 노드의 타일 및 슬롯 배치를 선택하는 정책 네트워크를 훈련하기 위해 강화학습 알고리즘으로 Proximal Policy Optimization(PPO)를 사용한다.
  • SDF 임베딩을 위한 그래프 신경망(GNN)과 배치 중 노드 간 의존성 모델링을 위한 멀티헤드 어텐션 메커니즘을 통합한 글로벌 그래프 어텐션(GGA) 모듈을 도입한다.
  • 각 단계에서 유효하지 않은 액션(예: 과도하게 제약된 또는 데이터에 의존하는 배치)을 마스킹하여 탐색 공간을 줄이고 학습 안정성을 향상시킨다.
  • 타일 메모리, 데이터플로우 의존성, 타일 간 지연을 모델링한 시뮬레이션된 SE 환경을 RL 환경으로 사용하여 보상을 계산한다.
  • 노드 처리 순서를 위상 정렬(정렬된 반복 순서)로 적용하여, 후속자 노드가 반드시 조상 노드 이후에 배치되도록 하여 학습을 향상시킨다.
  • 랜덤 IR 그래프에서의 사전 훈련 후, FFT와 같은 특정 워크로드에서의 미세조정을 통해 지식을 전이하고 수렴 속도를 향상시킨다.

실험 결과

연구 질문

  • RQ1딥 강화학습 프레임워크는 수동 감독 없이 CGRA의 광범위하고 희소한 명령어 매핑 탐색 공간을 효과적으로 탐색할 수 있는가?
  • RQ2그래프 어텐션 메커니즘(GGA)을 통합함으로써 RL 에이전트의 데이터플로우 의존성 및 배치 품질에 대한 추론 능력은 어떻게 향상되는가?
  • RQ3무효한 액션의 출력 마스킹이 SE 매핑 작업에서 학습 효율성과 최종 보상에 얼마나 기여하는가?
  • RQ4노드 반복 순서(예: 위상 정렬 대비 무작위 순서)는 학습된 매핑의 성공률과 품질에 어떤 영향을 미치는가?
  • RQ5사전 훈련된 RL 모델을 새로운 워크로드에 대해 효과적으로 미세조정하여, 초기 훈련부터 시작하는 것보다 더 빠른 수렴과 향상된 성능을 달성할 수 있는가?

주요 결과

  • 글로벌 그래프 어텐션(GGA) 모듈의 추가로, 다양한 그래프 복잡도와 SE 구성에서 총 클럭 사이클 수 기준으로 최고 스케줄링 성능이 10% 향상되었다.
  • 출력 마스킹을 통해 무효한 액션에 음수 보상을 부여하는 것보다 20% 높은 보상을 확보하였으며, 이는 샘플 효율성과 수렴 안정성 향상에 기여했다.
  • 노드 처리에 위상 정렬 순서를 사용함으로써 더 높은 보상과 더 안정적인 학습이 이루어졌으며, 이는 데이터플로우 의미 체계와 일치하고 예측 부담을 감소시켰기 때문이다.
  • 랜덤 IR 그래프에서의 사전 훈련 후 특정 워크로드(예: FFT)에서의 미세조정은 초기 및 최종 보상 수준이 초기 훈련부터 시작하는 것보다 높았으며, 이는 전이 학습 잠재력이 있음을 보여주었다.
  • RL 매핑기는 조건이 엄격한 64타일 SE 구성에서도 FFT 및 거리 계산과 같은 다양한 워크로드에 대해 유효하고 최적화된 매핑을 성공적으로 찾았으며, 희소 탐색 공간에서 시뮬레이티드 어닐링보다 뛰어난 성능을 보였다.
  • 이 프레임워크는 확장성과 적응성 있는 특성을 보였으며, 수동 작업을 줄이고 애플리케이션 배포 속도를 가속화하기 위해 SE 툴체인에 통합될 잠재력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.