Skip to main content
QUICK REVIEW

[논문 리뷰] An Energy-Aware Online Learning Framework for Resource Management in Heterogeneous Platforms

Sumit K. Mandal, Ganapati Bhat|arXiv (Cornell University)|2020. 03. 20.
Parallel Computing and Optimization Techniques인용 수 4
한 줄 요약

이 논문은 에너지 소비를 최소화하면서 성능을 유지하는 동안 이질적인 모바일 플랫폼에서 자원 관리 정책을 동적으로 적응시키기 위한 온라인 복제 학습(Online-IL) 프레임워크를 제안한다. 오프라인으로 훈련된 정책과 실시간 전력-성능 모델을 활용해 강력한 감독을 제공함으로써, Online-IL은 런타임 오버헤드를 최소화하고 에너지 절약과 성능 향상 효과를 극대화하면서도, 새로운 애플리케이션에 대해 최적의 전압/주파수 및 코어 구성 정책을 효율적으로 학습한다.

ABSTRACT

Mobile platforms must satisfy the contradictory requirements of fast response time and minimum energy consumption as a function of dynamically changing applications. To address this need, system-on-chips (SoC) that are at the heart of these devices provide a variety of control knobs, such as the number of active cores and their voltage/frequency levels. Controlling these knobs optimally at runtime is challenging for two reasons. First, the large configuration space prohibits exhaustive solutions. Second, control policies designed offline are at best sub-optimal since many potential new applications are unknown at design-time. We address these challenges by proposing an online imitation learning approach. Our key idea is to construct an offline policy and adapt it online to new applications to optimize a given metric (e.g., energy). The proposed methodology leverages the supervision enabled by power-performance models learned at runtime. We demonstrate its effectiveness on a commercial mobile platform with 16 diverse benchmarks. Our approach successfully adapts the control policy to an unknown application after executing less than 25% of its instructions.

연구 동기 및 목표

  • 알 수 없고 변화하는 워크로드를 가진 이질적인 모바일 SoC에서 동적이고 에너지 효율적인 자원 관리의 과제를 해결하기 위해.
  • 오프라인 정책의 한계와 비효율적인 강화 학습을 극복하기 위해, 런타임 중 새로운 애플리케이션에 빠르게 적응할 수 있도록 하기 위해.
  • 성능을 높이기 위해 시도-오류 학습에 의존하지 않고도 모바일 플랫폼에서 에너지 소비를 줄이고 반응 시간을 향상시키기 위해.
  • 정책 적응에 있어 높은 정확도를 유지하면서도 런타임 및 스토리지 오버헤드를 최소화하기 위해.
  • 실제 상용 모바일 플랫폼에서 실세계 벤치마크를 사용하여 온라인 복제 학습의 효과성을 입증하기 위해.

제안 방법

  • 프레임워크는 알려진 응용 프로그램 행동을 기반으로 초기화된 오프라인 정책을 온라인 정책 학습의 기반으로 사용한다.
  • 런타임 중 워크로드 메타데이터(예: 명령어, 메모리 액세스)가 수집되어 구성 평가를 안내한다.
  • 분석 기반 전력-성능 모델이 후보 구성 평가를 위해 빠르고 정확한 감독을 제공하며, 전체 실행 없이도 가능하다.
  • 신경망 정책은 이 모델 기반 감독 피드백을 사용해 역전파를 통해 업데이트되어 제어 결정을 정교화한다.
  • 시스템은 에포크 단위로 온라인 적응을 수행하며, 새로운 학습 예제 기반으로 주기적인 모델 업데이트와 정책 정밀 조정을 수행한다.
  • 효율적인 샘플링과 희박한 역전파 업데이트(매 100 에포크마다)를 통해 런타임 오버헤드를 최소화한다.

실험 결과

연구 질문

  • RQ1온라인 복제 학습 접근법은 런타임 오버헤드를 최소화하면서도, 새로운 모바일 애플리케이션에 대해 자원 관리 정책을 효과적으로 적응시킬 수 있는가?
  • RQ2Energy efficiency와 실행 시간 측면에서 Online-IL은 기존 게이브너(예: powersave, interactive)와 비교해 어떻게 성능을 냈는가?
  • RQ3알 수 없는 워크로드에 대해 Online-IL은 DyPO와 같은 오프라인 학습 기법보다 얼마나 뛰어나게 성능을 냈는가?
  • RQ4실시간 전력-성능 모델 통합이 표준 강화 학습과 비교해 학습 효율성을 얼마나 향상시키는가?
  • RQ5실제 모바일 플랫폼에서 Online-IL의 누적 런타임 및 스토리지 오버헤드는 얼마인가?

주요 결과

  • 제안된 Online-IL 프레임워크는 미리 알 수 없는 애플리케이션에 대해 DyPO 오프라인 방법 대비 평균 6.39%의 에너지 소비 감소와 15.24%의 실행 시간 향상을 달성한다.
  • Kmeans-BML 동시 워크로드에서 Online-IL은 powersave 게이브너 대비 에너지를 5% 감소시키고 실행 시간을 25% 향상시킨다.
  • 벤치마크 전반에서 Online-IL은 powersave 게이브너 대비 평균 24% 빠른 실행 속도와 10% 이상 낮은 에너지 소비를 기록한다.
  • 정책 평가에 대해 런타임 오버헤드는 0.06–0.12%에 불과하고, 역전파 업데이트에선 1% 미만이며, 학습 버퍼에 대해 18KB의 스토리지 오버헤드가 발생한다.
  • 강화 학습과 비교해, Spectral 벤치마크에서 Online-IL는 최적의 정책 학습을 위해 단 한 번의 역전파 단계만 필요로 하였고, RL은 여덟 단계가 지난 후에도 수렴하지 못했다.
  • 응용 프로그램의 지시어 실행 비율이 25% 미만일 때도 Online-IL은 빠른 수렴을 보이며 미리 알 수 없는 애플리케이션에 성공적으로 적응한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.