Skip to main content
QUICK REVIEW

[논문 리뷰] Experience-driven Networking: A Deep Reinforcement Learning based Approach

Zhiyuan Xu, Jian Tang|arXiv (Cornell University)|2018. 01. 17.
Software-Defined Networks and 5G참고 문헌 17인용 수 50
한 줄 요약

DRL-TE는 모델 프리이며 DRL 기반의 트래픽 엔지니어링 프레임워크로, TE 인식 탐색과 우선 순위 경험 재생을 사용하여 다이나믹 네트워크에서 엔드투엔드 유용성, 지연 및 처리량을 최적화하고, ns-3 시뮬레이션에서 baselines와 DDPG를 능가합니다.

ABSTRACT

Modern communication networks have become very complicated and highly dynamic, which makes them hard to model, predict and control. In this paper, we develop a novel experience-driven approach that can learn to well control a communication network from its own experience rather than an accurate mathematical model, just as a human learns a new skill (such as driving, swimming, etc). Specifically, we, for the first time, propose to leverage emerging Deep Reinforcement Learning (DRL) for enabling model-free control in communication networks; and present a novel and highly effective DRL-based control framework, DRL-TE, for a fundamental networking problem: Traffic Engineering (TE). The proposed framework maximizes a widely-used utility function by jointly learning network environment and its dynamics, and making decisions under the guidance of powerful Deep Neural Networks (DNNs). We propose two new techniques, TE-aware exploration and actor-critic-based prioritized experience replay, to optimize the general DRL framework particularly for TE. To validate and evaluate the proposed framework, we implemented it in ns-3, and tested it comprehensively with both representative and randomly generated network topologies. Extensive packet-level simulation results show that 1) compared to several widely-used baseline methods, DRL-TE significantly reduces end-to-end delay and consistently improves the network utility, while offering better or comparable throughput; 2) DRL-TE is robust to network changes; and 3) DRL-TE consistently outperforms a state-ofthe-art DRL method (for continuous control), Deep Deterministic Policy Gradient (DDPG), which, however, does not offer satisfying performance.

연구 동기 및 목표

  • 동적 네트워크에서 트래픽 엔지니어링에 대한 모델 프리, 경험 기반 접근 방식의 동기 부여.
  • 명시적 모델 없이 네트워크 다이나믹스와 제어 정책을 학습하는 DRL 기반 제어 프레임워크 개발.
  • TE 인식 탐색과 정책-가치 기반 우선순위 경험 재생을 도입하여 TE를 위한 DRL 최적화.
  • 다수의 토폴로지에서 패킷 수준 ns-3 시뮬레이션으로 접근 검증하고 baselines와 비교.

제안 방법

  • 상태 s = {xk, zk}를 각 세션에 대해 연속 제어 DRL 문제로 TE를 형식화.
  • 모든 세션에 대한 후보 경로들 간의 분할 비율을 행동으로 정의.
  • TE 인식 탐색이 가이드되는 DDPG 기반의 배우-비평가 DRL을 사용하고 기본 TE 솔루션으로.
  • TD 오차와 Q-그래디언트의 이중 우선순위 지표를 갖는 배우-비평가 학습을 위한 우선순위 경험 재생 도입.
  • 안정성을 위한 목표 네트워크를 갖춘 2층 신경망 배우/비평가로 ns-3에서 DRL-TE 구현.
  • NSFNET, ARPANET, BRITE-생성 토폴로지에서 Shortest Path, Load Balance, NUM-TE 및 DDPG에 대해 평가.

실험 결과

연구 질문

  • RQ1정확한 네트워크 모델 없이도 모델 프리 DRL 접근 방식이 효과적인 TE 정책을 학습할 수 있는가?
  • RQ2TE 인식 탐색과 우선순위 경험 재생이 연속 TE 문제에 대해 DRL 성능을 향상시키는가?
  • RQ3DRL-TE는 엔드-투-엔드 지연, 처리량 및 전체 네트워크 유틸리티 측면에서 전통적 방법과 DDPG에 비해 어떻게 성능을 보이는가?
  • RQ4네트워크 조건과 토폴로지가 바뀔 때 DRL-TE 프레임워크가 얼마나 견고한가?

주요 결과

  • DRL-TE는 NSFNET, ARPANET, BRITE 토폴로지에서 SP, LB, NUM, DDPG에 비해 엔드 투 엔드 지연을 크게 줄였으며(예: NSF에서 최대 74.6% 지연 감소).
  • DRL-TE는 NSF 토폴로지에서 SP, LB, NUM, DDPG 대비 평균 지연 감소율이 각각 55.4%, 47.1%, 70.5%, 44.2%를 달성.
  • DRL-TE는 TE 시나리오에서 연속 제어를 위한 최첨단 DRL 방법(DDPG)을 지속적으로 능가한다.
  • DRL-TE는 네트워크 변화에 강인함을 보이고 처리량은 더 좋거나 비슷하며 네트워크 유틸리티를 향상시킨다.
  • 프레임워크에는 새로운 TE 인식 탐색(base TE 솔루션이 탐색을 안내)과 배우-비평가 우선순위 경험 재생(TD 오차와 Q-그래디언트 기반의 두 부분 우선순위)이 포함된다.
  • NSFNET/ARPANET 결과는 다양한 트래픽 수요에서 엔드-투-엔드 유틸리티와 지연의 눈에 띄는 증가를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.