Skip to main content
QUICK REVIEW

[論文レビュー] Toward Packet Routing with Fully-distributed Multi-agent Deep Reinforcement Learning

Xinyu You, Xuanjie Li|arXiv (Cornell University)|May 9, 2019
Software-Defined Networks and 5G参考文献 36被引用数 14
ひとこと要約

本稿では、各ルーターにLSTMベースのQネットワークを搭載した完全分散型マルチエージェント強化学習フレームワークDQRCを提案する。局所的履歴、保留中パケット情報、周期的な隣接ノード状態共有を組み込むことで、バックプレッシャーと比較して平均パケット到着時間を50%以上短縮する。動的トポロジーにおいて、混雑度認識と最短パスルーティングのバランスを図る。

ABSTRACT

Packet routing is one of the fundamental problems in computer networks in which a router determines the next-hop of each packet in the queue to get it as quickly as possible to its destination. Reinforcement learning (RL) has been introduced to design autonomous packet routing policies with local information of stochastic packet arrival and service. However, the curse of dimensionality of RL prohibits the more comprehensive representation of dynamic network states, thus limiting its potential benefit. In this paper, we propose a novel packet routing framework based on \emph{multi-agent} deep reinforcement learning (DRL) in which each router possess an \emph{independent} LSTM recurrent neural network for training and decision making in a \emph{fully distributed} environment. The LSTM recurrent neural network extracts routing features from rich information regarding backlogged packets and past actions, and effectively approximates the value function of Q-learning. We further allow each route to communicate periodically with direct neighbors so that a broader view of network state can be incorporated. Experimental results manifest that our multi-agent DRL policy can strike the delicate balance between congestion-aware and shortest routes, and significantly reduce the packet delivery time in general network topologies compared with its counterparts.

研究の動機と目的

  • パケットルーティングにおける強化学習の次元の呪いを克服し、豊富な状態表現を有するスケーラブルで分散型の学習を可能にする。
  • 局所的観測と最小限の協調行動のみを用いて、最短パス効率と混雑回避のバランスを取る完全分散型ルーティングポリシーを設計する。
  • 深層学習を活用して正確な遅延推定と適応的意思決定を可能にすることで、従来のQルーティングおよびバックプレッシャー手法を改善する。
  • 通信間隔およびアーキテクチャ的要素(LSTM、共有状態)が動的ネットワークトポロジーにおけるルーティング性能に与える影響を評価する。

提案手法

  • 各ルーターは、HOLパケットの宛先、保留中パケット数、行動履歴、隣接ノードキュー状態を含む高次元入力を処理するため、長短記憶(LSTM)再帰ニューラルネットワークを搭載したディープQネットワークを採用する。
  • LSTMネットワークはQ学習のQ値関数を近似し、時間経過に伴うルーティング意思決定および混雑パターンの時系列モデリングを可能にする。
  • ルーターは直接接続された隣接ノードと周期的に通信し、キュー長および宛先情報を共有することで、中央集権的制御なしに局所的状態認識を拡張する。
  • 報酬信号はパケット到着時間の逆数として定義され、エンドツーエンド遅延を最小化する方向にポリシー学習を誘導する。
  • フレームワークは完全に分散型に訓練され、各エージェントが局所的観測と共有状態更新のみを用いて独立して学習する。
  • アブレーションスタディでは、LSTM、通信、入力表現の寄与を、これらの要素を有する・ないバージョンのDQRCを比較することで評価する。

実験結果

リサーチクエスチョン

  • RQ1DRLエージェントにLSTMを組み込むことで、標準的なQネットワークと比較してルーティングポリシー学習にどのような向上が見られるか?
  • RQ2周期的なエージェント間通信が、到着時間および混雑制御の観点でルーティング性能に与える影響は何か?
  • RQ3DQRCは、さまざまなネットワークトポロジーおよびトラフィックパターンにおいて、Qルーティングやバックプレッシャーといったベースライン手法と比較してどのように異なるか?
  • RQ4入力特徴の設計(例:HOL、バックログ、隣接ノード状態)が、ルーティングポリシーの学習効率および最終的性能にどの程度影響を与えるか?

主な発見

  • DQRCは、さまざまなネットワークトポロジーおよびトラフィック条件において、バックプレッシャーと比較して平均パケット到着時間を50%以上短縮する。
  • 通信間隔が長くなるに従い平均到着時間が徐々に増加するが、5ms間隔でもバックプレッシャーの性能の半分未満に保たれるため、非リアルタイム環境でも堅牢であることが示された。
  • LSTM層を削除すると平均到着時間が10%増加し、時間的依存性および混雑トレンドのモデリングにおいてその重要性が確認された。
  • エージェント間通信を排除するか、現在の宛先情報のみを入力に用いると、顕著な性能低下が生じ、共有状態情報の価値が裏付けられた。
  • DQR(入力の簡素化版)とQルーティングは同等の性能を示し、Qテーブルの単純なニューラルネットワーク近似では、より豊かな入力特徴がなければ遅延推定の改善が得られないことが示された。
  • 提案されたDQRCフレームワークは、最短パスルーティングと混雑度認識フォワーディングの両方のバランスをより良く達成し、動的環境下でQルーティングおよびバックプレッシャーを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。