Skip to main content
QUICK REVIEW

[論文レビュー] Decentralized Learning in Online Queuing Systems

Flore Sentenac, Étienne Boursier|arXiv (Cornell University)|Jun 8, 2021
Age of Information Optimization参考文献 33被引用数 6
ひとこと要約

本稿は、通信なしで集中型の性能を達成しつつ、サーバー率と到着率の比が1を超える場合にシステム安定性を保証する、初めての分散型学習アルゴリズムであるADeQuAを提案する。同期的なシステムパラメータ推定と確率的優位性を用いて、最小限の協調行動でキュー長を有界に保つ。これにより、比が2以上またはe/(e−1)以上を要するno-regretおよびpolicy-regret戦略の限界を克服する。

ABSTRACT

Motivated by packet routing in computer networks, online queuing systems are composed of queues receiving packets at different rates. Repeatedly, they send packets to servers, each of them treating only at most one packet at a time. In the centralized case, the number of accumulated packets remains bounded (i.e., the system is extit{stable}) as long as the ratio between service rates and arrival rates is larger than $1$. In the decentralized case, individual no-regret strategies ensures stability when this ratio is larger than $2$. Yet, myopically minimizing regret disregards the long term effects due to the carryover of packets to further rounds. On the other hand, minimizing long term costs leads to stable Nash equilibria as soon as the ratio exceeds $\frac{e}{e-1}$. Stability with decentralized learning strategies with a ratio below $2$ was a major remaining question. We first argue that for ratios up to $2$, cooperation is required for stability of learning strategies, as selfish minimization of policy regret, a extit{patient} notion of regret, might indeed still be unstable in this case. We therefore consider cooperative queues and propose the first learning decentralized algorithm guaranteeing stability of the system as long as the ratio of rates is larger than $1$, thus reaching performances comparable to centralized strategies.

研究の動機と目的

  • サーバー率対到着率比が2未満の分散型オンラインキューイングシステムにおけるシステム安定性を達成するという未解決問題に取り組む。
  • 率比が2未満の状況ですら、患者的レグルム最小化のもとでも協調が安定性に不可欠であることを示す。
  • 率比が1より大きい場合に強い安定性(有界なキュー長)を保証する分散型学習アルゴリズムを設計・分析する。
  • 提案アルゴリズム下でのキュー長モーメントに対する理論的上限を提供する。
  • 実験的比較を通じて、標準的なno-regret戦略に比べ協調的学習アプローチの優位性を検証する。

提案手法

  • 直接通信なしに、同期ラウンドを通じてキューがシステムパラメータ(到着率およびサービス率)を推定できる分散型アルゴリズムADeQuAを提案する。
  • 正確なパrameter推定に至るまでの時間を有界にする停止時刻τを用い、信頼性の高い意思決定を保証する。
  • 確率的優位性の議論を用い、キュー長が0で吸収されるバイアス付きランダムウォークによって確率的に支配されることを示す。
  • 停止時刻τおよびランダムウォークのモーメントに上限を適用し、キュー長モーメントの多項式境界を導出する。
  • キュー長の成長を制御するため、集中不等式とカップリングの議論を組み合わせた新規な解析フレームワークを導入する。
  • 定理5により理論的保証を確立し、キュー長のr次のモーメントがシステムパrameterの多項式で有界であることを示す。

実験結果

リサーチクエスチョン

  • RQ1サーバー率対到着率比が2未満の状況で、キュー間の通信なしに分散型学習戦略がシステム安定性を達成できるか?
  • RQ2率比が2未満の状況ですら、患者的レグルム最小化のもとでも、分散型キューイングシステムにおける安定性のためには協調が不可欠であるか?
  • RQ3率比が1に限りなく近い状況でも、分散型アルゴリズムが強い安定性(有界なキュー長)を保証できるか?
  • RQ4ADeQuAの性能は、標準的なno-regret戦略およびpolicy-regret戦略と比べて、安定性およびキュー長の増加の観点でどのように異なるか?
  • RQ5提案アルゴリズム下でのキュー長モーメントの理論的上限は何か?

主な発見

  • ADeQuAは、サーバー総率と到着率の比が1を超える任意のシステムにおいて、強い安定性(つまり、有界なキュー長)を保証する。
  • キュー長のr次のモーメントは、システムパラメータの多項式で有界であり、具体的にはO(KN (N^{5/2}K^{5/2}2^{5K^2}/(min(1,Kμ̄)λ̲Δ^5)^{5/4})^r)である。ここでKはキュー数、Nはサーバー数である。
  • パラメータ推定の停止時刻τのモーメントも有限であり、E[τ^r]は同様の多項式表現で有界である。
  • 率比が2未満の状況では、ポリシー・レグルム最小化でも安定性を保証できないため、この領域では協調が本質的であることが示された。
  • 実験的比較により、ADeQuAがno-regret戦略に比べ安定性と収束性で優れていることが確認され、特に低レート領域で顕著である。
  • 解析により、0で吸収されるバイアス付きランダムウォークによる確率的優位性が、ADeQuA下でのキュー長成長の制御に十分であることが立証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。