Skip to main content
QUICK REVIEW

[論文レビュー] Learning Runtime Parameters in Computer Systems with Delayed Experience Injection

Michael Schaarschmidt, Felix Gessert|arXiv (Cornell University)|Oct 31, 2016
Caching and Content Delivery参考文献 15被引用数 8
ひとこと要約

本稿では、リアルタイムの遅延制約下でクラウドデータベースにおけるHTTPキャッシュの有効期限を動的に最適化するため、遅延経験インジェクション(DEI)を用いた正規化された利得関数(NAF)を用いた深層強化学習アプローチ(NAF-DEI)を提案する。非同期的に遅延報酬と次状態情報を取り扱うことで、並列環境下でも88.5%の平均キャッシュヒット率と7.3%の無効化率を達成し、特に高頻度の書き込みワークロード下で統計的ポisson推定器を上回る性能を示した。

ABSTRACT

Learning effective configurations in computer systems without hand-crafting models for every parameter is a long-standing problem. This paper investigates the use of deep reinforcement learning for runtime parameters of cloud databases under latency constraints. Cloud services serve up to thousands of concurrent requests per second and can adjust critical parameters by leveraging performance metrics. In this work, we use continuous deep reinforcement learning to learn optimal cache expirations for HTTP caching in content delivery networks. To this end, we introduce a technique for asynchronous experience management called delayed experience injection, which facilitates delayed reward and next-state computation in concurrent environments where measurements are not immediately available. Evaluation results show that our approach based on normalized advantage functions and asynchronous CPU-only training outperforms a statistical estimator.

研究の動機と目的

  • 強い遅延制約と遅延したパフォーマンスフィードバックを伴うコンピュータシステムにおいて、最適なランタイムパラメータを学習する課題に対処すること。
  • 事前オフライン学習を必要とせず、クラウドデータベースにおけるリアルタイムかつリクエスト単位の設定意思決定を可能にすること。
  • パフォーマンスメトリクスが即座に入手できない並列システムにおける遅延した責任帰属(credit assignment)の困難さを克服すること。
  • 細粒度のランタイムメトリクスを活用した動的パrameterチューニングを実現する、スケーラブルでCPUオンリーの学習手法を開発すること。
  • 深層強化学習が、キャッシュ有効期限予測において従来の統計的推定器を上回ることを実証すること。

提案手法

  • 連続的アクション空間制御のため、正規化利得関数(NAF)を用い、1つのニューラルネットワークが価値関数と利得関数の両方を出力する。
  • 報酬と次状態が即座に入手できない場合に、経験を非同期に保存・処理する「遅延経験インジェクション(DEI)」というメカニズムを導入する。
  • 報酬の形状付けはキャッシュヒット率と無効化率に基づき、ワークロードの混合状況とサービスレベル目標を反映して動的に調整される。
  • システムはリアルタイムで動作し、入力リクエストを処理し、事前学習を経ずにオンラインでポリシーのパラメータを更新する。
  • アルゴリズムはCPUのみで学習されるため、リソース制限のある環境へのデプロイが可能である。

実験結果

リサーチクエスチョン

  • RQ1最小限の学習オーバーヘッドで、遅延したパフォーマンスフィードバックを伴うリアルタイムかつリクエスト単位のパrameterチューニングに深層強化学習を効果的に適用できるか?
  • RQ2パフォーマンスメトリクスが非同期に到着する並列的かつ高スループットなシステムにおいて、遅延報酬と次状態情報は効率的に管理できるか?
  • RQ3さまざまなワークロード下で、DRLベースのコントローラーは、最適なキャッシュ有効期限を予測する統計的推定器を上回ることができるか?
  • RQ4グローバル統計と比較して、細粒度のランタイムメトリクスを用いることで、キャッシュパフォーマンスはどの程度向上するか?
  • RQ5報酬形状付けを用いることで、高いキャッシュヒット率と低い無効化率という相反する目的をどの程度うまくバランスできるか?

主な発見

  • 10%の書き込みワークロード下で、NAF-DEIは平均88.5%のキャッシュヒット率と7.3%の無効化率を達成し、ポisson推定器(79.5%ヒット率、6.8%無効化)を顕著に上回った。
  • 30%の書き込みワークロード下では、NAF-DEIは77.7%のキャッシュヒット率と21.4%の無効化率を達成したのに対し、ポisson推定器は62.6%と15.6%であった。高頻度の書き込みに対して優れたロバストネスを示した。
  • 1,000リクエスト/秒という高い並列性にもかかわらず、運用開始後の数分以内にエージェントは効果的なポリシーを学習した。収束が速いことが示された。
  • 報酬にワークロード混合状況を反映させない場合、TTLは5〜10秒過剰に予測される傾向にあり、動的報酬形状付けの重要性が明らかになった。
  • 報酬をワークロード混合状況(例:負荷が1−w未満になるように)に合わせて調整した場合、TTLは適切に時間経過とともに短くなった。これは適応的行動の証明である。
  • 解析的モデルを必要とせず、キャッシュパフォーマンスと無効化の間で効果的なトレードオフを実現できた。これは、多目的最適化におけるRLの柔軟性を強調するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。