Skip to main content
QUICK REVIEW

[論文レビュー] Opportunistic View Materialization with Deep Reinforcement Learning

Xi Liang, Aaron J. Elmore|arXiv (Cornell University)|Mar 4, 2019
Cloud Computing and Resource Management参考文献 30被引用数 22
ひとこと要約

本稿では、メインメモリ型OLAPシステムにおけるインナージョインビューの機会的物化のための深層強化学習フレームワークDQMを提案する。アイドルタイム中に非同期的でポリシーに依存しない強化学習と反事後ペaired実験を用いることで、ヒューリスティクスやカーディナリティ推定に依存せずに、適応的で動的変化に柔軟に対応できるビュー作成および削除方針を学習する。性能は近似的に最適なベースラインと同等であり、ワークロードの変化にも即座に適応可能である。

ABSTRACT

Carefully selected materialized views can greatly improve the performance of OLAP workloads. We study using deep reinforcement learning to learn adaptive view materialization and eviction policies. Our insight is that such selection policies can be effectively trained with an asynchronous RL algorithm, that runs paired counter-factual experiments during system idle times to evaluate the incremental value of persisting certain views. Such a strategy obviates the need for accurate cardinality estimation or hand-designed scoring heuristics. We focus on inner-join views and modeling effects in a main-memory, OLAP system. Our research prototype system, called DQM, is implemented in SparkSQL and we experiment on several workloads including the Join Order Benchmark and the TPC-DS workload. Results suggest that: (1) DQM can outperform heuristic when their assumptions are not satisfied by the workload or there are temporal effects like period maintenance, (2) even with the cost of learning, DQM is more adaptive to changes in the workload, and (3) DQM is broadly applicable to different workloads and skews.

研究の動機と目的

  • 動的OLAPワークロードにおける静的およびヒューリスティクスベースのビュー物化の限界を解消すること。
  • 仮定やヒューリスティクスに依存せず、実際のクエリ実行フィードバックから学ぶデータ駆動型の適応的ビュー選択を可能にすること。
  • 強化学習を用いて最適な物化および削除方針を学習することで、メインメモリ型OLAPシステムにおけるクエリ遅延を低減すること。
  • ワークロードのモデリングやカーディナリティ推定を明示的に行わず、強化学習がビュー管理方針を効果的に学習できるかどうかを評価すること。
  • DQMが時間的シフトやデータスケイの変化を伴う多様なワークロードに対しても堅牢であることを示すこと。

提案手法

  • DQMは、遅延したパフォーマンスフィードバックに基づいてビュー物化および削除方針を学習する非同期的深層Qネットワーク(DQN)エージェントを採用する。
  • アイドル期間中にペアド反事後実験を実施し、ビューの有無によるクエリ実行時間の差を比較することで、ビュー物化の限界的利得を推定する。
  • 現在の物化済みビューとクエリ特性を符号化した状態表現を用い、行動選択を支援する。
  • クエリ実行時間の短縮に基づく報酬信号を用いることで、有益な意思決定に対する責任帰属(クレジット割り当て)を可能にする。
  • 探索は$ε$-グリーディスケジューリングで管理され、初期学習後に$ε$をゼロに減少させることで方策の安定化を図る。
  • フレームワークはSparkSQLに実装され、TPC-DSやジョインオーダーベンチマークを含む実世界のワークロードで評価されている。

実験結果

リサーチクエスチョン

  • RQ1カーディナリティ推定や手作業で設計されたヒューリスティクスに依存せずに、強化学習が効果的なビュー物化および削除方針を学習できるか?
  • RQ2DQMは、HAWC や Recycler といった最先端のヒューリスティクスベース方針と比較して、変化するワークロードやストレージ制約下でどのように性能を発揮するか?
  • RQ3DQMは、クエリパターンの時間的変化やシフトにどの程度適応できるか?
  • RQ4データおよび計算コストの観点から、学習プロセスはどの程度効率的か?
  • RQ5DQMは、完全な先行予測(perfect foresight)を備えた仮想の最適オラクル方針(Belady*)にどの程度近づけるか?

主な発見

  • HAWC や Recycler が前提する仮定が成り立たない場合や、ワークロードに時間的ダイナミクスが現れる場合、DQMはそれらのヒューリスティクスベース方針を上回る性能を発揮する。
  • 学習および探索コストを含めても、ジョインオーダーベンチマークおよびTPC-DSワークロードの両方で、ヒューリスティクスベースラインより累積クエリ実行時間が短い。
  • 学習後、探索を無効化した状態でDQMは全体のパフォーマンスを約15%向上させ、高いデータ効率と高速収束性を示している。
  • DQMは、完全な先行予測を用いる仮想のオラクル方針であるBelady*と同等のパフォーマンスを達成しており、優れた学習能力を示している。
  • DQMはさまざまなワークロードやデータスケイ分布に対しても堅牢であり、広範な適用性を示している。
  • アイドル時間に実施されるペアド反事後実験により、責任帰属のための強力で信頼性の高い信号が得られ、明示的なワークロードモデリングなしに効果的な学習が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。