Skip to main content
QUICK REVIEW

[論文レビュー] Diversifying Database Activity Monitoring with Bandits

Hagit Grushka-Cohen, Ofer Biller|arXiv (Cornell University)|Oct 23, 2019
Data Stream Mining Techniques参考文献 22被引用数 4
ひとこと要約

本稿では、探索(低リスクユーザーの調査)と活用(高リスクユーザーの注目)のバランスを取ることで、データベース活動監視(DAM)の多様性を高める、バンドイットベースのサンプリング戦略、C–ε–Greedyを提案する。サンプリングを予算制約付き動的マルチアームバンディット(BCD-MAB)問題としてモデル化することで、カバレッジと異常検出の再現率を向上させ、エキスパート知識やベースライン戦略を上回る性能を発揮する。

ABSTRACT

Database activity monitoring (DAM) systems are commonly used by organizations to protect the organizational data, knowledge and intellectual properties. In order to protect organizations database DAM systems have two main roles, monitoring (documenting activity) and alerting to anomalous activity. Due to high-velocity streams and operating costs, such systems are restricted to examining only a sample of the activity. Current solutions use policies, manually crafted by experts, to decide which transactions to monitor and log. This limits the diversity of the data collected. Bandit algorithms, which use reward functions as the basis for optimization while adding diversity to the recommended set, have gained increased attention in recommendation systems for improving diversity. In this work, we redefine the data sampling problem as a special case of the multi-armed bandit (MAB) problem and present a novel algorithm, which combines expert knowledge with random exploration. We analyze the effect of diversity on coverage and downstream event detection tasks using a simulated dataset. In doing so, we find that adding diversity to the sampling using the bandit-based approach works well for this task and maximizing population coverage without decreasing the quality in terms of issuing alerts about events.

研究の動機と目的

  • データベース活動監視(DAM)における静的でエキスパートが設計したポリシーの限界を是正すること。これにより、多様性とリスクカバレッジが制限される。
  • DAMシステムにおける「フィルターバブル効果」を軽減すること。これは、高リスクまたはなじみのあるユーザーしか監視されないことで、概念の変化(concept drift)が見逃される原因となる。
  • 戦略的なサンプリングの多様性を通じて、より広範なユーザーのカバレッジを確保することで、下流の異常検出性能を向上させること。
  • 低リスクユーザーの探索と高リスクユーザーの活用のバランスを取ることで、監査ログにおけるバイアスを回避すること。
  • 動的リスク環境においてエキスパート知識とランダムな探索を統合する、新規で実装可能なアルゴリズムを提案すること。

提案手法

  • 各ユーザーをリスク報酬が時間とともに変化する「アーム」として扱う、予算制約付き動的マルチアームバンディット(BCD-MAB)問題として、データベース活動のサンプリングを再定式化する。
  • 各タイムフレームでサンプリング容量を探索(ε)と活用(1–ε)に分割する、ε–Greedyの変種、C–ε–Greedyを提案する。
  • リスクスコアを報酬関数として使用し、役割の変更や侵害(compromise)に伴いユーザー行動が変化するにつれて動的に更新する。
  • 固定されたタイムフレームあたりのユーザー数に制限されたサンプリング容量を想定し、データベース活動ストリームのシミュレーションにアルゴリズムを適用する。
  • カバレッジと異常検出性能の評価に、実世界のユーザー行動パターンに基づくシミュレーテッドデータセットを用いる。
  • 初期化時にSO知識を活用することで、人間の専門知識を統合し、コールドスタートを回避するとともに、動的適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1バンドイットベースのアプローチは、高リスクイベントの検出を損なわず、データベース活動監視における多様性を向上させることができるか?
  • RQ2探索と活用のバランスが、ユーザー集団のカバレッジと下流の異常検出にどのように影響するか?
  • RQ3変化するユーザーのリスクプロファイルに適応する動的サンプリングポリシーは、静的エキスパートポリシーを上回る性能を発揮するか?
  • RQ4報酬と再現率の観点から、探索(多様性)と活用(リスク検出)の最適なトレードオフは何か?
  • RQ5エキスパート知識とランダム探索を組み合わせた手法は、純粋にランダムまたはオラクルベースのポリシーに比べて優れた性能を発揮できるか?

主な発見

  • 20%の探索(ε = 0.8)を採用したC–ε–Greedyは、オラクル知識ポリシーを上回り、危険な活動の収集で20%高い報酬を達成した。
  • ランダムサンプリングは88%の高い異常再現率を達成したが、報酬は最悪であり、無差別な探索のコストを示している。
  • SO知識ポリシーは、ユーザーの10%しか監視しなかったため、異常の8.5%しか検出できず、静的ポリシーの危険性を浮き彫りにした。
  • リスクに比例するサンプリング(Gibbs-by-risk)は56%の異常再現率にとどまり、C–ε–Greedyの67–83%に比べて著しく低いことが明らかになった。
  • 20%の探索を採用したC–ε–Greedyは、250タイムフレーム未満で全ユーザーのカバレッジ(1ユーザーあたり2回のサンプリング)を達成し、純粋なランダム法やGibbs法を上回った。
  • アルゴリズムは初期化の質に強く、静的ポリシーとは異なり、初期監視後に高リスク化したユーザーを検出できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。