Skip to main content
QUICK REVIEW

[論文レビュー] A Bayesian Approach to Rule Mining

Luis I. Lopera González, Adrian Derungs|arXiv (Cornell University)|Dec 13, 2019
Data Mining Algorithms and Applications参考文献 23被引用数 4
ひとこと要約

本稿では、再帰的ベイズ更新を用いてルールの信頼度を計算する、新しい関連ルールマイニング手法であるベイジアンルールマイニング(BRM)を提案する。この手法により、新たな観測が得られるたびに信頼度が上昇し、支持度の希釈を回避する。頻度ベースの関連ルールマイニング(FRM)とは異なり、BRMは共通の特徴に注目するのではなく、個々のプロセスのダイナミクスに注目することで、まれな意味のあるルールを効果的に抽出する。

ABSTRACT

In this paper, we introduce the increasing belief criterion in association rule mining. The criterion uses a recursive application of Bayes' theorem to compute a rule's belief. Extracted rules are required to have their belief increase with their last observation. We extend the taxonomy of association rule mining algorithms with a new branch for Bayesian rule mining~(BRM), which uses increasing belief as the rule selection criterion. In contrast, the well-established frequent association rule mining~(FRM) branch relies on the minimum-support concept to extract rules. We derive properties of the increasing belief criterion, such as the increasing belief boundary, no-prior-worries, and conjunctive premises. Subsequently, we implement a BRM algorithm using the increasing belief criterion, and illustrate its functionality in three experiments: (1)~a proof-of-concept to illustrate BRM properties, (2)~an analysis relating socioeconomic information and chemical exposure data, and (3)~mining behaviour routines in patients undergoing neurological rehabilitation. We illustrate how BRM is capable of extracting rare rules and does not suffer from support dilution. Furthermore, we show that BRM focuses on the individual event generating processes, while FRM focuses on their commonalities. We consider BRM's increasing belief as an alternative criterion to thresholds on rule support, as often applied in FRM, to determine rule usefulness.

研究の動機と目的

  • データセットのサイズが増加する際、支持度が低下する頻度ベースの関連ルールマイニング(FRM)における支持度の希釈問題を解消すること。
  • 最小支持度閾値の制限により、まれだが一貫性のあるルールを抽出できないFRMの限界を克服すること。
  • 信頼度をルール選択基準として用いる新しい関連ルールマイニングの分類体系—ベイジアンルールマイニング(BRM)—を提唱すること。
  • BRMが個々のプロセスのダイナミクスを明らかにできること、特に異種のデータセットにおいて優れた性能を示すこと。
  • BRMが実世界の応用、例えば社会経済的データや神経内科的リハビリテーション分野での実用性を示すこと。

提案手法

  • 再帰的にベイズの定理を適用することで、観測が追加されるたびにルールの信頼度を更新する、信頼度の増加基準を提案する。
  • 増加信頼度境界、事前情報の懸念なし、および結合前提といった重要な性質を導出することで、ルールの安定性と解釈可能性を保証する。
  • 事前確率、観測データ、尤度に基づく信頼度の更新を用いた、包括的探索型BRMアルゴリズムを実装する。
  • マイニング後のフィルタリング段階を設け、不要なルールを除外する。フィルタリングの選択はアプリケーションの文脈に依存する(例:信頼度の閾値、または結論ごとの最高信頼度)。
  • 信頼度更新式を適用:信頼度 = p × P(データ|ルール) / P(データ)。新しいデータが到着するたびに再帰的に更新される。
  • 合成時系列データ、社会経済的・化学的曝露データ、リハビリテーションにおける患者行動ルーティンの3つのデータセットを用いてBRMを検証する。

実験結果

リサーチクエスチョン

  • RQ1信頼度ベースの基準が、支持度の希釈を回避するための最小支持度閾値に代わってルールマイニングに利用可能か?
  • RQ2FRMが低支持度のため見逃す、まれだが一貫性のあるルールをBRMが効果的に抽出できるか?
  • RQ3FRMが共通性に注目するのに対し、BRMは個々のプロセスのダイナミクスをFRMよりもよく明らかにできるか?
  • RQ4異種のプロセスとまれな出来事を持つ実世界のデータセットにおいて、BRMはどの程度の性能を示すか?
  • RQ5BRMを用いて、行動ルーティンマイニングに基づき、アクティブ型と静的型の患者サブタイプに分類できるか?

主な発見

  • BRMは、データセットのサイズが増大しても、支持度の希釈に苦しまず、まれなルールを効果的に抽出できた。
  • 社会経済的データの実験では、BRMは低所得スコアと高教育水準の間の関連といった、まれだが意味のある関連を同定した。
  • リハビリテーション研究では、BRMは患者をアクティブ型と静的型の行動サブタイプに分類できたが、FRMはそのようなグループ化を検出できなかった。
  • PEP解析の結果、FRMのルールは患者サブセット間で変化しなかった。これは、人口全体の共通性を反映していることを示しており、一方BRMのルールは変化しており、プロセス固有のパターンを明らかにした。
  • BRMの信頼度指標はデータセットのサイズに強く依存せず、プロセスの知識(例えば、期待される頻度比や遷移時間)を用いて調整可能である。
  • フィルタリング戦略はアプリケーションに応じてカスタマイズされるべきである。信頼度の閾値はプロセスの分離に適しており、結論ごとの最高信頼度フィルタは遷移マイニングに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。