Skip to main content
QUICK REVIEW

[論文レビュー] Categorization of interestingness measures for knowledge extraction

Sylvie Guillaume, Dhouha Grissa|arXiv (Cornell University)|Jun 28, 2012
Data Mining Algorithms and Applications参考文献 50被引用数 7
ひとこと要約

本稿では、21の事前に定義された理論的性質への適合性に基づき、61の関連ルールの興味深さ尺度の正式な分類を提示する。2つのクラスタリング手法—ウォード法の階層的クラスタリングとk-means—を用いて実施された。研究では、尺度の行動的性質が類似する7つの異なるクラスを同定し、知識抽出における適切な尺度選択のための原則的フレームワークを提供する。これにより、ユーザーの選択の複雑さが軽減され、ルールの関連性フィルタリングが向上する。

ABSTRACT

Finding interesting association rules is an important and active research field in data mining. The algorithms of the Apriori family are based on two rule extraction measures, support and confidence. Although these two measures have the virtue of being algorithmically fast, they generate a prohibitive number of rules most of which are redundant and irrelevant. It is therefore necessary to use further measures which filter uninteresting rules. Many synthesis studies were then realized on the interestingness measures according to several points of view. Different reported studies have been carried out to identify "good" properties of rule extraction measures and these properties have been assessed on 61 measures. The purpose of this paper is twofold. First to extend the number of the measures and properties to be studied, in addition to the formalization of the properties proposed in the literature. Second, in the light of this formal study, to categorize the studied measures. This paper leads then to identify categories of measures in order to help the users to efficiently select an appropriate measure by choosing one or more measure(s) during the knowledge extraction process. The properties evaluation on the 61 measures has enabled us to identify 7 classes of measures, classes that we obtained using two different clustering techniques.

研究の動機と目的

  • 関連ルールマイニングにおける「良い」興味深さ尺度を特徴付ける性質のセットを拡張し、形式的に定義すること。
  • 61の既存の興味深さ尺度が、形式化されたこれらの性質の下でどのように振る舞うかを分析すること。
  • クラスタリング手法を用いて、性質プロファイルが類似する尺度の自然なグループ(クラス)を同定すること。
  • 検出された尺度クラスの意味的解釈を提供し、ユーザーが関連する尺度を選択する際により良いガイダンスを得られるようにすること。
  • 先行研究と照らし合わせて分類を検証し、実用的なデータマイニング応用に向けたコンSENSUSベースの分類体系を提供すること。

提案手法

  • 興味深さ尺度に望ましいとされる21の理論的性質(対称性、単調性、特定の変換に対する不変性など)を形式化する。
  • 61の尺度 × 21の性質の行列を作成し、各エントリはその尺度が特定の性質を満たすかどうかを示す。
  • ウォード法を用いた凝集型階層的クラスタリングを適用し、性質の類似性に基づいて尺度のネストされたグループを検出する。
  • 非階層的代替手法として、修正版k-meansクラスタリングアルゴリズムを用いて階層的結果を検証する。
  • 2つのクラスタリング手法の一致に基づいてコンセンサス分類を導出し、結果の堅牢性を確保する。
  • 最終的な分類を意味的解釈し、尺度クラスとその背後にある統計的または論理的行動を結びつける。

実験結果

リサーチクエスチョン

  • RQ161の興味深さ尺度のうち、21の形式化された性質において一貫した振る舞いを示すのはどれか?
  • RQ2クラスタリング手法は、共有される性質プロファイルに基づいて尺度の自然なグループを明らかにできるか?
  • RQ3得られた尺度クラスは、ルールマイニングにおける意味的なカテゴリに対応しているか?
  • RQ4ウォード法とk-meansの間でクラスタリング結果はどのように比較できるか?また、コンセンサスは得られているか?
  • RQ5同定されたクラスは、既存の文献と照らし合わせて検証可能であり、実際の尺度選択を支援するために利用可能か?

主な発見

  • コンセンサスクラスタリングを通じて、7つの明確に区別できる興味深さ尺度のクラスが同定された。各クラスは類似した行動的性質を持つグループを表す。
  • ウォード法とk-meansによるクラスタリング結果は強く一致しており、同定されたクラスの堅牢性が裏付けられた。
  • Lift、Kulczynski、Jaccardといった尺度は、対称的で信頼度に基づくルール強度評価を特徴とするクラスにグループ化された。
  • Piatetsky-ShapiroやLeverageといった尺度を含む別クラスは、独立性からの逸脱を強調し、レアイベントに敏感である。
  • 相互情報量とJ-Measureを含むクラスは、情報理論的基礎に立脚し、同時分布のパターンに敏感である点で特徴づけられる。
  • 本分類は、ユーザーが望むルールのフィルタリング基準(例:新規性、強度、信頼性)に一致する尺度を選択するのを支援する意味的フレームワークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。