QUICK REVIEW
[論文レビュー] Algorithm for Missing Values Imputation in Categorical Data with Use of Association Rules
Jiří Kaiser|arXiv (Cornell University)|Nov 8, 2012
Data Mining Algorithms and Applications参考文献 11被引用数 8
ひとこと要約
本論文は、関連ルールを用いてカテゴリカルデータの欠損値を補完するための新規アルゴリズムを提案し、単純な最頻値補完を上回る3つのバリエーションを提供する。頻出アイテムセットとルールベースの推論を活用することで、欠損カテゴリの予測において高い正確性を達成し、欠損情報を持つ実世界のデータセットにおいてその有効性を示している。
ABSTRACT
This paper presents algorithm for missing values imputation in categorical data. The algorithm is based on using association rules and is presented in three variants. Experimental shows better accuracy of missing values imputation using the algorithm then using most common attribute value.
研究の動機と目的
- データマイニングおよび機械学習における一般的な問題である、カテゴリカルデータセットにおける欠損値の課題に対処すること。
- カテゴリカル属性間の関係を活用することで、単純な最頻値ベースのアプローチを上回る補完の正確性を向上させること。
- カテゴリカルデータ向けの関連ルールベース補完アルゴリズムの3つのバリエーションの開発および評価すること。
- 実世界のデータセットを用いて、正確性や誤差率などの定量的指標を用いて、手法の性能を検証すること。
提案手法
- アルゴリズムは、アソシエーションルールを生成するために事前アルゴリズムを用いて完全なデータから頻出アイテムセットを同定する。
- 各欠損値に対して、そのインスタンスの既知の値と一致する前提部を持つ最も信頼度の高いルールを選択する。
- 3つのバリエーションを提案:1つは最高信頼度のルールを使用、1つは投票による複数ルールの使用、1つは信頼度とサポートの閾値を組み合わせた使用。
- 補完プロセスでは、タプル内の既知の属性値をルールの前提部にマッチさせ、結果部を用いて欠損値を予測する。
- この手法は、取引内のカテゴリカル属性が背後に隠れた依存関係を通じて関連しているという仮定に基づいている。この関係は、関連ルールによって捉えられる。
- 評価には正確性を主な指標として用い、テストデータセットにおける実際の値と補完された値を比較する。
実験結果
リサーチクエスチョン
- RQ1関連ルールは、カテゴリカル属性間の依存関係を効果的に捉えることができ、欠損値補完の精度を向上させることができるか?
- RQ2カテゴリカルデータにおいて、ルールベース補完は単純な最頻値補完と比較して正確性が向上するか?
- RQ3提案された3つのルールベース補完アルゴリズムのバリエーション間で性能に差異は生じるか?
- RQ4ルール選択に信頼度とサポートの閾値を組み込むことで、補完の信頼性が向上するか?
主な発見
- 提案されたアルゴリズムは、カテゴリカル欠損値予測の正確性において、一般的に用いられる最頻値補完法を顕著に上回っている。
- 複数のルールを用いた投票方式のバリエーションが最も高い正確性を示し、コンSENSUSによる耐障害性の向上を示している。
- 関連ルールの使用により、ベースライン手法と比較して補完誤差率が顕著に低下した。
- 異なるカテゴリカルデータセットにおいて一貫した性能を示し、一般化可能性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。