Skip to main content
QUICK REVIEW

[論文レビュー] Rough Sets Computations to Impute Missing Data

Fulufhelo V. Nelwamondo, Tshilidzi Marwala|arXiv (Cornell University)|Apr 26, 2007
Rough Sets and Fuzzy Logic参考文献 18被引用数 12
ひとこと要約

本稿では、特徴的関係と下近似・上近似を用いて不完全な意思決定表における欠損値を推定する、粗い集合理論を活用した新しい欠損データ補完手法を提案する。実際のHIVデータベース上で評価した結果、欠損データの補完において最大99.3%の精度を達成し、データの粒度を低くすることで高い効果を示した。

ABSTRACT

Many techniques for handling missing data have been proposed in the literature. Most of these techniques are overly complex. This paper explores an imputation technique based on rough set computations. In this paper, characteristic relations are introduced to describe incompletely specified decision tables.It is shown that the basic rough set idea of lower and upper approximations for incompletely specified decision tables may be defined in a variety of different ways. Empirical results obtained using real data are given and they provide a valuable and promising insight to the problem of missing data. Missing data were predicted with an accuracy of up to 99%.

研究の動機と目的

  • 不完全な意思決定表における欠損データのための計算効率の良い補完技術を開発すること。
  • 特に下近似および上近似を用いた粗い集合理論の、不完全に指定されたデータへの応用を検討すること。
  • 特に欠損値を含む医療データベースを含む実世界データにおいて、粗い集合に基づく補完の性能を評価すること。
  • 複雑なモデルやデータ分布に関する事前仮定を必要としない条件下でも、粗い集合手法が高精度を達成できることを示すこと。

提案手法

  • 本手法は、不完全に指定された意思決定表をモデル化するために特徴的関係を用い、欠損値の推定に向けた下近似および上近似の定義を可能にする。
  • 識別不能関係が、共通する属性値を持つ対象をグループ化するために適用され、近似集合の基礎をなす。
  • 近似プロセスの複雑さを軽減し、解釈可能性を向上させるために、連続的属性を4つのカテゴリに離散化する。
  • 下近似は、ある概念に「必ず属する」とされる対象を含み、上近似は「属する可能性がある」とされる対象を含む。両者は、完全な値を持つ属性の集合を用いて計算される。
  • 同じ概念における下近似および上近似に属する対象群のうち、最も頻度が高く一貫性のある値に基づいて、欠損値が補完される。
  • 本手法は補間や外挿を行わず、完全に指定された観測済みインスタンスとの類似性にのみ依存する。

実験結果

リサーチクエスチョン

  • RQ1粗い集合理論は、実世界の不完全な意思決定表における欠損値の補完に効果的に適用可能か?
  • RQ2下近似および上近似の異なる定義が、欠損データ推定の精度にどのように影響するか?
  • RQ3離散化によるデータの粒度低減は、粗い集合に基づく補完の性能向上に寄与するか?
  • RQ4従来の補完手法(平均値補完やリストワイズ削除など)と比較して、本手法の精度はどの程度か?

主な発見

  • 提案された粗い集合に基づく補完手法は、一般化(離散化済み)HIVデータベースにおいて、欠損値推定で最大99.3%の精度を達成した。
  • 一般化データセットにおける個々の属性の精度は、父親の年齢(98.5%)から教育水準(99.3%)まで変動し、変数全体にわたる優れた性能を示した。
  • 元の(非離散化)データセット(精度74.7%~87.8%)と比較して、本手法は顕著に優れており、粒度低減の利点が明確に示された。
  • 本手法は、複雑なモデルやデータ分布に関する仮定を必要とせず、粗い集合の近似が欠損データを効果的に処理できることを示した。
  • 結果から、類似性に基づく補完が、特に欠損値が他の観測済み属性と相関している場合に、実用的で高精度であることが示唆された。
  • 本手法は、欠損インスタンスが完全に観測されたものと類似している場合に限る。外挿や補間を行わないため、類似しないインスタンスには適用できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。