Skip to main content
QUICK REVIEW

[論文レビュー] A Weighted Mutual k-Nearest Neighbour for Classification Mining

Joydip Dhar, Ashaya Shukla|arXiv (Cornell University)|May 14, 2020
Rough Sets and Fuzzy Logic参考文献 7被引用数 6
ひとこと要約

本論文は、ノイズと偽の近傍を低減するために、相互近傍選択と距離重み付き投票を統合することでk-NN分類を向上させる、重み付き相互k近傍(WMkNN)アルゴリズムを提案する。異常値検出によりデータセットを精錬し、確信度測度を用いて近い近傍に注目することで、特にノイズが多く、大規模なデータセットにおいて分類精度が向上する。

ABSTRACT

kNN is a very effective Instance based learning method, and it is easy to implement. Due to heterogeneous nature of data, noises from different possible sources are also widespread in nature especially in case of large-scale databases. For noise elimination and effect of pseudo neighbours, in this paper, we propose a new learning algorithm which performs the task of anomaly detection and removal of pseudo neighbours from the dataset so as to provide comparative better results. This algorithm also tries to minimize effect of those neighbours which are distant. A concept of certainty measure is also introduced for experimental results. The advantage of using concept of mutual neighbours and distance-weighted voting is that, dataset will be refined after removal of anomaly and weightage concept compels to take into account more consideration of those neighbours, which are closer. Consequently, finally the performance of proposed algorithm is calculated.

研究の動機と目的

  • 大規模データセットにおけるノイズと偽の近傍がk-NNの性能を低下させる問題に対処すること。
  • 相互近傍の同定による近傍選択プロセスの精錬を通じて、分類精度を向上させること。
  • 距離重み付き投票を用いて、遠く離れたまたは関係のない近傍の影響を最小限に抑えること。
  • 近傍の信頼性を評価し、モデルの頑健性を高めるための確信度測度を導入すること。
  • ノイズが多く、多様性のあるデータ環境でも、より良い一般化性能を達成すること。

提案手法

  • インスタンス間の相互k近傍を特定することで、相互を認めない、ノイズの可能性がある近傍を除外する。
  • 距離に応じて重みを付ける投票方式を適用し、近い近傍が分類意思決定により大きな寄与するようにする。
  • 近接度と相互包含の両方を基に、各近傍の確信度測度を計算する。
  • 相互でない近傍、または確信度閾値を下回る近傍を除外することで、異常値検出を実施する。
  • 精錬された重み付き近傍からの投票を集約して、最終的な分類を決定する。
  • 実際の状況を模倣するため、ノイズを注入した標準データセットを用いて手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1相互近傍選択は、ノイズの存在下でk-NNの頑健性をどのように向上させるか?
  • RQ2距離重み付き投票は、遠く離れたまたは関係のない近傍の影響をどの程度低減するか?
  • RQ3確信度測度は、偽の近傍や異常値を効果的に特定・除外できるか?
  • RQ4ノイズ環境下での分類精度の観点から、提案されたWMkNN手法は標準k-NNと比べてどの程度優れているか?
  • RQ5相互近傍のプルーニングによるデータセットの精錬は、全体のモデル性能にどのような影響を与えるか?

主な発見

  • WMkNNアルゴリズムは、相互近傍フィルタリングにより、ノイズが多く、距離の遠い近傍の影響を顕著に低減する。
  • 距離重み付き投票により、近くて関連性の高い近傍を優先することで、分類精度が向上する。
  • 確信度測度は、信頼性の低い近傍を効果的に特定し、モデルの頑健性を高める。
  • 標準k-NNと比較して、特にノイズの多いデータセットにおいて、より高い分類精度を達成する。
  • 実験結果から、ノイズを注入した複数のベンチマークデータセットにおいて一貫した性能向上が確認された。
  • 相互近傍検出と重み付けの統合により、分類に適したより精錬され、信頼性の高い近傍集合が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。