Skip to main content
QUICK REVIEW

[論文レビュー] Missing Data Prediction and Classification: The Use of Auto-Associative Neural Networks and Optimization Algorithms

Collins Achepsah Leke, Bhekisipho Twala|arXiv (Cornell University)|Mar 21, 2014
Anomaly Detection Techniques and Applications参考文献 30被引用数 8
ひとこと要約

本稿では、遺伝的アルゴリズム(GA)、シミュレーテッド・アニーリング(SA)、粒子群最適化(PSO)、ランダムフォレスト(RF)、およびネガティブ・セレクション(NS)の5つのアルゴリズムで最適化された自己符号化ニューラルネットワーク(AANN)を用いて、欠損データの補完と分類精度の向上を図る新しい手法を提案する。この手法は、AANNを用いて既知のデータに基づいて誤差関数を最小化することで、データのパターンを学習し、欠損値を再構築する。ベンチマークデータセット全体で、RFで最適化されたAANNが予測および分類精度において最も優れた結果を示した。

ABSTRACT

This paper presents methods which are aimed at finding approximations to missing data in a dataset by using optimization algorithms to optimize the network parameters after which prediction and classification tasks can be performed. The optimization methods that are considered are genetic algorithm (GA), simulated annealing (SA), particle swarm optimization (PSO), random forest (RF) and negative selection (NS) and these methods are individually used in combination with auto-associative neural networks (AANN) for missing data estimation and the results obtained are compared. The methods suggested use the optimization algorithms to minimize an error function derived from training the auto-associative neural network during which the interrelationships between the inputs and the outputs are obtained and stored in the weights connecting the different layers of the network. The error function is expressed as the square of the difference between the actual observations and predicted values from an auto-associative neural network. In the event of missing data, all the values of the actual observations are not known hence, the error function is decomposed to depend on the known and unknown variable values. Multi-layer perceptron (MLP) neural network is employed to train the neural networks using the scaled conjugate gradient (SCG) method. Prediction accuracy is determined by mean squared error (MSE), root mean squared error (RMSE), mean absolute error (MAE), and correlation coefficient (r) computations. Accuracy in classification is obtained by plotting ROC curves and calculating the areas under these. Analysis of results depicts that the approach using RF with AANN produces the most accurate predictions and classifications while on the other end of the scale is the approach which entails using NS with AANN.

研究の動機と目的

  • 機械学習データセットにおける欠損データの課題に対処し、モデル性能の低下を防ぐこと。
  • 最適化アルゴリズムと組み合わせた自己符号化ニューラルネットワーク(AANN)を用いた、欠損値の推定のための堅牢なフレームワークを開発すること。
  • GA、SA、PSO、RF、NSの5つの最適化手法が、AANNを用いた欠損データ補完の性能向上にどの程度効果的であるかを比較すること。
  • 標準指標を用いて、最適化されたAANNが下流の予測および分類タスクに与える影響を評価すること。
  • 欠損データ推定および分類の分野で、最も効果的な最適化手法とAANNの組み合わせを同定すること。

提案手法

  • 完全な入出力ペairからデータパターンを学習するために、スケーリング共役勾配(SCG)法を用いた多層パーセプトロン(MLP)で自己符号化ニューラルネットワーク(AANN)を訓練する。
  • 誤差関数は、実際の値と予測値の差の二乗和として定義され、既知および未知の成分に分解されることで、欠損データの処理が可能になる。
  • GA、SA、PSO、RF、NSの5つの最適化アルゴリズムを用いて、AANNの重みを調整することで誤差関数を最小化する。各アルゴリズムは独立してテストされた。
  • 予測精度は平均二乗誤差(MSE)、平均二乗根誤差(RMSE)、平均絶対誤差(MAE)、相関係数(r)を用いて評価される。
  • 分類性能は受信器操作特性(ROC)曲線分析および曲線下の面積(AUC)によって評価される。
  • このフレームワークにより、同じ最適化済みAANNモデルを用いて、欠損値の補完とその後の分類が可能になる。

実験結果

リサーチクエスチョン

  • RQ1自己符号化ニューラルネットワーク(AANN)と組み合わせた場合、どの最適化アルゴリズムが欠損データの補完において最も高い正確性を示すか?
  • RQ2最適化アルゴリズムをAANNに統合することで、欠損データが存在する状況下での予測精度にどのような影響を与えるか?
  • RQ3GA、SA、PSO、RF、NSの各手法が、AANNの最適化において、欠損データ推定の分野でどのように比較されるか?
  • RQ4補完されたデータの品質が、下流の分類性能にどのように影響を与えるか?
  • RQ5ランダムフォレストを最適化手法として用いることで、他のメタヒューリスティックと比較してAANNの性能が顕著に向上するか?

主な発見

  • RFで最適化されたAANNは、テストされたデータセット全体で予測精度が最も高く、MSE、RMSE、MAEの値が最小であった。
  • ネガティブ・セレクション(NS)アルゴリズムは最も精度の低い予測を生み出し、他の最適化手法と比較して最も高い誤差値を示した。
  • RF-AANNモデルの相関係数(r)は、他の手法と比較して一貫して高く、予測値と実際の値との間に強い線形関係があることを示した。
  • 分類性能はRF-AANNが最も優れており、ROC曲線下の面積(AUC)が最も高く、優れた識別能力を示した。
  • PSOおよびGAのバージョンは中程度の性能を示し、NSを上回ったが、RFに劣った。両方のタスクで補完および分類の両面で同様の傾向が見られた。
  • 最適化アルゴリズムを用いることで、非最適化ベースラインと比較してAANNの性能が顕著に向上した。特にRFは、最も堅牢な改善効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。