[논문 리뷰] Missing Data Prediction and Classification: The Use of Auto-Associative Neural Networks and Optimization Algorithms
이 논문은 유전 알고리즘(GA), 시뮬레이티드 어닐링(SA), 입자 군집 최적화(PSO), 랜덤 포레스트(RF), 그리고 음성 선택(NS) 다섯 가지 알고리즘으로 최적화된 자동인코딩 신경망(AANN)을 사용하여 결측 데이터를 보간하고 분류 정확도를 향상시키는 새로운 접근법을 제안한다. 이 방법은 완전한 입력-출력 쌍에서 데이터 패턴을 학습하고 알려진 데이터 기반 오차 함수를 최소화하여 결측값을 재구성함으로써 작동하며, 랜덤 포레스트(RF)-최적화 AANN가 기준 데이터셋 전반에서 가장 높은 예측 및 분류 정확도를 달성한다.
This paper presents methods which are aimed at finding approximations to missing data in a dataset by using optimization algorithms to optimize the network parameters after which prediction and classification tasks can be performed. The optimization methods that are considered are genetic algorithm (GA), simulated annealing (SA), particle swarm optimization (PSO), random forest (RF) and negative selection (NS) and these methods are individually used in combination with auto-associative neural networks (AANN) for missing data estimation and the results obtained are compared. The methods suggested use the optimization algorithms to minimize an error function derived from training the auto-associative neural network during which the interrelationships between the inputs and the outputs are obtained and stored in the weights connecting the different layers of the network. The error function is expressed as the square of the difference between the actual observations and predicted values from an auto-associative neural network. In the event of missing data, all the values of the actual observations are not known hence, the error function is decomposed to depend on the known and unknown variable values. Multi-layer perceptron (MLP) neural network is employed to train the neural networks using the scaled conjugate gradient (SCG) method. Prediction accuracy is determined by mean squared error (MSE), root mean squared error (RMSE), mean absolute error (MAE), and correlation coefficient (r) computations. Accuracy in classification is obtained by plotting ROC curves and calculating the areas under these. Analysis of results depicts that the approach using RF with AANN produces the most accurate predictions and classifications while on the other end of the scale is the approach which entails using NS with AANN.
연구 동기 및 목표
- 기계 학습 데이터셋에서의 결측 데이터 문제를 해결함으로써 모델 성능 저하를 방지하기 위해.
- 최적화 알고리즘과 결합한 자동인코딩 신경망(AANN)을 사용하여 결측값을 추정하는 견고한 프레임워크를 개발하기 위해.
- AANN 기반 결측 데이터 보간 성능을 햖थ하는 데에 효과적인 다섯 가지 최적화 기법(GA, SA, PSO, RF, NS)의 비교를 위해.
- 표준 평가 지표를 사용하여 최적화된 AANN가 후속 예측 및 분류 작업에 미치는 영향을 평가하기 위해.
- 결측 데이터 추정 및 분류에 있어 가장 효과적인 최적화-AANN 조합을 특정하기 위해.
제안 방법
- 완전한 입력-출력 쌍에서 데이터 패턴을 학습하기 위해 다층 퍼셉트론(MLP)을 사용한 자동인코딩 신경망(AANN)을 스케일드 콘jugate 기울기(SCG) 방법으로 훈련한다.
- 오차 함수는 실제 값과 예측 값 간의 제곱 차이의 합으로 정의되며, 알려진 및 알려지지 않은 성분을 분리하여 결측 데이터를 처리하기 위해 분해된다.
- 다섯 가지 최적화 알고리즘(GA, SA, PSO, RF, NS)을 사용하여 AANN 가중치를 조정함으로써 오차 함수를 최소화하며, 각 알고리즘은 별도로 테스트된다.
- 예측 정확도는 평균 제곱 오차(MSE), 제곱근 평균 제곱오차(RMSE), 평균 절대 오차(MAE), 상관계수(r)를 사용하여 평가된다.
- 분류 성능는 ROC 곡선 분석 및 곡선 아래 면적(AUC)을 통해 평가된다.
- 이 프레임워크는 동일한 최적화된 AANN 모델을 사용하여 결측값 보간과 이후 분류를 모두 수행할 수 있다.
실험 결과
연구 질문
- RQ1자동인코딩 신경망과 조합했을 때, 어떤 최적화 알고리즘이 가장 정확한 결측 데이터 보간을 제공하는가?
- RQ2최적화 알고리즘을 AANN에 통합할 경우, 결측 데이터 존재 조건에서 예측 정확도에 어떤 영향을 미치는가?
- RQ3GA, SA, PSO, RF, NS는 AANN의 결측 데이터 추정 최적화에서 비교적 어떻게 성능을 내는가?
- RQ4보간된 데이터의 품질은 후속 분류 성능에 어떤 영향을 미치는가?
- RQ5랜덤 포레스트를 최적화 기법으로 사용할 경우, 다른 메타휴리스틱 기법들에 비해 AANN 성능을 상당히 향상시키는가?
주요 결과
- 랜덤 포레스트(RF)-최적화 AANN 접근법이 테스트된 데이터셋 전반에서 가장 높은 예측 정확도를 기록하였으며, 가장 낮은 MSE, RMSE, MAE 값을 기록하였다.
- 음성 선택(NS) 알고리즘이 가장 낮은 정확도의 예측을 생성하여, 모든 최적화 방법 중에서 가장 높은 오차 값을 기록하였다.
- RF-AANN 모델의 상관계수(r)는 다른 방법들보다 일관되게 높았으며, 예측값과 실제값 간의 강한 선형 관계를 나타내었다.
- 분류 성능는 RF-AANN에서 가장 우수하였으며, ROC 곡선 아래 면적(AUC)이 가장 높아 뛰어난 분류 능력을 보였다.
- PSO 및 GA 변종은 중간 수준의 성능를 보였으며, NS보다는 우수했지만 RF에 비해 열등한 성능를 보였다. 이는 모두 결측값 보간 및 분류 작업에서 동일하게 적용되었다.
- 비최적화 기반 모델에 비해 최적화 알고리즘의 사용이 AANN 성능을 상당히 향상시켰으며, 특히 RF가 가장 견고한 향상을 제공하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.