Skip to main content
QUICK REVIEW

[논문 리뷰] Variable selection with genetic algorithms using repeated cross-validation of PLS regression models as fitness measure

David Kepplinger, Peter Filzmoser|ArXiv.org|2017. 11. 17.
Spectroscopy and Chemometric Analyses인용 수 3
한 줄 요약

이 논문은 변수 선택에서 유전 알고리즘의 새로운 적합도 평가 프레임워크를 제안하며, 내부 및 외부 예측 성능을 추정하기 위해 PLS 회귀 모델의 반복적 교차검증을 사용한다. 교차검증된 PLS 모델을 통한 예측 정확도 최적화를 통해 기존의 적합도 측정 기준에 비해 외부 예측 성능이 뛰어난 변수 조합을 식별한다. 특히 실제 화학계량학 데이터셋에서 기존의 R² 기반 기준에 비해 뛰어난 성능을 보인다.

ABSTRACT

Genetic algorithms are a widely used method in chemometrics for extracting variable subsets with high prediction power. Most fitness measures used by these genetic algorithms are based on the ordinary least-squares fit of the resulting model to the entire data or a subset thereof. Due to multicollinearity, partial least squares regression is often more appropriate, but rarely considered in genetic algorithms due to the additional cost for estimating the optimal number of components. We introduce two novel fitness measures for genetic algorithms, explicitly designed to estimate the internal prediction performance of partial least squares regression models built from the variable subsets. Both measures estimate the optimal number of components using cross-validation and subsequently estimate the prediction performance by predicting the response of observations not included in model-fitting. This is repeated multiple times to estimate the measures' variations due to different random splits. Moreover, one measure was optimized for speed and more accurate estimation of the prediction performance for observations not included during variable selection. This leads to variable subsets with high internal and external prediction power. Results on high-dimensional chemical-analytical data show that the variable subsets acquired by this approach have competitive internal prediction power and superior external prediction power compared to variable subsets extracted with other fitness measures.

연구 동기 및 목표

  • 기존의 화학계량학에서 유전 알고리즘의 적합도 측정 기준이 일반선형제곱법에 의존하고 다중공선성을 고려하지 못하는 한계를 해결하기 위해.
  • 변수 조합에서 생성된 PLS 회귀 모델의 내부 및 외부 예측 성능을 정확히 추정하는 적합도 평가 방법을 개발하기 위해.
  • 교차검증을 통합하여 최적의 PLS 성분 수와 예측 오차를 추정함으로써 고차원 화학적 분석 데이터에서의 변수 선택을 향상시키기 위해.
  • 선택된 변수 조합이 새로운 데이터에 잘 일반화되는 것을 우선시함으로써 QSPR 모델의 예측 안정성을 향상시키기 위해.

제안 방법

  • 이 방법은 반복적 이重교차검증(rdCV)과 간소화된 변형인 단순 반복 교차검증(srCV)을 유전 알고리즘의 적합도 측정 기준으로 사용한다.
  • 각 변수 조합에 대해 예측 오차가 최소가 되는 최적의 PLS 성분 수를 교차검증을 통해 추정하여, 미리 포함되지 않은 데이터에 대한 예측 성능을 최적화한다.
  • 예측 성능은 모델 학습에 포함되지 않은 관측치의 반응을 예측함으로써 평가되며, 다양한 무작위 데이터 분할에 대해 반복하여 변동성을 추정한다.
  • srCV 변형은 테스트 세트 크기 제약 조건을 완화함으로써 계산 효율성을 향상시켜, 외부 예측 성능을 신속하면서도 정확하게 추정할 수 있도록 한다.
  • 적합도 측정 기준은 단순히 모델 적합도가 아니라 내부 및 외부 예측 정확도가 높은 모델을 우선시하도록 설계되어 있다.
  • 이 접근법은 CRAN에 공개된 R 패키지 gaselect를 통해 구현되어 있으며, 화학계량학 응용 분야에서 널리 접근 가능하도록 한다.

실험 결과

연구 질문

  • RQ1기존의 R² 기반 기준에 비해 교차검증된 PLS 회귀 모델이 변수 선택에서 유전 알고리즘의 적합도 측정 기준으로 더 신뢰할 수 있는가?
  • RQ2PLS 성분 수를 추정하기 위해 반복적 교차검증을 사용할 경우, 선택된 변수 조합의 예측 성능에 어떤 영향을 미치는가?
  • RQ3간소화된 교차검증 접근법(srCV)은 반복적 이중교차검증에 비해 계산 시간을 크게 줄이면서도 높은 정확도를 유지하는가?
  • RQ4제안된 적합도 측정 기준을 사용해 선택된 변수 조합이 기존 표준 방법에 비해 외부 예측 성능 측면에서 얼마나 뛰어나게 되는가?

주요 결과

  • srCV 적합도 측정 기준은 외부 예측 성능이 뛰어난 변수 조합을 생성하여 KOC 데이터셋에서 총 RMSEP 0.503을 달성했으며, Gramatica 등(2011)이 보고한 최고의 부분집합(0.532)을 초월했다.
  • 제안된 교차검증 기반의 적합도 측정 기준을 사용해 선택된 변수 조합은 R² 또는 BIC 기반 기준을 사용한 경우보다 더 높은 외부 예측 성능(RMSEP_ext. validation)을 보였다.
  • srCV 방법은 반복적 이중교차검증 대비 계산 시간을 500% 이상 단축시키면서도 성능 추정의 정확도를 유지했다.
  • 새로운 적합도 측정 기준을 사용해 선택된 모델들은 평균적으로 더 적은 PLS 성분을 필요로 하여 단순하고 더 강건한 모델을 나타냈다.
  • 모든 검증 기준이 모델 성능을 과대평가하는 것으로 나타났으며, 훈련 데이터에서의 RMSEP가 검증 데이터에서의 RMSEP보다 낮은 것으로 확인되어, 적절한 외부 검증의 필요성을 확인했다.
  • 제안된 방법, 특히 srCV는 다중공선성이 있는 고차원 화학계량학 데이터에 적합한 일반화 능력을 갖춘 변수 조합을 식별할 수 있게 하여, 실용적인 응용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.