[논문 리뷰] plsRglm: Partial least squares linear and generalized linear regression for processing incomplete datasets by cross-validation and bootstrap techniques with R
plsRglm 패키지는 선형 및 일반화선형모형에서 부분최소제곱법 회귀(PLS)를 위한 종합적인 R 솔루션을 제공하며, 고도화된 교차검증 및 부트스트랩 기법을 통해 누락 데이터를 지원한다. 이는 강력한 모델 선택, $BC_a$ 신뢰구간을 통한 예측변수의 유의성 평가 및 그래픽 진단을 가능하게 하며, 주요 기여 사항으로는 누락 데이터 처리, PLSGLR 확장, 고차원 또는 다중공선성 데이터에 대한 안정된 추론이 포함된다.
The aim of the plsRglm package is to deal with complete and incomplete datasets through several new techniques or, at least, some which were not yet implemented in R. Indeed, not only does it make available the extension of the PLS regression to the generalized linear regression models, but also bootstrap techniques, leave-one-out and repeated $k$-fold cross-validation. In addition, graphical displays help the user to assess the significance of the predictors when using bootstrap techniques. Biplots (Fig. 4) can be used to delve into the relationship between individuals and variables.
연구 동기 및 목표
- 기존 R PLS 패키지가 일반적으로 불완전한 관측치를 제거하거나 거부하는 바, 누락 데이터 지원이 부족한 문제를 해결한다.
- 부분최소제곱법 회귀(PLS)를 일반화선형모형(PLSGLR)으로 확장하여 이진, 카운트 및 기타 비정규 분포의 반응변수 분석을 가능하게 한다.
- 고차원 또는 다중공선성 데이터 세트에서 예측변수의 유의성 및 모델 안정성을 평가하기 위해 부트스트랩 리샘플링 기법(예: $(Y,T)$ 및 $(Y,X)$)을 구현한다.
- 최적의 성분 수 선택을 위한 교차검증 기반 기준(예: $Q^2$, PRESS, 오분류율)과 자유도 보정을 고려한 정보기준(AIC, BIC)을 제공한다.
- 복잡한 데이터세트에서 PLS 모델의 해석 및 강건성 평가를 돕기 위해 이중도, 부트스트랩 신뢰구간 등의 그래픽 도구를 개발한다.
제안 방법
- 예측변수 간 다중공선성 또는 관측수를 초과하는 예측변수 존재 시에도 관계를 모델링할 수 있도록 PLSR 및 PLSGLR 프레임워크를 활용한다.
- 모델 성능 추정 및 최적 성분 수 선택을 위해 반복적 $k$-폴드 교차검증(예: 100×8폴드)을 적용하며, $Q^2$, 오분류율, AIC, BIC 등의 기준을 사용한다.
- 두 가지 부트스트랩 리샘플링 전략인 $(Y,X)$ 및 $(Y,T)$를 구현하며, 후자는 일반화선형모형에서 더 빠르고 안정적인 것으로 나타났다.
- 예측변수 유의성 평가를 위해 $BC_a$ 부트스트랩 신뢰구간을 계산하며, 패키지 내에서 시각화 기능을 제공한다.
- 성분 수 잘못 지정에 대한 영향을 고려하기 위해 다양한 성분 수를 가진 모델들에서의 유의성 정보를 통합하는 강력한 유의성 지표 $\pi_e$를 도입한다.
- 이항, 순서형, 이항, 포isson, 음수이항 등 다양한 반응형태를 다룰 수 있도록 PLSGLR를 통해 다양한 링크 함수(예: 이진 결과에 대한 로짓)를 지원한다.
실험 결과
연구 질문
- RQ1고차원 또는 누락 데이터 존재 시, PLS 회귀를 일반화선형모형(PLSGLR)으로 효과적으로 확장하면서도 강건성을 유지할 수 있는가?
- RQ2누락 데이터 또는 강한 예측변수 다중공선성 존재 시, 최적의 PLS 성분 수 선택에 가장 신뢰할 수 있는 교차검증 및 정보기준은 무엇인가?
- RQ3다른 부트스트랩 리샘플링 전략($(Y,X)$ 대비 $(Y,T)$)은 일반화선형모형에서 PLS 예측변수의 안정성 및 유의성 평가에 어떤 영향을 미치는가?
- RQ4이중도 및 부트스트랩 신뢰구간과 같은 그래픽 도구는 복잡한 생물학적 또는 의료 데이터세트에서 PLS 모델의 해석 가능성 및 신뢰성 향상에 어느 정도 기여하는가?
- RQ5교차검증을 통해 선택된 성분 수의 불확실성에 대비해, 강력한 유의성 지표 $\pi_e$는 어떻게 구성할 수 있는가?
주요 결과
- 100회의 반복 8폴드 교차검증 기반으로 4성분 PLS 이진로지스틱 모델이 선택되었으며, 이는 104개 관측치 중 55개의 오분류율을 기록하고 반복 간 일관된 성능을 보였다.
- 1000회 리샘플링을 적용한 $BC_a$ 부트스트랩 기반 분석에서, 대장암 알레로타이핑 데이터세트의 33개 예측변수 중 9개만이 5% 수준에서 0과 유의미하게 다를 바가 없었다.
- 4성분 모델은 추정계수 $\hat{c}_1 = 1.4274$, $\hat{c}_2 = 0.5096$, $\hat{c}_3 = 0.6903$, $\hat{c}_4 = 0.7930$, 그리고 절편 $\hat{\mu} = -0.2968$ 를 제공하였으며, $y=1$일 확률은 로짓 링크 함수로 모델링되었다.
- $BC_a$ 부트스트랩 신뢰구간 분석 결과, 1에서 8성분까지 다양한 모델에서 여러 예측변수가 일관되게 유지되는 유의성 보존을 확인하였다. 이는 강력한 안정성을 시사한다.
- 강력한 유의성 지표 $\pi_e$는 성분 수 변화에 비춰도 예측변수의 유의성 유지가 상대적으로 안정되었음을 보여주며, 성분 수 선택 오류로 인한 가짜 양성 결과 위험 감소를 가능하게 하였다.
- $(Y,T)$ 부트스트랩 방법은 일반화선형모형에서 특히 $(Y,X)$에 비해 유의미하게 더 빠르고 안정적인 것으로 나타났다. 다만 두 방법 간 결과는 뚜렷이 다를 것으로 나타나, 방법 선택의 중요성을 강조하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.