Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised Learning for Multi-Block Incomplete Data

Hadrien Lorenzo, Jérôme Saracco|arXiv (Cornell University)|2019. 01. 14.
Statistical Methods and Inference참고 문헌 37인용 수 4
한 줄 요약

이 논문은 새로운 알고리즘인 Koh-Lanta를 사용하여 변수 선택, 부분공간 추정, 결측치 보정을 동시에 수행하는 새로운 감독형 다중 블록 PLS 방법인 mdd-sPLS를 제안한다. 고차원이고 완전하지 않은 데이터 설정에서, 특히 블록 내 및 블록 간 상관관계가 높을 경우 기존의 두 단계 방법(예: 평균 보정, nipals, softImpute, imputeMFA)보다 예측 오차가 가장 낮아 성능이 뛰어나다.

ABSTRACT

In the supervised high dimensional settings with a large number of variables and a low number of individuals, one objective is to select the relevant variables and thus to reduce the dimension. That subspace selection is often managed with supervised tools. However, some data can be missing, compromising the validity of the sub-space selection. We propose a Partial Least Square (PLS) based method, called Multi-block Data-Driven sparse PLS mdd-sPLS, allowing jointly variable selection and subspace estimation while training and testing missing data imputation through a new algorithm called Koh-Lanta. This method was challenged through simulations against existing methods such as mean imputation, nipals, softImpute and imputeMFA. In the context of supervised analysis of high dimensional data, the proposed method shows the lowest prediction error of the response variables. So far this is the only method combining data imputation and response variable prediction. The superiority of the supervised multi-block mdd-sPLS method increases with the intra-block and inter-block correlations. The application to a real data-set from a rVSV-ZEBOV Ebola vaccine trial revealed interesting and biologically relevant results. The method is implemented in a R-package available on the CRAN and a Python-package available on pypi.

연구 동기 및 목표

  • 감독 학습 설정에서 결측 공변수를 가진 고차원 데이터의 과제를 해결한다.
  • 데이터 보정과 분석을 별도로 수행하는 두 단계 접근법의 한계를 극복한다.
  • 변수 선택, 부분공간 추정, 결측치 보정을 동시에 수행하는 통합 방법을 개발한다.
  • 블록 간 상관관계를 활용하여 결측치가 있는 다중 블록 데이터에서 반응 변수의 예측 정확도를 향상시킨다.
  • 실제 생물학적 및 생물의학적 데이터셋에서 결측치가 존재하는 상황에서도 계산적으로 효율적이고 통계적으로 안정적인 해결책을 제공한다.

제안 방법

  • L1-정규화 최적화를 통한 변수 선택을 통합한 감독형 다중 블록 PLS 방법인 mdd-sPLS를 제안한다.
  • SVD 기반 보정과 PLS 기반 추정을 번갈아가며 수행하는 Koh-Lanta 알고리즘을 도입하여 결측치 보정과 예측을 동시에 수행한다.
  • 현재 PLS 성분에서 유도된 낮은 질서 근사값을 사용하여 반복적으로 결측치 값을 업데이트하는 데이터 기반 접근법을 적용한다.
  • 예측자 블록과 반응 블록 양쪽에서 관련 변수를 선택하기 위해 L1-노름 정규화를 적용한 희박 PLS를 사용한다.
  • 비볼록 문제를 해결하기 위해 교대 최적화를 활용하며, 오목 성분을 조정 파rameter κ를 통해 감소시킨다.
  • 모든 데이터 행렬을 분석 전에 평균이 0이고 분산이 1이 되도록 표준화하여 블록 간 비교 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1통합 방법이 다중 블록 고차원 데이터에서 결측치 보정과 감독형 예측을 동시에 수행할 수 있는가?
  • RQ2mdd-sPLS의 성능은 예측 오차 측면에서 두 단계 방법(예: 보정 후 분석)과 비교해 어떻게 되는가?
  • RQ3블록 내 및 블록 간 상관관계 수준이 다양할 경우에도 이 방법이 뛰어난 성능을 유지하는가?
  • RQ4개인 수가 증가함에 따라 mdd-sPLS의 예측 정확도는 기존 방법과 비교해 어떻게 변화하는가?
  • RQ5블록 구조가 약한 저상관관계 설정에서도 mdd-sPLS는 강건한가?

주요 결과

  • 모든 시뮬레이션 시나리오에서 mdd-sPLS는 가장 낮은 예측 오차(RMSEP)를 기록했으며, 특히 높은 블록 내 및 블록 간 상관관계 조건에서 뛰어난 성능을 보였다.
  • 평균 보정, nipals, softImpute, imputeMFA와 비교해 유의미하게 낮은 예측 오차를 기록했으며, 모든 경우에서 경쟁 방법보다 예측 오차가 일관되게 낮았다.
  • 저상관관계 설정(ρd = 0.3, ρt = 0.5)에서는 모든 방법이 유사하게 성능을 보였고, RMSEP ≈ 0.73이었으며, Lasso 기반 방법을 제외한 나머지는 높은 오차(≈ 0.83)를 보였다.
  • 개인 수가 증가함에 따라 mdd-sPLS(Koh-Lanta 포함)의 예측 정확도가著명하게 향상되었으며, even nipals + classic-sPLS를 초월하는 성능을 보였다.
  • Koh-Lanta를 사용한 mdd-sPLS는 모든 조건에서 가장 낮은 오차를 유지했으며, 특히 상관관계가 높을 경우 뛰어난 성능을 발휘했다.
  • 실제 rVSV-ZEBOV 에볼라 백신 데이터셋에서 4개의 관련 공변수(각 성분당 2개)를 성공적으로 식별했으며, 유일한 샘플 제외 교차검증에서 완벽한 그룹 할당을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.