Skip to main content
QUICK REVIEW

[논문 리뷰] BeSS: An R Package for Best Subset Selection in Linear, Logistic and CoxPH Models

Canhong Wen, Aijun Zhang|arXiv (Cornell University)|2017. 09. 19.
Statistical Methods and Inference참고 문헌 21인용 수 6
한 줄 요약

이 논문은 선형, 로지스틱, 코ックス 비례 위험 모델에서 최적 부분집합 선택을 위한 원시-이중 활성집합 알고리즘을 구현한 R 패키지 BeSS를 소개한다. 이는 효율적인 C++/Rcpp 통합을 활용하며 순차적 및 골드ensection 검색 전략을 지원하여, 단일 컴퓨터에서 최대 10,000개의 예측변수를 가진 고차원 데이터에 대해 초당 빠르고 안정적인 선택을 가능하게 한다.

ABSTRACT

We introduce a new R package, BeSS, for solving the best subset selection problem in linear, logistic and Cox's proportional hazard (CoxPH) models. It utilizes a highly efficient active set algorithm based on primal and dual variables, and supports sequential and golden search strategies for best subset selection. We provide a C++ implementation of the algorithm using Rcpp interface. We demonstrate through numerical experiments based on enormous simulation and real datasets that the new BeSS package has competitive performance compared to other R packages for best subset selection purpose.

연구 동기 및 목표

  • 큰 p를 가진 고차원 설정에서 완전 탐색을 통한 최적 부분집합 선택의 계산 불가능성을 해결하기 위해.
  • 선형, 일반화된 선형 및 코ックス 비례위험 모델 전반에 걸쳐 계산적으로 효율적이고 안정적인 최적 부분집합 선택 알고리즘 개발을 위해.
  • 부분집합 선택 문제에서 비볼록인 L0 제약 조건을 효율적으로 처리할 수 있는 원시-이중 활성집합 방법을 개발하기 위해.
  • AIC, BIC, EBIC와 같은 모델 선택 기준을 지원하는 C++로 가속화된 핵심 알고리즘과 함께 사용자 친화적인 R 패키지를 제공하기 위해.
  • 시뮬레이션 및 실제 데이터 세트를 활용하여 패키지의 성능을 입증하고, n이 수천 수준이고 p가 수만 수준까지 확장 가능함을 보여주기 위해.

제안 방법

  • 알고리즘은 원시 및 이중 변수를 사용하여 예측변수의 활성집합을 반복적으로 갱신하는 원시-이중 활성집합(PDAS) 알고리즘을 사용한다.
  • 이 알고리즘은 L0 노름 제약 조건이 있는 볼록 손실 함수로 일반화되어 있어 선형, 로지스틱 및 코ックスPH 모델에 적용 가능하다.
  • 두 가지 검색 전략을 지원한다: k(부분집합 크기)에 대한 순차적 검색과 최적의 k를 결정하기 위한 골드ensection 검색.
  • 메모리 최적화를 통해 희소 행렬 연산을 지원하는 C++를 통한 Rcpp를 통한 핵심 알고리즘 구현으로 높은 성능을 달성한다.
  • 모델 선택 기준(AIC, BIC, EBIC)을 사용하여 각 k에 대한 최적 부분집합의 시퀀스에서 최적 모델을 식별한다.
  • 완전 탐색을 피하기 위해 활성집합 갱신과 이중 기반 수렴 검사를 사용함으로써 계산 시간을 크게 감소시킨다.

실험 결과

연구 질문

  • RQ1원시-이중 활성집합 알고리즘이 선형, 로지스틱 및 코克斯PH 모델에서 최적 부분집합 선택에 대해 경쟁적인 계산 효율성과 정확도를 달성할 수 있는가?
  • RQ2BeSS의 성능는 leaps, bestglm, glmuti와 같은 기존 R 패키지들과 비교해 고차원 데이터에서 속도와 안정성 측면에서 어떻게 다른가?
  • RQ3순차적 및 골드ensection 검색 전략이 최소한의 계산 오버헤드로 최적의 모델 크기 k를 효과적으로 식별할 수 있는 정도는 어느 정도인가?
  • RQ4BeSS의 C++ 가속 구현은 p > 10,000개의 예측변수와 n이 수천 수준인 데이터세트에서도 수치적 안정성을 유지하면서 확장 가능한가?
  • RQ5정보 기준(AIC, BIC, EBIC)은 BeSS 알고리즘과 함께 사용될 때 최적 모델을 선택하는 데 얼마나 잘 작동하는가?

주요 결과

  • BeSS는 다른 R 패키지들과 비교해 경쟁적인 성능를 보이며, 단일 개인 컴퓨터에서 n이 수천 수준이고 p가 수만 수준인 최적 부분집합 문제를 단 몇 초 내에 해결한다.
  • trim32 데이터셋에서 EBIC 기준을 사용하여 최적 모델을 성공적으로 식별하였으며, EBIC = -561.2689인 2개의 예측변수를 포함한 모델을 선택했다.
  • trim32 데이터셋에서 AIC 기준으로 선택된 최적 모델은 AIC = -890.9282이었으며, 이는 강력한 적합도와 모델 복잡도 간의 균형을 보여준다.
  • 원시-이중 활성집합 알고리즘은 안정적이고 효율적으로 수렴하여 완전 탐색으로는 불가능한 NP-난이도 최적 부분집합 문제를 해결할 수 있다.
  • Rcpp를 통한 C++ 구현은 계산을 크게 가속화하여 고차원 데이터에 대한 최적 부분집합 선택을 실용적으로 만들었다.
  • BeSS가 생성한 해 경로와 손실 함수 플롯은 모델 선택에 명확한 시각적 가이던스를 제공하며, 수직선은 EBIC에 의해 선택된 최적의 k를 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.