[논문 리뷰] Determining the Number of Factors in High-dimensional Generalised Latent Factor Models
이 논문은 혼합 데이터 유형과 결측치를 수용하는 고차원 일반화 잠재요인 모형에서 요인 수를 결정하기 위한 일관된 정보기준을 제안한다. 이 방법은 고차원 점점 증가하는 점근적 조건 하에서 정확한 요인 선택을 보장하며, 이론적 오차 경계와 시뮬레이션 및 실제 데이터에서의 강력한 경험적 성능을 보이며, 아이젠크 성격검사에서의 세 요인 구조 검증을 포함한다.
As a generalisation of the classical linear factor model, generalised latent factor models are a useful tool for analysing multivariate data of different types, including binary choices and counts. In this paper, we propose an information criterion to determine the number of factors in generalised latent factor models. The consistency of the proposed information criterion is established under a high-dimensional setting where both the sample size and the number of manifest variables grow to infinity and data may have many missing values. To establish this consistency result, an error bound is established for the parameter estimates that improves the existing results and may be of independent theoretical interest. Simulation shows that the proposed criterion has good finite sample performance. An application to Eysenck's personality questionnaire confirms the three-factor structure of this personality survey.
연구 동기 및 목표
- 혼합형 다변량 데이터를 가진 고차원 일반화 잠재요인 모형에서 요인 수를 결정하는 데 도전하는 것.
- 표본 크기와 관측 변수 수가 모두 무한대로 증가할 때에도 일관성 유지가 보장되는 요인 선택 기준을 개발하는 것.
- 실제 응용에서 흔한 고차원 데이터에서 많은 수의 결측치 존재를 고려하는 것.
- 매개변수 추정치에 대한 더 날카운 오차 경계를 설정하여 고차원 요인 모형화 이론적 기여를 하는 것.
- 시뮬레이션 데이터와 실제 성격 설문지 데이터(아이젠크의 설문지)를 활용한 방법의 경험적 검증
제안 방법
- 정규분포가 아니며 혼합형 데이터(예: 이진형, 카운트형)를 가진 일반화 잠재요인 모형에 특화된 가능도 근사 기반 정보기준을 제안한다.
- 표본 크기 n과 관측 변수 수 p가 모두 무한대로 향하는 고차원 점점 증가하는 점근적 조건 하에서 정보기준의 이론적 일관성을 도출한다.
- 기존 결과보다 향상된 매개변수 추정치에 대한 새로운 오차 경계를 설정하여 이론적 강건성을 향상시킨다.
- 결측치 처리를 가능도 기반 추정을 통해 통합하여, 완전하지 않은 데이터셋에 적용 가능하게 한다.
- 모델 적합도와 복잡도의 균형을 맞추기 위해 펜라티드 가능도 접근법을 사용하여 점점 증가하는 조건에서 진짜 요인 수를 선호한다.
실험 결과
연구 질문
- RQ1혼합형 데이터 유형을 가진 고차원 일반화 잠재요인 모형에서 정보기준이 일관되게 진짜 요인 수를 선택할 수 있는가?
- RQ2데이터에 많은 결측치가 포함된 유한 표본에서 제안된 기준은 어떻게 성능을 보이는가?
- RQ3매개변수 추정치에 대한 향상된 오차 경계는 요인 선택의 신뢰성에 어느 정도 기여하는가?
- RQ4이 방법은 아이젠크 성격검사에서 알려진 세 요인 구조를 올바르게 식별할 수 있는가?
주요 결과
- 제안된 정보기준은 고차원 점점 증가하는 점근적 조건 하에서 결측치가 존재하는 경우에도 진짜 요인 수 선택에 대해 일관성을 보인다.
- 시뮬레이션에서 이론적 조건 하에서 다양한 데이터 구성에서 진짜 요인 수를 정확히 복원하는 데 성공한 좋은 표본 내 성능을 보인다.
- 유도된 매개변수 추정치 오차 경계는 기존 결과보다 더 날카롭게, 이론적 안정성 향상을 시사한다.
- 아이젠크 성격검사에 대한 경험적 적용을 통해 세 요인 구조 존재를 확인하여 방법의 타당성을 뒷받침한다.
- 이 방법은 이진형 및 카운트형 변수와 같은 혼합 데이터 유형과 결측치를 보완 없이 효과적으로 처리할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.