Skip to main content
QUICK REVIEW

[논문 리뷰] Essential formulae for restricted maximum likelihood and its derivatives associated with the linear mixed models

Shengxin Zhu, Andrew J. Wathen|arXiv (Cornell University)|2018. 05. 11.
Spectroscopy and Chemometric Analyses참고 문헌 16인용 수 9
한 줄 요약

이 논문은 선형 혼합 모델에서 제한된 최대우도( REML) 및 그 도함수에 대한 필수 공식의 자가 포함된 수학적 유도를 제공하며, 관측 정보 행렬과 피셔 정보 행렬의 효율적 계산에 중점을 둔다. 오차 대비 변환과 평균 정보 행렬을 포함한 핵심 REML 공식에 대해 새로운 증명을 제시함으로써, 고속도 생물학적 데이터에 대한 확장 가능한 최적화를 가능하게 한다.

ABSTRACT

The restricted maximum likelihood method enhances popularity of maximum likelihood methods for variance component analysis on large scale unbalanced data. As the high throughput biological data sets and the emerged science on uncertainty quantification, such a method receives increasing attention. Estimating the unknown variance parameters with restricted maximum likelihood method usually requires an nonlinear iterative method. Therefore proper formulae for the log-likelihood function and its derivatives play an essential role in practical algorithm design. It is our aim to provide a mathematical introduction to this method, and supply a self-contained derivation on some available formulae used in practical algorithms. Some new proof are supplied.

연구 동기 및 목표

  • 실제 알고리즘에서 사용되는 REML 공식의 수학적으로 엄밀한 유도를 제공하여 이전 통계 문헌에서 남겨진 격차를 메운다.
  • 저자 주오 등(2012)의 공식처럼 오래된 공식을 보완하고 업데이트하기 위해 새로운 자가 포함된 증명을 제공한다.
  • 관측 정보 행렬과 피셔 정보 행렬의 구조를 명확히 하여 고차원 분산 구성 요소 추정에서 도함수 기반 최적화를 효율적으로 가능하게 한다.
  • 특히 불균형적인 대규모 데이터셋에 대해 확장 가능한 REML 추정을 위한 기반을 마련하기 위해 평균 정보 행렬을 활용한다.
  • 유전체학 및 불확실성 정량화에서 알고리즘 설계를 지원하기 위해 로그우도 도함수에 대한 계산적으로 다룰 수 있는 표현을 제공한다.

제안 방법

  • 직교 투영 행렬과 헷 마트릭스의 스펙트럼 분해를 사용하여 오차 대비 변환을 유도한다. $ P_X = X(X^T X)^{-1}X^T $, $ L = [L_1, L_2] $ 가 존재하여 $ L_1^T X = I_p $, $ L_2^T X = 0 $ 임을 증명한다.
  • 고정 효과에 영향을 받지 않는 $ L_2^T y $ 의 마진 분포를 사용하여 제한된 로그우도 $ ilde{ heta}^{ ext{REML}} = ext{argmax}_ heta ilde{ heta} $ 를 구성한다.
  • 관측 정보 행렬 $ oldsymbol{/mathcal{I}}_O( heta_i, heta_j) $ 와 피셔 정보 행렬 $ oldsymbol{/mathcal{I}}_F( heta_i, heta_j) $ 를 유도하며, 복잡한 추적 기반 형태임을 보여준다.
  • 평균 정보 행렬 $ oldsymbol{/mathcal{I}}_A( heta_i, heta_j) $ 를 도입하여 이차형식을 통해 계산을 단순화하고 효율적인 뉴턴-라프슨 최적화를 가능하게 한다.
  • 평균 정보 행렬이 관측 정보 행렬과 피셔 정보 행렬의 정확한 평균임을 보이며, 잔차 항이 영 행렬에 근접한 무시할 수 없는 항임을 입증한다.
  • 다중 우측항을 가진 희소 선형 시스템을 통해 평균 정보 행렬을 해결함으로써, 대규모 생물학적 데이터에서의 확장 가능한 REML 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1고정 효과에 영향을 받지 않는 $ L_2^T y $ 의 마진 분포를 확보하기 위해 오차 대비 변환 $ L = [L_1, L_2] $ 를 엄밀하게 구성할 수 있는 방법은 무엇인가?
  • RQ2REML 추정에서 관측 정보 행렬과 피셔 정보 행렬에 대한 정확하고 계산적으로 효율적인 표현은 무엇인가?
  • RQ3대규모 문제에서 계산 비용이 높은 관측 정보 행렬을 대체하기 위해 평균 정보 행렬을 어떻게 도출하고 활용할 수 있는가?
  • RQ4기존 알고리즘이 여전히 오래된 공식을 사용하는 이유는 무엇이며, 새로운 유도를 통해 어떻게 수정할 수 있는가?
  • RQ5고차원 REML 추정에서 도함수 기반 방법(예: 뉴턴-라프슨)이 도함수 미사용 방법보다 어떤 계산적 이점이 있는가?

주요 결과

  • 오차 대비 변환 $ L = [L_1, L_2] $ 의 존재성과 구성에 대해 엄밀한 증명이 제공되며, 이는 $ L_1^T X = I_p $ 와 $ L_2^T X = 0 $ 를 만족시어 REML에 필수적이다.
  • 제한된 로그우도는 $ ilde{ heta} = - rac{1}{2} igracevert (n - u) ext{log}(2 ilde{ heta}) + ext{log}|L_2^T V( heta) L_2| + y^T L_2 (L_2^T V( heta) L_2)^{-1} L_2^T y igracevert $ 로 유도되며, 고정 효과 추정의 편향을 제거한다.
  • 관측 정보 행렬 $ oldsymbol{/mathcal{I}}_O( heta_i, heta_j) $ 는 네 개의 행렬 곱의 추적을 포함하여 대규모 데이터셋에서는 계산이 금기이다.
  • 피셔 정보 행렬 $ oldsymbol{/mathcal{I}}_F( heta_i, heta_j) $ 는 더 단순하지만 여전히 추적 항을 포함하여 계산 비용이 높다.
  • 평균 정보 행렬 $ oldsymbol{/mathcal{I}}_A( heta_i, heta_j) $ 는 관측 정보 행렬과 피셔 정보 행렬의 정확한 평균임을 입증하였으며, 잔차 항이 영 행렬에 근접한 무시할 수 없는 항이다.
  • 평균 정보 행렬은 다중 우측항을 가진 희소 선형 시스템을 통해 효율적으로 계산 가능하여, 고속도 유전체학에서의 확장 가능한 REML 최적화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.