Skip to main content
QUICK REVIEW

[논문 리뷰] Computing log-likelihood and its derivatives for restricted maximum likelihood methods

Shengxin Zhu|arXiv (Cornell University)|2016. 08. 25.
Genetic Mapping and Diversity in Plants and Animals참고 문헌 31인용 수 4
한 줄 요약

이 논문은 대규모 선형 혼합 모델에 대한 제한 최대우도( REML) 추정에서 로그우도 및 그 도함수를 계산하는 데 있어 효율적인 계산 프레임워크를 제시한다. 행렬 변환과 평균 정보 분할 기법을 활용하여, 자코비안 행렬의 계산 비용이 높은 추적 항목을 네 개의 행렬-벡터 곱으로 줄여, 희소 선형 해법기와 다중 프rontal LDL^T 분해를 통해 확장 가능한 뉴턴-라프슨 최적화를 가능하게 한다.

ABSTRACT

Recent large scale genome wide association analysis involves large scale linear mixed models. Quantifying (co)-variance parameters in the mixed models with a restricted maximum likelihood method results in a score function which is the first derivative of a log-likelihood. To obtain a statistically efficient estimate of the variance parameters, one needs to find the root of the score function via the Newton method. Most elements of the Jacobian matrix of the score involve a trace term of four parametric matrix-matrix multiplications. It is computationally prohibitively for large scale data sets. By a serial matrix transforms and an averaged information splitting technique, an approximate Jacobian matrix can be obtained by splitting the average of the Jacobian matrix and its expected value. In the approximated Jacobian, its elements only involve Four matrix vector multiplications which can be efficiently evaluated by solving sparse linear systems with the multi-frontal factorization method.

연구 동기 및 목표

  • 유전체 연관 연구 등에서 대규모 선형 혼합 모델에 대한 REML 추정에서 발생하는 계산적 병목 현상을 해결한다.
  • 점수 함수의 자코비안 행렬에서 추적 항목을 계산하는 데 드는 금전적 비용을 줄인다.
  • 고차원 데이터에 대해 로그우도 및 그 도함수를 수치적으로 안정적이고 확장 가능한 방법으로 계산할 수 있는 방법을 개발한다.
  • 평균 정보 분할 기법을 사용해 자코비안을 근사화하여 REML에서의 효율적 뉴턴-라프슨 최적화를 가능하게 한다.
  • 신규 연구자들이 접근하고 재현할 수 있도록 로그우도 도함수의 자가 일관된 유도를 제공한다.

제안 방법

  • 복잡한 자코비안 행렬을 다룰 수 있는 구성 요소로 분해하기 위해 순차적 행렬 변환을 적용한다.
  • 자코비안을 주요 부분과 무시할 수 있는 기댓값 부분으로 분리하기 위해 평균 정보 분할 기법을 도입한다.
  • 주로 주요 부분만을 사용해 자코비안을 근사화하며, 그 요소들은 관측 벡터를 포함한 이차형식에 의존한다.
  • 각 이차형식을 네 개의 행렬-벡터 곱으로 줄여, 이를 희소 선형 시스템을 통해 효율적으로 해결한다.
  • 같은 계수 행렬을 공유하는 다중 우변 벡터 시스템을 해결하기 위해 다중 프론탈 또는 슈퍼노달 LDL^T 분해를 활용한다.
  • 희소 정밀도 행렬 C의 LDL^T 분해를 기반으로 우도 평가를 수행하며, 이는 관측 수보다 작다.

실험 결과

연구 질문

  • RQ1대규모 모델에서 REML 자코비안 행렬의 추적 항목을 어떻게 근사화하여 계산 비용을 줄일 수 있는가?
  • RQ2어떤 행렬 분해 기법이 고차원 선형 혼합 모델에서 로그우도 도함수의 효율적 평가를 가능하게 하는가?
  • RQ3평균 정보 분할 기법을 사용해 헤시안을 근사화함으로써 뉴턴-라프슨 방법을 REML 추정에 대해 확장 가능하게 만들 수 있는가?
  • RQ4기존의 도함수 없는 또는 전체 자코비안 접근법과 비교해 제안된 방법은 효율성과 정확성 측면에서 어떻게 다른가?
  • RQ5희소 행렬 분해는 유전체 데이터에 대한 확장 가능한 REML 계산을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • 제안된 평균 정보 분할 기법은 자코비안을 지배적인 부분과 무시할 수 있는 기댓값 부분으로 효과적으로 분리하여 계산 복잡도를 낮춘다.
  • 근사된 자코비안 행렬 요소들은 오직 네 개의 행렬-벡터 곱에 의존하며, 이를 희소 선형 해법을 통해 효율적으로 계산할 수 있다.
  • 이중 도함수 평가 과정은 동일한 계수 행렬 C를 공유하는 다중 선형 시스템을 푸는 것으로 줄여, 분해 결과의 재사용이 가능해진다.
  • 이 방법은 유전체 연관 연구와 같은 고속 생물정보학 데이터에서 확장 가능한 REML 추정을 가능하게 한다.
  • 로그우도 도함수의 자가 일관된 유도는 연구자들과 실무자들이 쉽게 접근하고 재현할 수 있도록 명확한 참조 자료를 제공한다.
  • 다중 프론탈 LDL^T 분해의 사용은 희소이고 대규모 문제에 대해 수치적 안정성과 효율성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.