Skip to main content
QUICK REVIEW

[論文レビュー] Essential formulae for restricted maximum likelihood and its derivatives associated with the linear mixed models

Shengxin Zhu, Andrew J. Wathen|arXiv (Cornell University)|May 11, 2018
Spectroscopy and Chemometric Analyses参考文献 16被引用数 9
ひとこと要約

本稿は、線形混合モデルにおける制限付き最尤推定(REML)およびその導関数の基本的公式の自己完備的な数学的導出を提供し、観測情報行列とフィッシャー情報行列の効率的計算に焦点を当てている。誤差対比変換と平均情報行列に関する新しい証明を提示することで、高スループットな生物学的データに対するスケーラブルな最適化を可能にする。

ABSTRACT

The restricted maximum likelihood method enhances popularity of maximum likelihood methods for variance component analysis on large scale unbalanced data. As the high throughput biological data sets and the emerged science on uncertainty quantification, such a method receives increasing attention. Estimating the unknown variance parameters with restricted maximum likelihood method usually requires an nonlinear iterative method. Therefore proper formulae for the log-likelihood function and its derivatives play an essential role in practical algorithm design. It is our aim to provide a mathematical introduction to this method, and supply a self-contained derivation on some available formulae used in practical algorithms. Some new proof are supplied.

研究の動機と目的

  • 実用的なアルゴリズムで用いられるREML公式の数学的に厳密な導出を提供し、先行統計文献が残した空白を埋める。
  • Zhouら(2012)のものなど、古くなった公式を、新しい自己完備的証明を用いて是正・更新する。
  • 観測情報行列とフィッシャー情報行列の構造を明確にすることで、高次元の分散成分推定における導関数に基づく最適化を可能にする。
  • 特に不均衡な大規模データセットに対して、平均情報行列を用いたスケーラブルなREML推定の基盤を構築する。
  • ゲノム解析や不確実性の定量化におけるアルゴリズム設計を支援するため、対数尤度の導関数に対する計算可能で実用的な表現を提供する。

提案手法

  • 正規化射影行列とハット行列の固有値分解 $ P_X = X(X^T X)^{-1}X^T $ を用いて、誤差対比変換を導出し、$ L = [L_1, L_2] $ が存在して $ L_1^T X = I_p $、$ L_2^T X = 0 $ を満たすことを証明する。
  • 固定効果に依存しない $ L_2^T y $ の周辺分布を用いて、制限付き対数尤度 $ ilde{ heta}^{ ext{REML}} = \text{argmax}_\theta \tilde{\theta} $ を構築する。
  • 観測情報行列 $ \boldsymbol{/mathcal{I}}_O(\theta_i, \theta_j) $ とフィッシャー情報行列 $ \boldsymbol{/mathcal{I}}_F(\theta_i, \theta_j) $ を導出し、それらの複雑なトレースに基づく表現を示す。
  • 平均情報行列 $ \boldsymbol{/mathcal{I}}_A(\theta_i, \theta_j) $ を導入し、2次形式を介して計算を簡略化することで、効率的なニュートン・ラプソン最適化を可能にする。
  • 平均情報行列が観測情報行列とフィッシャー情報行列の正確な平均に近づき、無視できる残差項(ゼロ行列)を持つことを示す。
  • スパース線形方程式系を用いて複数の右辺を持つ平均情報行列を解く手法を提案し、大規模な生物学的データにおけるスケーラブルなREML最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1固定効果に依存しない $ L_2^T y $ の周辺分布を保証するため、誤差対比変換 $ L = [L_1, L_2] $ を厳密に構築する方法は何か?
  • RQ2REML推定における観測情報行列とフィッシャー情報行列の正しい、かつ計算効率の良い表現は何か?
  • RQ3平均情報行列はどのように導出され、大規模問題における計算コストの高い観測情報行列に代わって使用できるか?
  • RQ4一部の既存アルゴリズムがなぜ未だに古くなった公式を使用しているのか。新しい導出によりどのように是正できるか?
  • RQ5高次元REML推定において、導関数に基づく手法(例:ニュートン・ラプソン法)は導関数フリー手法に比べてどのような計算的利点を持つのか?

主な発見

  • 誤差対比変換 $ L = [L_1, L_2] $ の存在と構築に関する厳密な証明が提供され、$ L_1^T X = I_p $ および $ L_2^T X = 0 $ を満たすことが保証される。これはREMLに不可欠である。
  • 制限付き対数尤度は $ \tilde{\theta} = -\frac{1}{2} \big\bracevert (n - \nu)\text{log}(2\tilde{\theta}) + \text{log}|L_2^T V(\theta) L_2| + y^T L_2 (L_2^T V(\theta) L_2)^{-1} L_2^T y \big\bracevert $ として導出され、固定効果推定のバイアスが除去される。
  • 観測情報行列 $ \boldsymbol{/mathcal{I}}_O(\theta_i, \theta_j) $ は4つの行列積のトレースを含み、大規模データに対して計算が非現実的になる。
  • フィッシャー情報行列 $ \boldsymbol{/mathcal{I}}_F(\theta_i, \theta_j) $ はより単純であるが、依然としてコストの高いトレース項を含む。
  • 平均情報行列 $ \boldsymbol{/mathcal{I}}_A(\theta_i, \theta_j) $ は、観測情報行列とフィッシャー情報行列の正確な平均に等しく、無視できる残差項(ゼロ行列)を持つことが示された。
  • 平均情報行列は、複数の右辺を持つスパース線形方程式系を用いて効率的に計算可能であり、高スループットゲノム解析におけるスケーラブルなREML最適化を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。