Skip to main content
QUICK REVIEW

[論文レビュー] Modelling of directional data using Kent distributions

Parthan Kasarapu|arXiv (Cornell University)|Jun 26, 2015
Bayesian Methods and Mixture Models参考文献 33被引用数 5
ひとこと要約

本稿では、従来のモーメント推定法および最尤推定法に欠ける点を補うために、最小メッセージ長(MML)原理を用いたケント分布のベイズ推定フレームワークを提案する。MMLに基づくパラメータ推定値は、バイアスと平均二乗誤差が低く抑えられ、方向データの信頼性の高い混合モデル化を可能にし、タンパク質の構造的状態データの記述においてボン・ミーゼス・フィッシャー分布モデルを上回る性能を示す。

ABSTRACT

The modelling of data on a spherical surface requires the consideration of directional probability distributions. To model asymmetrically distributed data on a three-dimensional sphere, Kent distributions are often used. The moment estimates of the parameters are typically used in modelling tasks involving Kent distributions. However, these lack a rigorous statistical treatment. The focus of the paper is to introduce a Bayesian estimation of the parameters of the Kent distribution which has not been carried out in the literature, partly because of its complex mathematical form. We employ the Bayesian information-theoretic paradigm of Minimum Message Length (MML) to bridge this gap and derive reliable estimators. The inferred parameters are subsequently used in mixture modelling of Kent distributions. The problem of inferring the suitable number of mixture components is also addressed using the MML criterion. We demonstrate the superior performance of the derived MML-based parameter estimates against the traditional estimators. We apply the MML principle to infer mixtures of Kent distributions to model empirical data corresponding to protein conformations. We demonstrate the effectiveness of Kent models to act as improved descriptors of protein structural data as compared to commonly used von Mises-Fisher distributions.

研究の動機と目的

  • ケント分布に対する従来のモーメント推定法に、統計的厳密性が欠けている問題に対処すること。
  • 非指数型分布族に属し、正規化定数が複雑であるため、ケント分布に対するベイズ推定法を開発すること。
  • 最小メッセージ長(MML)基準を用いて、方向データの最適なケント分布混合モデルを推定すること。
  • MMLに基づく推定法とモーメント推定法・最尤推定法との間で、パラメータ推定および混合成分数の選択性能を評価・比較すること。
  • タンパク質の構造的状態データの記述において、ケント混合モデルが一般的に用いられるボン・ミーゼス・フィッシャー混合モデルを上回ることを示すこと。

提案手法

  • 5パラメータケント分布(FB₅)のベイズ的パラメータ推定を、最小メッセージ長(MML)原理を用いて導出し、パラメータ推定をデータ圧縮問題として扱う。
  • MMLフレームワークを用いて、モデルパラメータとデータの両方を符号化し、合計メッセージ長を最小化することで最適な推定値を求める。
  • 尤度計算に不可欠な、ガンマ関数および変形ベッセル関数を含む無限級数としてのケント分布の正規化定数を導出する。
  • 全探索的摂動に基づく探索法を用いて、FB₅混合モデルにおける最適な混合成分数を特定する。
  • モデル選択においてMMLと従来の基準(AIC、BIC)を比較し、同じ成分数でも異なるパラメータ推定を持つモデルを区別できるMMLの能力を示す。
  • 得られたMMLに基づく混合モデルを、球面座標(θ, φ)を用いて方向的向きを表現する実験的タンパク質の構造的状態データに適用する。

実験結果

リサーチクエスチョン

  • RQ1最小メッセージ長(MML)原理は、複雑なケント分布に効果的に適用可能か?
  • RQ2MMLに基づくパラメータ推定値は、従来のモーメント推定法および最尤推定法と比較して、バイアスおよび平均二乗誤差の観点で優れているか?
  • RQ3MMLに基づくモデル選択は、AICやBICが同じ成分数を持つモデルを区別できない場合でも、ケント分布混合モデルの成分数を信頼性高く特定できるか?
  • RQ4ケント分布の混合モデルは、一般的に用いられるボン・ミーゼス・フィッシャー混合モデルと比較して、実験的タンパク質の構造的状態データにより良いフィットを示すか?
  • RQ5MMLフレームワークは、同じ成分数でも異なるパラメータ推定を持つモデルを区別できるか?AICやBICとは異なり、その能力を有するか?

主な発見

  • ケント分布に対するMMLに基づくパラメータ推定値は、モーメント推定法および最尤推定法と比較して、顕著にバイアスと平均二乗誤差が低いことが示された。
  • MML基準は、同じ成分数でも異なるパラメータ推定を持つ混合モデルを明確に区別できたが、AICやBICはペナルティ項が同一であるため、その区別が不可能であった。
  • 全タンパク質データセット(N = 251,346)において、MMLに基づく探索法はK=30前後で安定した成分数を推定したのに対し、AICおよびBICはこの点以降に明確な傾向を示さなかった。
  • 小規模なデータサブセット(N = 1,000 から 20,000)においては、MMLとBICは類似した安定した成分数を示したが、AICは一貫して多くの成分を選択した。
  • ケント分布に基づく混合モデルは、タンパク質の構造的状態データの記述において、ボン・ミーゼス・フィッシャー混合モデルを上回り、構造生物学における改善されたノンパラメトリックな帰無仮説モデルとしての役割を果たす。
  • MMLに基づく推定法は再パrameter化に対して不変であるため、MAP推定法と比較して優れたロバストネスと信頼性を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。