Skip to main content
QUICK REVIEW

[論文レビュー] Data Integration with High Dimensionality

Xin Gao, Raymond J. Carroll|arXiv (Cornell University)|Oct 3, 2016
Gene expression and cancer classification被引用数 3
ひとこと要約

本稿は、標本サイズとともに真の予測子数が増加する状況において、高次元データ統合のための擬似尤度情報基準を提案する。複数の実験からの周辺尤度を組み合わせることで、情報豊富な予測子オブジェクトを選択する。正則性条件下で選択の一貫性を確立し、2次形式の大偏差境界を用いて理論的保証を伴う無限大のモデルサイズへのベイズ情報基準の拡張を実現する。

ABSTRACT

We consider a problem of data integration. Consider determining which genes affect a disease. The genes, which we call predictor objects, can be measured in different experiments on the same individual. We address the question of finding which genes are predictors of disease by any of the experiments. Our formulation is more general. In a given data set, there are a fixed number of responses for each individual, which may include a mix of discrete, binary and continuous variables. There is also a class of predictor objects, which may differ within a subject depending on how the predictor object is measured, i.e., depend on the experiment. The goal is to select which predictor objects affect any of the responses, where the number of such informative predictor objects or features tends to infinity as sample size increases. There are marginal likelihoods for each way the predictor object is measured, i.e., for each experiment. We specify a pseudolikelihood combining the marginal likelihoods, and propose a pseudolikelihood information criterion. Under regularity conditions, we establish selection consistency for the pseudolikelihood information criterion with unbounded true model size, which includes a Bayesian information criterion with appropriate penalty term as a special case. Simulations indicate that data integration improves upon, sometimes dramatically, using only one of the data sources.

研究の動機と目的

  • 連続的・バイナリ・離散的応答タイプを併用する複数の実験で測定される予測子オブジェクト(例:遺伝子)を統合するデータ統合問題に対処すること。
  • 真の予測子数が標本サイズとともに無限大に近づく状況においても一貫性を保つモデル選択基準を開発すること。
  • 異なる実験からの周辺尤度を統合的に組み合わせ、統合尤度フレームワークを構築して共同推論を可能にすること。
  • 一般正則性条件下(モデル不適合を含む)で、提案された情報基準の理論的一致性を確立すること。
  • 真のモデルサイズが発散する高次元予測子オブジェクトを伴う状況に、既存の情報基準(例:BIC)を拡張すること。

提案手法

  • K個の異なる実験からの周辺尤度を組み合わせることで擬似尤度を定式化し、それぞれが同じ予測子オブジェクト集合を異なる手法で測定する。
  • 無限大の真のモデルサイズに対処できるように設計されたペナルティ項を備えた擬似尤度情報基準を導出する。
  • 大偏差理論を応用して2次形式の尾確率に対する鋭い上界を導出し、漸近的カイ二乗近似に代わるものとする。
  • モーメント生成関数技術と積率の有界性を用いて、擬似尤度スコアおよびその導関数の逸脱を制御する。
  • ボンフェローニ不等式と濃度不等式を用いて、モデル空間全体におけるすべてのモデルにおける最大逸脱を上界で抑える。
  • 標本サイズが増加する際、誤ったモデルが選択される確率が消えることを示すことにより、一貫性を確立する。これは、真の予測子数がnとともに増加する場合でも成立する。

実験結果

リサーチクエスチョン

  • RQ1真の予測子数が標本サイズとともに増加する状況において、擬似尤度に基づく情報基準はモデル選択の一貫性を達成できるか?
  • RQ2高次元設定でモデルサイズが発散する状況において、情報基準のペナルティ項はどのように設計すべきか?
  • RQ3漸近的カイ二乗近似が失敗する場合、擬似尤度比統計量の尾確率を制御するために必要な理論的道具は何か?
  • RQ4複数の実験にわたるデータ統合は、単一のデータソースに比べて、モデル選択性能をどの程度向上させるか?
  • RQ5モデル不適合が存在する状況でも、提案された基準が真のモデルを一貫して選択するための正則性条件は何か?

主な発見

  • 提案された擬似尤度情報基準は、正則性条件下で、真の予測子数が標本サイズとともに増加する場合でも選択の一貫性を達成する。
  • ペナルティ項を $ \gamma_n = 6w(1+\gamma)\log(p_n) $ または $ \gamma_n = 6w(\log p_n + \log \log p_n) $ と選ぶことで、モデル選択確率が1に収束することが示された。
  • 2次形式のための大偏差境界は、信頼性の低い漸近的カイ二乗近似に代わる、鋭い有限標本上界を提供する。
  • シミュレーションでは、単一ソース解析に比べて本手法が優れた性能を示し、データ統合によりモデル選択の正確性が顕著に向上した。
  • 理論的結果として、ベイズ情報基準を真のモデルサイズが無限大に発散する高次元設定に拡張した。これは、従来の境界付き真のモデルサイズに限られた先行研究を一般化する。
  • 一貫性の証明は、濃度不等式とモーメントバウンドを用いて、すべてのモデルにおける擬似尤度スコアおよびその導関数の最大逸脱を制御することに依存する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。