Skip to main content
QUICK REVIEW

[論文レビュー] A Review of Statistical Methods in Imaging Genetics

Farouk S. Nathoo, Linglong Kong|arXiv (Cornell University)|Jul 23, 2017
Genetic Associations and Epidemiology参考文献 30被引用数 7
ひとこと要約

この論文は、画像遺伝学におけるビッグデータスクエアド(BD²)分析のための高度な統計的手法をレビューし、高次元の神経画像データと遺伝的データの共同モデリングに焦点を当てている。空間的構造を有するベイズ多次元回帰モデルを提案し、マルコフ確率場とスパース精度行列を用いて空間的依存性と計算スケーラビリティを扱う。これにより、大規模な画像遺伝学研究における効率的な推論が可能となる。

ABSTRACT

With the rapid growth of modern technology, many large-scale biomedical studies have been/are being/will be conducted to collect massive datasets with large volumes of multi-modality imaging, genetic, neurocognitive, and clinical information from increasingly large cohorts. Simultaneously extracting and integrating rich and diverse heterogeneous information in neuroimaging and/or genomics from these big datasets could transform our understanding of how genetic variants impact brain structure and function, cognitive function, and brain-related disease risk across the lifespan. Such understanding is critical for diagnosis, prevention, and treatment of numerous complex brain-related disorders (e.g., schizophrenia and Alzheimer). However, the development of analytical methods for the joint analysis of both high-dimensional imaging phenotypes and high-dimensional genetic data, called big data squared (BD$^2$), presents major computational and theoretical challenges for existing analytical methods. Besides the high-dimensional nature of BD$^2$, various neuroimaging measures often exhibit strong spatial smoothness and dependence and genetic markers may have a natural dependence structure arising from linkage disequilibrium. We review some recent developments of various statistical techniques for the joint analysis of BD$^2$, including massive univariate and voxel-wise approaches, reduced rank regression, mixture models, and group sparse multi-task regression. By doing so, we hope that this review may encourage others in the statistical community to enter into this new and exciting field of research.

研究の動機と目的

  • 高次元の画像データと遺伝的データの共同解析が引き起こす計算的・統計的課題に対処すること。これは、ビッグデータスクエアド(BD²)と呼ばれる。
  • 神経画像表現型の空間的依存性と遺伝マーカーの連鎖ダイレクト(LD)を考慮する統計的手法を開発・レビューすること。
  • 大規模コhortにおけるマルチモodalデータ統合を通じて、脳構造および機能と関連する遺伝的関連性の検出を向上させること。
  • 特にベイズ階層モデルを含む高度な統計技法の採用を、統計学および神経画像研究コミュニティに促進すること。
  • 画像、ゲノム、臨床データの統合的分析を通じて、脳関連疾患リスクと関連する遺伝変異を同定するための方法論的基盤を提供すること。

提案手法

  • 画像表現型の多次元正規尤度を用いたベイズ階層モデルを提案。精度行列は隣接行列Aと空間相関パラメータρを用いて空間的依存性を表現する。
  • 誤差構造に条件付き自己回帰(CAR)仕様を用い、各側頭部における空間的依存性と、左右対称領域間の相関をモデル化する。
  • 高次元設定における変数選択と過剰適合の低減を目的に、回帰係数Wにスパース化事前分布を導入する。
  • スパース数値線形代数とスパース精度行列を用いたギブスサンプリングを採用し、大規模な画像遺伝学データに対する計算スケーラビリティを確保する。
  • 大規模推論のためのより高速な代替手法として、平均場変分ベイズアルゴリズムを開発する。
  • Rパッケージ'bgsmtr'に実装。空間的構造を有する事前分布とスパース行列演算による効率的計算をサポートする。

実験結果

リサーチクエスチョン

  • RQ1空間的依存性と高次元性を考慮しつつ、高次元の画像データと遺伝的データを共同で分析する統計的手法をどのように開発できるか。
  • RQ2画像遺伝学におけるビッグデータスクエアド(BD²)分析における計算的および理論的課題は何か。それらはどのように克服できるか。
  • RQ3神経画像表現型の空間的相関と遺伝的連鎖ダイレクト(LD)を、統一された統計枠組み内で効果的にモデル化できるか。
  • RQ4スパース精度構造を有するベイズ階層モデルは、大規模な画像遺伝学研究におけるスケーラブルかつ正確な推論を可能にするか。
  • RQ5ギブスサンプリングと変分ベイズ法の間で、複雑な空間モデルの適合に際して、それぞれの相対的利点は何か。

主な発見

  • 提案された空間的ベイズモデルは、スパース隣接行列Aを用いたマルコフ確率場構造により、神経画像表現型の空間的依存性を効果的に捉えることができる。
  • 精度行列のフル条件付き分布においてスパース性を維持することで、計算スケーラビリティが確保され、効率的なギブスサンプリングが可能となる。
  • 空間相関パラメータρとクロスヘミスフェアの共分散行列Σの導入により、内部および両側頭部間の依存性を柔軟にモデル化できる。
  • 回帰係数Wにスパース化事前分布を導入することで、高次元設定における変数選択が可能となり、過剰適合が低減される。
  • 平均場変分ベイズアルゴリズムは、ギブスサンプリングの代替としてスケーラブルな手法として開発され、大規模データセットではさらに高い効率性が期待できる。
  • モデルはRパッケージ'bgsmtr'に実装されており、将来のバージョンでは強化されたアルゴリズムと大規模な画像遺伝学データを対象としたサポートが予定されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。