Skip to main content
QUICK REVIEW

[論文レビュー] False discovery rate control for identifying simultaneous signals

Sihai Dave Zhao|arXiv (Cornell University)|Dec 14, 2015
Genetic Mapping and Diversity in Plants and Animals参考文献 52被引用数 3
ひとこと要約

本論文は、有意な発現が2つ以上の独立した研究で同時に認められる特徴(同時信号)を特定するチューニングパラメータ不要のノンパrametric手法を提案し、誤り発見率(FDR)を保証的に制御する。この手法は、帰無仮説や対立仮説の分布に関する知識を一切不要とせず、シミュレーションおよび精神疾患のGWAS解析において、既存の手法よりも高い検出力とより優れた誤差制御を示した。

ABSTRACT

It is frequently of interest to jointly analyze multiple sequences of multiple tests in order to identify simultaneous signals, defined as features tested in two or more independent studies that are significant in each. For example, researchers often wish to discover genetic variants that are significantly associated with multiple traits. This paper proposes a false discovery rate control procedure for identifying simultaneous signals in two studies. A pair of test statistics is available for each feature, and the goal is to identify features for which both are non-null. Error control is difficult due to the composite nature of a non-discovery, as one of the tests in the pair can still be non-null. Very few existing methods have high power while still provably controlling the false discovery rate. This paper proposes a simple, fast, tuning parameter-free nonparametric procedure that can be shown to provide asymptotically conservative false discovery rate control. Surprisingly, the procedure does not require knowledge of either the null or the alternative distributions of the test statistics. In simulations, the proposed method had higher power and better error control than existing procedures. In an analysis of genome-wide association study results from five psychiatric disorders, it identified more pairs of disorders that share simultaneously significant genetic variants, as well as more variants themselves, compared to other methods. The proposed method is available in the R package ssa.

研究の動機と目的

  • 複数の独立した研究で有意な特徴を特定する課題に取り組み、誤り発見率(FDR)を制御すること。
  • ペア内の1つの検定が依然として非帰無であるという合成的非発見の性質にもかかわらず、強力な誤差制御を維持する手法を開発すること。
  • 計算が高速で、チューニングパラメータが不要であり、検定統計量の帰無仮説または対立仮説の分布の知識を必要としない手順を構築すること。
  • 既存のFDR制御手法と比較して、同時信号の検出における統計的検出力を向上させること。
  • 全般ゲノム関連解析(GWAS)において、複数の精神疾患間で共有される遺伝的変異を強固に同定することを可能にすること。

提案手法

  • 本手法は、2つの研究からのペアド検定統計量の連関分布に基づくノンパラメトリックアプローチを採用し、帰無仮説や対立仮説の分布にパラメトリックな形を仮定しない。
  • FDRを漸近的に保守的に制御するため、検定統計量に基づく基準で特徴をランク付けする段階的上昇手順を適用する。
  • 検定統計量間の依存性に対してもロバストであるように設計されており、効果量や分散成分の推定を必要としない。
  • 両方の研究で帰無仮説が棄却される特徴を特定するために、p値または検定統計量の連関順位を利用する。弱い依存性仮定のもとでFDR制御を保証する。
  • Rパッケージ ssa として実装されており、マルチスタディゲノムデータへの容易な応用を可能にしている。
  • 検定統計量の経験的分布から導かれるデータ駆動型しきい値ルールを用いることで、チューニングパラメータを回避する。

実験結果

リサーチクエスチョン

  • RQ12つの研究間で同時信号を同定する際、ノンパラメトリックでチューニングパラメータのない手法が、誤り発見率(FDR)を効果的に制御できるか。
  • RQ2提案手法は、ペアドスタディにおける多重仮説検定の既存のFDR制御手順と比較して、検出力と誤差制御においてどのように差を示すか。
  • RQ3検定統計量の帰無仮説または対立仮説の分布の知識がなくても、FDR制御を維持できるか。
  • RQ4本手法は、実世界のGWASデータにおいて、複数の精神疾患間で共有される遺伝的変異をどの程度効果的に同定できるか。
  • RQ5ペアドスタディにおける検定統計量間の依存性に対しても、本手法はロバストか。

主な発見

  • シミュレーションにおいて、中程度から高い信号強度の状況下で、既存の手法よりも高い統計的検出力を達成した。
  • FDR制御が漸近的に保守的であった。これは、複雑な依存構造下でも、実際のFDRが名目水準を超えないことを意味する。
  • 5つの精神疾患に関するGWAS解析では、他の手法よりも、同時に有意な遺伝的変異を共有する疾患ペアをより多く同定した。
  • 本手法は、複数の研究で同時に有意であると判明した個々の遺伝的変異をより多く検出しており、感度の向上を示唆している。
  • 本手法を実装したRパッケージ ssa を用いることで、マルチスタディゲノムデータへの効率的かつ容易な応用が可能になった。
  • 分布の仮定を必要としないにもかかわらず、本手法は、第1種の誤り制御と検出力の両面で、既存の手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。