Skip to main content
QUICK REVIEW

[論文レビュー] Structure-Adaptive Sequential Testing for Online False Discovery Rate Control

Bowen Gang, Wenguang Sun|arXiv (Cornell University)|Feb 28, 2020
Statistical Methods in Clinical Trials参考文献 23被引用数 4
ひとこと要約

本稿では、時間変動するデータ構造に適応するため、条件付き局所偽発見率(Clfdr)を用いて動的にアルファ・ウェルスを割り当てる、構造適応型オンライン誤発見率(FDR)制御手法であるSASTを提案する。局所信号パターンと適応的アルファ投資ルールを活用することで、従来のオンライン手法と比較して顕著に高い統計的パワーを達成しながら、厳密なFDR制御を維持する。実世界の時系列データおよび遺伝子データセットを用いた実験でその有効性が示された。

ABSTRACT

Consider the online testing of a stream of hypotheses where a real--time decision must be made before the next data point arrives. The error rate is required to be controlled at {all} decision points. Conventional \emph{simultaneous testing rules} are no longer applicable due to the more stringent error constraints and absence of future data. Moreover, the online decision--making process may come to a halt when the total error budget, or alpha--wealth, is exhausted. This work develops a new class of structure--adaptive sequential testing (SAST) rules for online false discover rate (FDR) control. A key element in our proposal is a new alpha--investment algorithm that precisely characterizes the gains and losses in sequential decision making. SAST captures time varying structures of the data stream, learns the optimal threshold adaptively in an ongoing manner and optimizes the alpha-wealth allocation across different time periods. We present theory and numerical results to show that the proposed method is valid for online FDR control and achieves substantial power gain over existing online testing rules.

研究の動機と目的

  • 時間変動するデータ構造への適応性に欠ける既存のオンラインFDR制御手法の限界、および固定された誤差割り当てによるパワー損失を是正すること。
  • 将来のデータが入手不可能でアルファ・ウェルスも限られている状況でも、各意思決定ポイントで厳密なFDR制御を維持する順次検定フレームワークの構築。
  • 局所信号パターン(クラスタリングやスパarsityなど)を活用し、最適なしきい値を学習することで、時間経過に伴うアルファ・ウェルスの最適投資を最適化すること。
  • アルファ・ウェルスの早期枯渇を防ぎ、継続的な発見を可能にするため、オンラインテストの早期終了を回避すること。
  • 信号のグループ化や大きさのトレンドといったドメイン固有の構造的情報を意思決定プロセスに統合し、統計的パワーを向上させること。

提案手法

  • 順次検定における利益と損失を正確にモデル化する新しいアルファ投資アルゴリズムを導入し、観測されたデータ構造に基づいてアルファ・ウェルスを動的に再割り当て可能にする。
  • 時間変動する信号パターンを捉え、棄却意思決定に情報を与えるために、条件付き局所偽発見率(Clfdr)を主要統計量として採用する。
  • 時系列データからトレンドおよび季節成分をSTL分解で除去し、残差を二成分正規混合モデルでモデル化することで、経験的ノイズ分布を推定する。
  • Clfdrに基づくデータ駆動型しきい値設定ルールを適用し、局所信号強度と構造を反映した適応的棄却しきい値を選択する。
  • Clfdr推定の安定化、特にオンラインテストの初期段階において、バーニングイン段階と近隣ベースのスムージングを実装する。
  • Clfdr統計量と一般化されたアルファ投資フレームワークを統合し、FDR制御の妥当性を保ちつつ、発見パワーを最大化する。

実験結果

リサーチクエスチョン

  • RQ1信号のクラスタリングやスパarsityといった局所的データ構造に適応することで、オンラインFDR制御のパワーを向上させることは可能か?
  • RQ2時間経過に伴い、FDR制御を維持しながら発見収量を最大化するため、アルファ・ウェルスをどのように動的に割り当てるべきか?
  • RQ3条件付き局所偽発見率(Clfdr)は、標準的なp値ベース手法と比較して、順次検定における検出パワーをどの程度向上させ得るか?
  • RQ4構造適応型手法は、アルファ・ウェルスの枯渇によるオンラインテストの早期終了を防げるか?
  • RQ5実世界のストリーミングデータ環境において、SASTはオフラインおよび既存のオンラインFDR手順と比較して、どの程度優れているか?

主な発見

  • SASTは、FDR水準0.0001でNYCタクシー・データセットにおいて201件の異常ポイントを検出し、オフラインBH手順(179件)および他のオンライン手法を上回った。
  • IMPCゲノタイプ・データセットでは、FDR水準0.05でSASTが12,975件の発見を達成し、オフラインBH手順(12,907件)およびすべての他のオンライン手法を上回った。
  • SAST.DDバージョンは、LORD++(8,517件)、LOND(2,905件)、固定しきい値手法(4,158件)を上回る高いパワーを示し、ロバストで適応可能な性能を示した。
  • 本手法は、時系列データにおけるクラスタ化された異常を効果的に捉えた。信号パターンに内在する構造的情報が、p値のみに依存する手法を上回る検出性能を実現した。
  • Clfdrの使用により、局所的データ構造のより良い活用が可能となり、高次元ストリーミング環境下でもFDR制御を逸脱することなく、統計的パワーの向上が達成された。
  • SASTはすべての意思決定ポイントで有効なFDR制御を維持し、信号強度と構造に基づく知的なアルファ・ウェルスの再投資により、早期終了を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。