Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Covariance Shrinkage and Regularised Partial Correlations

Suzanne Jin, Cédric Notredame|arXiv (Cornell University)|Dec 1, 2022
Geochemistry and Geologic Mapping被引用数 5
ひとこと要約

本稿では、高次元で標本サイズが小さい状況下での推定を改善するために、対数比非相関組成を特化したターゲットとして用いる、組成データにおける対数比共分散行列の新規正則化手法を提案する。この手法は、単位和制約に起因するバイアスを低減することで偏相関推定を向上させ、シミュレーションおよび単細胞RNA-seqデータにおいて標準的な正則化を上回る性能を示す。

ABSTRACT

We propose an estimation procedure for covariation in wide compositional data sets. For compositions, widely-used logratio variables are interdependent due to a common reference. Logratio uncorrelated compositions are linearly independent before the unit-sum constraint is imposed. We show how they are used to construct bespoke shrinkage targets for logratio covariance matrices and test a simple procedure for partial correlation estimates on both a simulated and a single-cell gene expression data set. For the underlying counts, different zero imputations are evaluated. The partial correlation induced by the closure is derived analytically. Data and code are available from GitHub.

研究の動機と目的

  • 組成データにおける単位和制約が引き起こす共分散および偏相関推定のバイアスを解消すること。
  • 対数比変換された組成データに特化した一貫性のある正則化手順を構築し、対数比変数間の独立性を仮定しないこと。
  • 対数比非相関組成を正則化ターゲットとして活用することで、直接相互作用を特定するのに重要な偏相関の推定を向上させること。
  • 合成データおよび実際の単細胞遺伝子発現データを用いて、さまざまな標本サイズおよびゼロ値補完戦略下での性能をベンチマークすること。
  • ゲノムおよび組成データ解析に統合可能な、計算的に効率的かつ再現性のある実装を提供すること。

提案手法

  • 対数比非相関(LU)組成を用いて、組成制約に整合する対数比共分散行列の正則化ターゲットを定義する。
  • 2通りの同等の手法を提案:(1) 対数比変換の前に対数比の基本共分散行列を正則化する方法、(2) LUに基づくターゲットを用いて直接対数比共分散行列を正則化する方法。前者を単純さの観点から優先する。
  • LU共分散行列の解析的逆行列を導出することで、数値的不安定性を回避し、正則化ターゲットから直接偏相関を計算する。
  • James-Stein正則化を基本共分散行列に適用し、標本共分散とLUターゲットの凸結合を用いて分散を低減する。
  • 合成データおよびリサンプリングされた単細胞RNA-seqデータを用いて、さまざまなゼロ値補完手法下での平均二乗誤差(MSE)を評価する。
  • Rパッケージとして`bShrink`関数を実装し、GitHubに公開。`propr`などの既存ツールとの統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1対数比変換された変数同士の内在的依存性を考慮した上で、組成データに適した共分散正則化手法はどのように設計できるか?
  • RQ2対数比非相関組成は、高次元状況下で対数比共分散行列の最適な正則化ターゲットとして機能するか?
  • RQ3偏相関推定における平均二乗誤差の観点から、提案手法は対数比共分散行列に対する単純な正則化と比べてどのように優れているか?
  • RQ4単細胞遺伝子発現データにおける偏相関推定性能に、さまざまなゼロ値補完戦略が与える影響は何か?
  • RQ5LU組成における偏相関の解析的表現が、組成ネットワークにおける直接相互作用の解釈をどの程度向上させるか?

主な発見

  • 提案手法である基本共分散行列の正則化により、特に標本サイズが小さい状況(N=8~N=40)において、単純な正則化と比較して対数比共分散推定の平均二乗誤差が顕著に低減された。
  • 単細胞遺伝子発現データにおいて、本手法は全標本サイズ(N=100~N=2500)でノーマル正則化および単純な正則化を上回り、ゼロ値補完戦略にかかわらずMSEが一貫して改善された。
  • 対数比非相関組成における偏相関の解析的表現により、単位和制約下でも正しい条件付き独立構造が保持されていることが確認された。
  • LU組成を正則化ターゲットとして用いることで、特に高次元かつスパースな組成データにおいて、従来手法よりも安定的かつ正確な偏相関推定が可能になった。
  • 単細胞データにおけるさまざまなゼロ値補完手法に対して、本手法は性能が一貫して維持され、ボックスプロット比較でもそのロバストネスが示された。
  • `propr`パッケージを用いた割合と偏相関分析ワークフローに直接統合可能な、Rにおける`bShrink`関数の実装が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。