[論文レビュー] A Mixed-effects Model for Incomplete Data With Batch-Level Abundance-Dependent Missing-Data Mechanism
本稿では、iTRAQプロテオミクスデータにおけるバッチ効果と、新たなバッチレベルの濃度依存型欠損データ機構(BADMM)を同時に扱う混合効果モデルであるmixEMMを提案する。欠損確率をバッチレベルのタンパク質濃度の関数として指数リンク関数を用いて明示的にモデル化することにより、欠損機構を無視する従来手法や相対的濃度に依存する手法と比較して、パラメータ推定の精度と統計的検出力が向上する。
In mass spectrometry based quantitative proteomics research, the emerging iTRAQ technique has been widely adopted for high throughput protein profiling, as it enables one to measure multiple samples simultaneously in one multiplex experiment and thus greatly enhances the throughput of protein quantification. However, the technical variation across different iTRAQ multiplex experiments is often large due to the dynamic nature of MS instruments. This leads to strong batch effects in the iTRAQ data. Moreover, the iTRAQ data often contain substantial batch-level non-ignorable missingness. Specifically, the abundance measures of a given protein/peptide are often missing altogether in all the samples from the same batch, with the missing probability depending on the combined batch-level abundances. We term this unique missing-data mechanism as the Batch-level Abundance-Dependent Missing-data mechanism (BADMM). We introduce a new method, mixEMM, for analyzing iTRAQ data with batch effects and batch-level non-ignorable missingness. The mixEMM method employs a linear mixed-effects model and explicitly models the batch effects and the BADMM in the likelihood function. With simulation studies, we showed that compared with existing approaches that utilize relative abundances and ignore the missing batches under the missing completely at random assumption, the mixEMM method achieves more accurate parameter estimation and inference.We applied the method to an iTRAQ proteomics data from a breast cancer study and identified phosphopeptides differentially expressed between different breast cancer subtypes. The method can be applied to general clustered data with cluster level non ignorable missing-data mechanisms.
研究の動機と目的
- iTRAQを用いた定量的プロテオミクス実験におけるバッチ効果と無視できない欠損性の課題に対処すること。
- タンパク質測定値がバッチ全体で欠損するという特徴的な欠損データ機構—バッチレベルの濃度依存型欠損データ機構(BADMM)—をモデル化すること。
- 尤度に基づく混合効果モデルにBADMMを明示的に組み込むことで統計的推論を改善し、推定精度と検出力を向上させること。
- クラスターレベルで無視できない欠損性を示すクラスタードデータに一般化可能なフレームワークを提供すること。プロテオミクスを超えた分野への応用も可能である。
提案手法
- ランダムバッチ効果と行動変数の固定効果を考慮するため、線形混合効果モデルを用いる。
- バッチレベル平均濃度の指数リンク関数を用いて、バッチ内の欠損確率をモデル化し、BADMMを捉える。
- 期待値-条件付き最大化(ECM)アルゴリズムを用いて、欠損データとランダム効果を同時に処理する尤度推定値(MLE)を計算する。
- 尤度関数が欠損データ機構を統合しているため、無視できない欠損性のもとでも妥当な推論が可能である。
- 柔軟性を高めるために、ロジット関数などの代替リンク関数も検討されたが、計算効率の観点から指数関数が好まれた。
- 多変量解析への拡張が可能であり、ペプチドレベルまたはタンパク質レベルに適用可能。ペプチドレベルの結果をタンパク質レベルの推論に要約するオプションも用意されている。
実験結果
リサーチクエスチョン
- RQ1BADMMを明示的にモデル化することで、BADMMを無視するか相対的濃度に依存する従来手法と比較して、iTRAQプロテオミクスデータにおけるパラメータ推定の精度がどの程度向上するか?
- RQ2バッチレベルの欠損性が濃度に依存しており、かつ頻度が高い状況下でも、mixEMM手法が統計的検出力とバイアスの低減を維持できるか?
- RQ3相対的濃度を用い、欠損性を無視できると仮定する従来手法と比較して、mixEMMの性能はどのように異なるか?
- RQ4欠損データ機構のモデル化に異なるリンク関数(例:指数関数 vs. ロジット)を用いることで、推定精度と計算効率にどのような影響が生じるか?
主な発見
- シミュレーション研究では、BADMMを無視するか相対的濃度に依存する従来手法と比較して、mixEMMが顕著に高いパラメータ推定精度と優れた統計的検出力を達成した。
- mixEMMは、バッチレベルの欠損性と分散構造を適切に捉えることで、差別的発現解析における第一種および第二種の誤り率を低減した。
- 指数リンク関数は、ロジット関数と同等またはそれ以上の性能を示したが、計算コストは著しく低かった。
- CPTAC乳癌リン酸化プロテオミクスデータセットにおいて、mixEMMは乳癌サブタイプ間の差別的発現リン酸化ペプチドを、感度と正確性を向上させながら同定した。
- 欠損率や濃度分布が変動する状況下でも、特に欠損性がバッチレベルの濃度に強く依存する場合に、本手法は頑健性を示した。
- Rパッケージ「mixEMM」はCRANに公開予定であり、クラスタ構造と不完全な構造を示す類似の高スループットオミクスデータへの本手法の広範な応用を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。