Skip to main content
QUICK REVIEW

[論文レビュー] Comparison of Clustering Methods for Time Course Genomic Data: Applications to Aging Effects

Yafeng Zhang, Steve Horvath|arXiv (Cornell University)|Apr 29, 2014
Gene expression and cancer classification参考文献 27被引用数 3
ひとこと要約

本研究では、時間経過に伴う遺伝子発現データに対して、3つのモデルベースの手法(MFDA、FCM、MCLUST)と3つの距離ベースの手法(WGCNA、DTW、ACF)を比較し、シミュレートされたデータおよび実際の加齢関連マイクロアレイデータセットを用いて性能を評価した。WGCNAとMCLUSTが最も優れた手法であったが、特に長く密度の高い遺伝子発現曲線に対しては、WGCNAが生物学的関連性と正確性の面でMCLUSTを上回った。一方、MCLUSTはモデルベースの推論と不確実性の推定を提供する。

ABSTRACT

Time course microarray data provide insight about dynamic biological processes. While several clustering methods have been proposed for the analysis of these data structures, comparison and selection of appropriate clustering methods are seldom discussed. We compared $3$ probabilistic based clustering methods and $3$ distance based clustering methods for time course microarray data. Among probabilistic methods, we considered: smoothing spline clustering also known as model based functional data analysis (MFDA), functional clustering models for sparsely sampled data (FCM) and model-based clustering (MCLUST). Among distance based methods, we considered: weighted gene co-expression network analysis (WGCNA), clustering with dynamic time warping distance (DTW) and clustering with autocorrelation based distance (ACF). We studied these algorithms in both simulated settings and case study data. Our investigations showed that FCM performed very well when gene curves were short and sparse. DTW and WGCNA performed well when gene curves were medium or long ($>=10$ observations). SSC performed very well when there were clusters of gene curves similar to one another. Overall, ACF performed poorly in these applications. In terms of computation time, FCM, SSC and DTW were considerably slower than MCLUST and WGCNA. WGCNA outperformed MCLUST by generating more accurate and biological meaningful clustering results. WGCNA and MCLUST are the best methods among the 6 methods compared, when performance and computation time are both taken into account. WGCNA outperforms MCLUST, but MCLUST provides model based inference and uncertainty measure of clustering results.

研究の動機と目的

  • 時間経過に伴う遺伝子発現データに対して6つのクラスタリング手法の性能を評価・比較すること。特に加齢関連のダイナミクスに焦点を当てる。
  • 曲線の長さやサンプリングパターンの違いを考慮した機能的ゲノムデータに対して、最も正確で計算効率の良いクラスタリング手法を同定すること。
  • 実際の加齢関連データセットにおけるクラスタリング結果の生物学的関連性を評価すること。特に加齢関連の遺伝子発現パターンの同定を目的とする。
  • モデルベースの推論(例:不確実性の定量化)と距離ベースの効率の間のトレードオフを、時間経過に伴うデータのクラスタリングにおいて検討すること。

提案手法

  • スムージングスプラインクラスタリング(MFDA)、希なサンプリングに適した関数クラスタリング(FCM)、モデルベースクラスタリング(MCLUST)の3つのモデルベース手法を評価。これらはすべて混合モデルとEMアルゴリズムを用いてパrameter推定を実施した。
  • 重み付き遺伝子共発現ネットワーク解析(WGCNA)、動的時間ワープ(DTW)、自己相関に基づく距離(ACF)の3つの距離ベース手法を評価。それぞれが関数データに適した異なる類似性測定を用いた。
  • スムージングスプライン法とビニング法を用いて、断面的データを一貫性のある疑似縦断的曲線に変換した。
  • モデルベース手法におけるモデル選択およびクラスタ数の決定にベイズ情報量基準(BIC)を用いた。
  • 曲線の長さ(短い、中程度、長い)とサンプリングの希薄さを変化させたシミュレーションスタディを実施し、手法のロバストネスをテストした。
  • 実データセット(オランダの発現データセットおよびSAFHS発現データセット)を用いて結果を検証し、加齢関連の遺伝子クラスタに焦点を当てた。

実験結果

リサーチクエスチョン

  • RQ1時間経過に伴うマイクロアレイデータにおいて、どのクラスタリング手法が生物学的に意味のある加齢関連の遺伝子発現パターンを最もよく同定できるか?
  • RQ2遺伝子曲線が短い、希なサンプリング、または長く密度の高いサンプリングの場合、クラスタリング手法の性能はどのように比較されるか?
  • RQ3評価した6つの手法において、計算効率とクラスタリングの正確性の間にはどのようなトレードオフがあるか?
  • RQ4モデルベース手法(例:MCLUST)と距離ベース手法(例:WGCNA)は、不確実性の推定やモデルベースの推論において、どのように比較されるか?
  • RQ5スムージングとビニングの異なるデータ変換手法は、クラスタリングの結果や手法の性能にどの程度影響を与えるか?

主な発見

  • WGCNAは、特に長く密度の高い曲線(15件以上の観測値以上)に対して、加齢関連の遺伝子クラスタを識別する際、他のすべての手法を上回った。特に、年齢とともに発現が低下する明確な単調なトレンドを示す遺伝子群に対して優れた性能を示した。
  • FCMは、短く希なサンプリングの曲線に対して最も優れた性能を示した。これは、不規則にサンプリングされた関数データを想定した設計に合致していた。
  • DTWは中程度の長さの曲線(10件の観測)に対して優れた性能を示し、特に曲線の形状にわずかな変動がある場合に有効であった。
  • ACFは、すべてのシミュレーションおよび実データの設定において低精度で、クラスタの分離が不十分であった。
  • 計算時間の観点では、WGCNAとMCLUSTはMFDA、FCM、DTWよりも顕著に高速であり、20,000個の遺伝子の解析を約100分で完了した。一方、FCMとMFDAは1日以上を要した。
  • 固有遺伝子(eigengene)と平均曲線の形状が類似していたにもかかわらず、ヒートマップの可視化においてWGCNAが同定したクラスタは、年齢との関連性がより強く、明確に現れており、生物学的解釈可能性が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。