Skip to main content
QUICK REVIEW

[論文レビュー] Adjacency-constrained hierarchical clustering of a band similarity matrix with application to Genomics

Christophe Ambroise, Alia Dehman|arXiv (Cornell University)|Feb 5, 2019
Gene expression and cancer classification参考文献 39被引用数 33
ひとこと要約

本論文は、近傍制約付き Ward HAC アルゴリズムを、帯域化された類似行列とともに提案し、準線形時間と線形空間計算量を実現してスケーラブルなゲノム区分を可能にする。さらに GWAS および Hi-C データ解析のための R パッケージ adjclust を提供する。

ABSTRACT

Motivation: Genomic data analyses such as Genome-Wide Association Studies (GWAS) or Hi-C studies are often faced with the problem of partitioning chromosomes into successive regions based on a similarity matrix of high-resolution, locus-level measurements. An intuitive way of doing this is to perform a modified Hierarchical Agglomerative Clustering (HAC), where only adjacent clusters (according to the ordering of positions within a chromosome) are allowed to be merged. A major practical drawback of this method is its quadratic time and space complexity in the number of loci, which is typically of the order of 10^4 to 10^5 for each chromosome. Results: By assuming that the similarity between physically distant objects is negligible, we propose an implementation of this adjacency-constrained HAC with quasi-linear complexity. Our illustrations on GWAS and Hi-C datasets demonstrate the relevance of this assumption, and show that this method highlights biologically meaningful signals. Thanks to its small time and memory footprint, the method can be run on a standard laptop in minutes or even seconds. Availability and Implementation: Software and sample data are available as an R package, adjclust, that can be downloaded from the Comprehensive R Archive Network (CRAN).

研究の動機と目的

  • GWAS および Hi-C 研究において、 locus レベルの類似性行列に基づいて染色体を領域に分割する必要性を動機づける。
  • 大規模なゲノムデータセットにスケーラブルな、近傍制約付き階層クラスタリング手法を開発する。
  • 帯域化された類似性仮定を活用してほぼ線形時間・線形空間の計算量を達成する。
  • ゲノムデータへの適用のための効率的な実装と実践的なガイダンスを提供する。)

提案手法

  • 事前に定義されたゲノム順序に沿って隣接クラスタ間のマージのみを許可することで、階層的アグロメーティブクラスタリングを拡張する。
  • Ward の結合基準を採用し、結合更新を事前計算された類似性和の観点で表現する。これによりペンシル和表現を介して候補マージごとに定数時間の結合計算を可能にする。
  • |i-j| >= h のとき s_ij = 0 となる帯域化類似性仮定を課し、ストレージを O(ph) に、時間を O(p(h+log p)) に削減する。
  • 候補マージを min-heap に格納して、各手番で最良の隣接マージを効率的に特定・更新し、全体の複雑さを O(p(h+log p)) に達成する。
  • R 実装 adjclust(C コア付き)を提供し、クラスタレベルを選択するためのモデル選択ガイダンス(broken stick, slope heuristic)を提供する。

実験結果

リサーチクエスチョン

  • RQ1帯域化された類似性行列を用いた近傍制約付き HAC は、ゲノミクスにおいて生物学的に意味のある区分を生み出すか。
  • RQ2距離に基づく疎性である帯域仮定は、クラスタリング品質を損なうことなく実質的な計算利得をもたらすか。
  • RQ3提案手法は GWAS LD ブロックおよび Hi-C データにおける樹形図の構造と解釈性の観点でどう性能を示すか。
  • RQ4ゲノム文脈での帯域幅 h の選択やモデル選択について、どのような実践的指針を示せるか。

主な発見

  • 帯域化された類似性行列を伴う近傍制約付き Ward HAC は、準線形時間と線形空間計算量を達成する。それぞれ O(p(h+log p)) と O(ph)。
  • ペンシルベースの和を事前計算することで、候補マージの Ward 結合を定数時間で計算できる。
  • 候補融合を管理するために min-heap を用いることで、全体として大規模ゲノムデータセットに適した効率的なアルゴリズムになる。
  • GWAS LD ブロックおよび Hi-C データに対する実証的な結果は、帯域アプローチが樹形図構造を保持し、生物学的に意味のある区分を生み出すことを示し、全帯域法よりも効率が高い。
  • GWAS では、帯域幅を縮小しても h が適度に大きい場合(例:h ≥ 2000)には樹形図はほぼ全帯域と同一になる。
  • Hi-C 分析は、疎で帯域化されたクラスタリングが計算時間とメモリを著しく削減しつつ、境界での TAD に似た構造や DI 富化に関する解釈性を維持することを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。