[論文レビュー] Clustering pipeline for determining consensus sequences in targeted next-generation sequencing
本論文では、モバイル要素統合部位の標的NGSデータにおけるコンSENSス配列回復を改善するために、UCLUSTと最適化されたIインデックス測定値を用いた複数ラウンドのクラスタリングパイプラインを提案する。繰り返しクラスタリング閾値を最適化することで、単一ラウンドのクラスタリングと比較して、特に繰り返し配列が豊富な領域において真の統合部位をより高い正確性で同定することができ、シーケンシング深度の変動に対しても安定した性能を示す。
Analyses of targeted genomic sequencing data from next-generation-sequencing (NGS) technologies typically involves mapping reads to a reference sequence or clustering reads. For a number of species a reference genome is not available so the analyses of targeted sequencing data, for example polymorphic structural variation caused by mobile elements is difficult; clustering methods are preferred for such data analysis. Clustering of reads requires a clustering threshold parameter, which is used to compare and group reads. However, determining the optimal clustering threshold for a read dataset is challenging because of different sequence composition, the number of sequences present, and also the amount of sequencing errors in the dataset. High values of the clustering threshold parameter can falsely inflate the number of recovered genomic regions, while low values of clustering threshold can merge reads from distinct regions into a single cluster. Thus, an algorithm that can empirically determine clustering threshold is needed. We propose a pipeline for clustering genomic sequences wherein the clustering threshold is empirically determined from the NGS data. The optimal threshold is decided based on two internal clustering measures which assess clusters for small intra-cluster diameters and large inter-cluster distances. We evaluate the pipeline on two simulated datasets derived from human genome sequence simulating different genomic regions and sequencing depth. The total number of clusters obtained from our pipeline is closer to the actual number of reference sequences when compared to single round of clustering. Also, the number of clusters whose consensus sequence matches a corresponding reference sequence is higher in our pipeline. We observe that the presence of repeat regions affects clustering accuracy.
研究の動機と目的
- 参照ゲノムが利用可能でない、もしくは不完全な状況下で、集団内におけるモバイル要素統合部位を正確に同定する課題に対処すること。
- クラスタリング閾値の最適化により、NGSデータにおけるクラスタリングの正確性を向上させること。これにより、統合部位の過剰または不足報告を回避する。
- 内部クラスタリング測定値(Iインデックス)を用いて、クラスタの密着性と分離性を向上させることで、シークエンシングノイズおよび多様体の影響を低減するパイプラインの開発。
- シーケンシング深度の変動およびゲノム的文脈(例:繰り返し領域対一意領域)がクラスタリング性能に与える影響を評価すること。
提案手法
- パイプラインは、ペアワイズ配列類似度に基づいてUCLUSTを用いてNGSリードの初期クラスタリングを実行し、クラスタ形成を制御するクラスタリング閾値θを用いる。
- 複数ラウンドのクラスタリングアプローチを採用し、複数の閾値ペア(θ¹, θ³)をテストすることで、Iインデックスを最大にする最適な組み合わせを同定する。Iインデックスは、クラスタの密着性と分離性の複合測定値である。
- IインデックスはDunnおよびDavies-Bouldinインデックスから導出され、内部クラスタの密着性とクラスタ間分離性を統合的に評価し、閾値選択を支援する。
- PCRに起因する誤差を低減し、アライメントの一貫性を向上させるために、リードをプライマー配列を除き、一定長にトリミングする前処理を実施する。
- パイプラインのクラスタリング性能は、内部(Iインデックス)および外部(Eインデックス)の両測定値を用いて評価され、単一ラウンドUCLUSTクラスタリングと比較される。
- 最適な閾値は、最大のIインデックス値に基づき選択され、その後、最終的なクラスタおよびコンセンサス配列が生成される。
実験結果
リサーチクエスチョン
- RQ1最適化された閾値選択を伴う複数ラウンドクラスタリングパイプラインは、単一ラウンドクラスタリングと比較して、モバイル要素統合部位のコンセンサス配列回復の正確性を向上させることができるか?
- RQ2シーケンシング深度の変動が、クラスタリングパイプラインによる真の統合部位配列回復性能に与える影響は何か?
- RQ3ゲノム的文脈(特に繰り返し領域対一意領域)がクラスタリング正確性に与える影響はどの程度か?
- RQ4Iインデックスは、クラスタの密着性と分離性のバランスを最適化するための最適なクラスタリング閾値選択を効果的に支援できるか?
主な発見
- 提案されたパイプラインは、IインデックスおよびEインデックスの値がより高いため、単一ラウンドUCLUSTクラスタリングを上回り、より優れたクラスタの密着性と分離性を示す。
- 最適な閾値で、94–98%の実際の統合部位数が、シーケンシング深度にかかわらず、両方のシミュレーテッドデータセットで回復された。
- 一意領域の統合部位では、84%のクラスタが真のコンセンサス配列と1塩基以内に位置したが、繰り返し領域では55%未満にとどまった。
- 繰り返し配列の存在は、類似性のためクラスタが容易に合体するため、クラスタリング正確性を著しく低下させる。
- パイプラインはシーケンシング深度に強く、カバレッジが9倍異なるデータセット間でも、性能に顕著な劣化が認められなかった。
- 最適なクラスタリング閾値ペアは、特に繰り返し配列の存在に依存しており、コンテンツに応じた閾値選択の重要性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。