Skip to main content
QUICK REVIEW

[論文レビュー] Illumina Sequencing Artifacts Revealed by Connectivity Analysis of Metagenomic Datasets

Adina Chuang Howe, Jason Pell|arXiv (Cornell University)|Dec 1, 2012
Genomics and Phylogenetic Studies参考文献 28被引用数 7
ひとこと要約

本研究では、de Bruijnグラフの接続性解析を通じて、Illuminaメタゲノムデータセットに広範にわたるシーケンシングアーティファクトを同定した。これは、位置特異的バイアスに起因する、読みの『塊』(lump)として現れる極めて高い接続性を持つ領域である。これらのアーティファクトに起因する配列を除去することで、アセンブリの正確性が向上し、メモリ使用量が削減され、並列処理が効率的に行えるようになった。フィルタリングを施したアセンブリは、多様なメタゲノムにおいて一貫した内容を示した。

ABSTRACT

Sequencing errors and biases in metagenomic datasets affect coverage-based assemblies and are often ignored during analysis. Here, we analyze read connectivity in metagenomes and identify the presence of problematic and likely a-biological connectivity within metagenome assembly graphs. Specifically, we identify highly connected sequences which join a large proportion of reads within each real metagenome. These sequences show position-specific bias in shotgun reads, suggestive of sequencing artifacts, and are only minimally incorporated into contigs by assembly. The removal of these sequences prior to assembly results in similar assembly content for most metagenomes and enables the use of graph partitioning to decrease assembly memory and time requirements.

研究の動機と目的

  • シーケンシングアーティファクトに起因する人工的な接続性がメタゲノムアセンブリグラフに存在するかを調査すること。
  • 生物学的に由来しないが、プラットフォーム固有のバイアスに起因する、極めて高い接続性を示すk-mer配列を同定すること。
  • これらのアーティファクト由来配列を除去した場合の、デノボメタゲノムアセンブリのパフォーマンスおよび効率への影響を評価すること。
  • アーティファクト除去後にデータセットを分割することで、より正確かつスケーラブルなメタゲノムアセンブリを可能にすること。
  • カバレッジ推定やコンティグ構築を損なうシーケンシングアーティファクトを検出・フィルタリングする手法を提供すること。

提案手法

  • k=32のk-mer長を用いて、Illuminaメタゲノムデータセットからde Bruijnグラフを構築し、読みの接続性を分析した。
  • 『lump』を、各アセンブリグラフにおける最大連結成分として定義し、異常な高い接続性を示す領域として特定した。
  • 各k-merの周囲における局所的グラフ密度を計算して接続性を定量化し、20を超える値は極めて非線形的かつ過剰に接続された領域を示すとみなした。
  • 読み配列全体におけるグラフ密度の位置特異的変動を分析したところ、すべての環境由来メタゲノムで高密度領域に3’末端に著しい富集が見られた。
  • Bowtieおよびblastnを用いてリファレンスゲノムおよびNCBI非再帰的データベースへのアラインメントにより、高頻度で高接続性を示すk-merを同定した。
  • VelvetおよびMeta-IDBAを用いて、読みからアーティファクトk-merをフィルタリングした後、再アセンブリを行い、フィルタリング前後でのアセンブリ結果を比較した。

実験結果

リサーチクエスチョン

  • RQ1メタゲノムアセンブリグラフに異常な高い接続性が生じる原因は何であり、それは生物学的に意味を持つものなのか?
  • RQ2シーケンシングアーティファクトは、読みの接続性においてどのように位置特異的バイアスとして現れるのか?
  • RQ3極めて高い接続性を示すk-merは、アセンブリエラーおよびメモリオーバーヘッドにどの程度寄与しているのか?
  • RQ4これらのアーティファクト由来配列を除去することで、デノボメタゲノムアセンブリの正確性と効率性が向上するのか?
  • RQ5アーティファクトk-merのフィルタリングにより、多様なメタゲノムにおいて一貫性があり、より信頼性の高いアセンブリ内容が得られるのか?

主な発見

  • ヒトの腸内メタゲノムでは全読みの75%がlumpに含まれていたが、シミュレーテッドメタゲノムでは5%にとどまり、実データにおけるアーティファクトの広範な存在を示した。
  • すべての実メタゲノムにおいて、lump内のノードの22–50%が局所的グラフ密度>20を示したが、シミュレーテッドデータでは17%にとどまり、生物学的でない過剰接続性が顕著であった。
  • 位置特異的解析により、すべての環境由来メタゲノムで読みの3’末端に顕著に高いグラフ密度が確認され、プラットフォーム固有のシーケンシングバイアスを示唆した。
  • 高接続性k-merは生物学的由来ではなく、ヒトの腸内メタゲノムにおける上位100位内の32-merの95%が、いかなるリファレンスゲノムやNCBIデータベースとも一致しなかった。
  • アーティファクトk-merを除去した後、フィルタリング済みアセンブリは、異なるデータセット間で類似した内容を示し、バイアスの低減と一貫性の向上を示した。
  • フィルタリング済みアセンブリは、より少ないメモリと時間で処理可能であり、接続性の低減に伴いグラフの分割が可能となり、並列処理が実現可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。