Skip to main content
QUICK REVIEW

[論文レビュー] Models and information-theoretic bounds for nanopore sequencing

Wei Mao, Suhas Diggavi|arXiv (Cornell University)|May 31, 2017
Nanopore and Nanochannel Transport Studies参考文献 19被引用数 4
ひとこと要約

本稿では、シンボル間干渉、削除、ノイズを伴う有限状態チャネルとしてのナノポアシークエンシングの数学的モデルを提案し、その容量に関する情報理論的限界を導出する。信頼性のある復号速度の計算可能な下界を確立し、妥当なDNA配列の不確実性リストのサイズを定量化することで、ベースコールアルゴリズムのベンチマーク評価や、DNAストレージおよび長距離シークエンシングのためのナノポア設計最適化を可能にする。

ABSTRACT

Nanopore sequencing is an emerging new technology for sequencing DNA, which can read long fragments of DNA (~50,000 bases) in contrast to most current short-read sequencing technologies which can only read hundreds of bases. While nanopore sequencers can acquire long reads, the high error rates (20%-30%) pose a technical challenge. In a nanopore sequencer, a DNA is migrated through a nanopore and current variations are measured. The DNA sequence is inferred from this observed current pattern using an algorithm called a base-caller. In this paper, we propose a mathematical model for the "channel" from the input DNA sequence to the observed current, and calculate bounds on the information extraction capacity of the nanopore sequencer. This model incorporates impairments like (non-linear) inter-symbol interference, deletions, as well as random response. These information bounds have two-fold application: (1) The decoding rate with a uniform input distribution can be used to calculate the average size of the plausible list of DNA sequences given an observed current trace. This bound can be used to benchmark existing base-calling algorithms, as well as serving a performance objective to design better nanopores. (2) When the nanopore sequencer is used as a reader in a DNA storage system, the storage capacity is quantified by our bounds.

研究の動機と目的

  • シンボル間干渉、削除、確率的応答を捉えた物理的根拠に基づくナノポアチャネルの数学的モデルの構築。
  • ナノポアシークエンシングにおける最大の信頼性のある情報抽出レートを定量化する情報理論的限界の導出。
  • 妥当なDNA配列の不確実性リストのサイズに基づく性能指標の提供—ベースコールアルゴリズムのベンチマーク評価のため。
  • さまざまな劣化要因下でのシステムの情報容量を定量化することで、ナノポア設計の最適化を可能にする。
  • ナノポアシークエンサーをリードアウト機構として用いるDNAストレージシステムの設計を支援するため、ストレージ容量の特徴付け。

提案手法

  • ナノポアチャネルを非線形なシンボル間干渉と同期エラーを有する有限状態マルコフチャネルとしてモデル化する。
  • ドブルーシュインの多文字容量公式を、シンボル間干渉と類似する同期エラーを含める形に一般化する。
  • 削除チャネル解析に適応した手法を用いて、チャネル容量の単一文字計算可能な下界を導出する。
  • 1ヌクレオチドあたりの電流サンプル数のモーメント生成関数を用い、配列再構築確率を評価する。
  • 大偏差および大偏差原理を用いて、電流トレースからDNA配列が正しく復号される確率を推定する。
  • 不確実性リストサイズの上限を遷移確率と状態分布の関数として表現するため、補助関数 $ E_a(\gamma) $ と $ E_{ab}(\gamma) $ を導入する。

実験結果

リサーチクエスチョン

  • RQ1実際の劣化要因(シンボル間干渉や削除など)が存在する状況下で、ナノポアシークエンシングにおける情報抽出の根本的な情報理論的限界は何か?
  • RQ2観測された電流トレースが与えられたとき、妥当なDNA配列の不確実性リストのサイズはどのように定量化できるか?
  • RQ3i.i.d. 一様入力シーケンスを想定したナノポアシークエンサーの信頼性のある復号速度の計算可能な下界は何か?
  • RQ4導出された下界は、ベースコールアルゴリズムの評価と改善にどのように利用できるか?
  • RQ5ナノポアシークエンサーをリードアウト機構として用いるDNAストレージシステムのストレージ容量は何か?

主な発見

  • 本稿では、ナノポアチャネルの信頼性のある復号速度の計算可能な下界を導出し、区別可能な異なるDNA配列の最大数を定量化する。
  • デノボシークエンシングにおける不確実性リストサイズは、$ \exp(n - m) \cdot \beta_m $ で上限付けられる。ここで $ \beta_m $ はチャネルの状態遷移確率と誤差指数に依存する関数である。
  • 導出された下界は、遷移行列のスペクトル的性質および1ヌクレオチドあたりのサンプル数分布のモーメント生成関数に依存する。
  • 本手法により、ベースコールアルゴリズムの性能指標が得られる—不確実性リストサイズが小さいほど、アルゴリズムの復号能力が優れていると評価できる。
  • これらの下界は、デノボシークエンシングおよびナノポアシークエンサーをリードチャネルとして用いるDNAストレージシステムの両方に適用可能である。
  • 数値的評価により、下界がきついものであり、異なるナノポア設計およびベースコール戦略の比較に利用可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。