Skip to main content
QUICK REVIEW

[論文レビュー] Computational prediction of replication sites in DNA sequences using complex number representation

Shubham Kundal, Raunak Lohiya|arXiv (Cornell University)|Sep 27, 2019
RNA and protein synthesis mechanisms参考文献 27被引用数 5
ひとこと要約

本論文は、DNA配列の複素数表現を用いて、従来の自己相関手法よりも高分解能かつ高精度に複製開始部位(ORI)を予測する新しい計算手法iCorrを提案する。ヌクレオチドを複素数単位{+1, −1, +i, −i}にマッピングすることで、4種類の塩基の完全な空間的情報を捉え、手動による検査を不要にした自動ピーク検出を可能にし、原核生物および真核生物の両方で予測精度を顕著に向上させる。

ABSTRACT

Computational prediction of origin of replication (ORI) has been of great interest in bioinformatics and several methods including GC-skew, auto-correlation etc. have been explored in the past. In this paper, we have extended the auto-correlation method to predict ORI location with much higher resolution for prokaryotes and eukaryotes, which can be very helpful in experimental validation of the computational predictions. The proposed complex correlation method (iCorr) converts the genome sequence into a sequence of complex numbers by mapping the nucleotides to {+1,-1,+i,-i} instead of {+1,-1} used in the auto-correlation method (here, i is square root of -1). Thus, the iCorr method exploits the complete spatial information about the positions of all the four nucleotides unlike the earlier auto-correlation method which uses the positional information of only one nucleotide. Also, the earlier auto-correlation method required visual inspection of the obtained graphs to identify the location of origin of replication. The proposed iCorr method does away with this need and is able to identify the origin location simply by picking the peak in the iCorr graph.

研究の動機と目的

  • 従来の自己相関手法がDNA配列における複製開始部位(ORI)を予測する際に抱える制限を克服すること。
  • ORI予測における相関プロファイルの視覚的検査の必要性を排除すること。
  • 複素数マッピングを用いて4種類のヌクレオチド(A, T, C, G)の完全な空間的情報を活用することで、分解能と精度を向上させること。
  • より高分解能の予測により探索範囲を縮小することで、実験的検証の精度を高めること。
  • 原核生物および真核生物ゲノムに適用可能な堅牢で自動化された手法を提供すること。

提案手法

  • iCorr手法は各ヌクレオチドを次のように複素数にマッピングする:A → +1, T → −1, C → +i, G → −i。
  • これにより、DNA配列が4種類の塩基の位置的および組成的情報を保持する複素数列に変換される。
  • この手法はゲノム配列のスライディングウインドウ上で複素数自己相関関数(iCorr)を計算する。
  • iCorr関数は、複素数列に標準的な自己相関式を適用することで計算され、位相および振幅情報を捉える。
  • ORIの位置は、iCorrプロファイルのピークとして自動的に特定され、手動での解釈が不要になる。
  • 分解能とノイズ低減の最適化を図るため、可変なウインドウサイズおよびシフトサイズを用いたスライディングウインドウ手法を採用する。

実験結果

リサーチクエスチョン

  • RQ1従来の自己相関手法と比較して、DNA配列の複素数表現が、複製開始部位の予測分解能および精度を向上させることができるか。
  • RQ2iCorr手法は、相関プロファイルの視覚的検査を必要とせずにORI位置を自動的に検出できるか。
  • RQ3複素数マッピングを用いて4種類のヌクレオチド(A, T, C, G)の位置情報を統合することで、検出感度および特異度が向上するか。
  • RQ4iCorr手法は多様な原核生物および真核生物ゲノムにおいて、ORI予測精度の観点でどのように性能を発揮するか。
  • RQ5iCorrフレームワークにおいて、予測精度を最大化する最適なウインドウサイズおよびシフトサイズは何か。

主な発見

  • iCorr手法は、複素数相関プロファイルのピークとして複製開始部位を正確に特定し、従来の自己相関手法で必要な手動による検査を不要にした。
  • 複素数マッピングを用いることで、iCorrは4種類のヌクレオチドの完全な空間的情報を捉えるのに対し、従来の手法はG塩基の位置情報のみを用いていた。
  • ORI位置の高分解能予測を達成し、実験的検証を支援する上で極めて重要である。
  • *Bacillus subtilis*において、iCorr、gCorr、およびGCスキーはいずれも同じゲノム位置に終止領域(TER)を予測するが、iCorrはより鋭く明確なピークを示す。
  • iCorr手法は原核生物および真核生物の両方で適用可能であり、ゲノム特異的なチューニングを必要とせず、一貫した性能を発揮する。
  • パラメータの最適化を分析した結果、最適なウインドウサイズおよびシフトサイズが特定され、パラメータ最適化が予測精度を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。