Skip to main content
QUICK REVIEW

[論文レビュー] Encoding DNA sequences by integer chaos game representation

Changchuan Yin|arXiv (Cornell University)|Dec 12, 2017
Fractal and DNA sequence analysis被引用数 7
ひとこと要約

本稿では、DNA配列を3つの固有の整数(配列長および2つの座標整数)に符号化する整数カオスゲーム表現(iCGR)を導入する。この方法により、完全な復元が可能な圧縮、暗号化、ステガノグラフィが可能となる。2ナノヌクレオチドあたり2ビットの符号化効率を達成し、標準的な8ビット符号化と比較して75%のストレージ削減が可能となる。これは、ヌクレオチド位置の反復的整数マッピングにより、全配列情報を完全に保持する。

ABSTRACT

DNA sequences are fundamental for encoding genetic information. The genetic information may not only be understood by symbolic sequences but also from the hidden signals inside the sequences. The symbolic sequences need to be transformed into numerical sequences so the hidden signals can be revealed by signal processing techniques. All current transformation methods encode DNA sequences into numerical values of the same length. These representations have limitations in the applications of genomic signal compression, encryption, and steganography. We propose an integer chaos game representation (iCGR) of DNA sequences and a lossless encoding method DNA sequences by the iCGR. In the iCGR method, a DNA sequence is represented by the iterated function of the nucleotides and their positions in the sequence. Then the DNA sequence can be uniquely encoded and recovered using three integers from iCGR. One integer is the sequence length and the other two integers represent the accumulated distributions of nucleotides in the sequence. The integer encoding scheme can compress a DNA sequence by 2 bits per nucleotide. The integer representation of DNA sequences provides a prospective tool for sequence compression, encryption, and steganography. The Python programs in this study are freely available to the public at https://github.com/cyinbox/iCGR

研究の動機と目的

  • DNA配列の損失なしの数値符号化法を開発し、効率的な圧縮、暗号化、ステガノグラフィを可能にする。
  • 従来の数値表現では元のDNA配列と同一長のシーケンスを生成するため、ストレージおよび処理に制限が生じる問題を克服する。
  • ヌクレオチドの位置と種別に基づく反復関数系を用いて、DNA配列を一対一の整数マッピングに変換する。
  • 任意のDNA配列が、情報損失なしに一意に表現され、再構築可能な三整数(n, X, Y)であることを示す。
  • 標準表現と比較して、1ヌクレオチドあたり8ビットであるのに対し、iCGRでは2ビットにまで符号化を短縮し、顕著なストレージ削減を実現する。

提案手法

  • A, C, G, T の各ヌクレオチドを、頂点が A=(1,1), T=(-1,1), C=(-1,-1), G=(1,-1) として割り当てられた2次元正方形空間内の座標ベクトルとして表現する。
  • 累積座標を計算する反復的整数関数を用いる:p_i,x = p_{i-1,x} + 2^{i-1} * α_{i,x} および同様に y 座標についても同様に計算する。
  • 長さ n のDNA配列を、n(長さ)、X(最終的な x 座標)、Y(最終的な y 座標)という3つの整数に符号化する。これらは iCGR 軌道から得られる。
  • 復号は反復の逆操作により行う:p_{i-1,x} = p_{i,x} - 2^{i-1} * α_{i,x} として、座標差の符号を用いて各ヌクレオチドを回復する。
  • ヌクレオチド種別と座標ベクトルの間の一対一マッピングを採用することで、一意かつ可逆な符号化を保証する。
  • ヒトのglobin遺伝子を含む実際のゲノム配列を用いて、圧縮および再構築の正確性を検証する。

実験結果

リサーチクエスチョン

  • RQ1DNA配列を3つの整数に損失なしで符号化し、すべての配列情報を保持できるか?
  • RQ2整数CGRR表現は、標準的な8ビットヌクレオチド符号化と比較して顕著な圧縮を可能にするか?
  • RQ3三整数表現の一意性により、データ転送中の誤り検出が符号化・復号プロセスで可能になるか?
  • RQ4iCGR手法は、暗号化やステガノグラフィを含むゲノム応用に適しているか?
  • RQ5iCGR符号化における1ヌクレオチドあたりの平均ビットコストは、従来手法と比較してどの程度か?

主な発見

  • iCGR手法は、任意のDNA配列を3つの整数(配列長 n、および2つの座標整数 X と Y)に符号化でき、完全な再構築が可能である。
  • 本手法は2ビット/ヌクレオチドの圧縮率を達成し、標準的な8ビットの記号符号化と比較して75%のストレージ削減が可能である。
  • ヒト(Homo sapiens)のglobin遺伝子(171 bp)の場合、三整数の合計ビットサイズは349ビットであり、1ヌクレオチドあたり2.041ビットに相当する。
  • 符号化は双対写像である:各DNA配列は一意な三整数の組にマッピングされ、各三整数の組は一意に元の配列に復号可能である。
  • 三整数に不正が加わると、復号時に無効または一致しない配列が得られるため、本手法は本質的に誤り検出機能を有する。
  • iCGR表現は、元の配列のすべての統計的および構造的特徴を保持しており、ゲノム信号処理や解析への応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。