Skip to main content
QUICK REVIEW

[論文レビュー] LinearPartition: Linear-Time Approximation of RNA Folding Partition Function and Base Pairing Probabilities

He Zhang, Liang Zhang|arXiv (Cornell University)|Dec 31, 2019
RNA and protein synthesis mechanisms参考文献 31被引用数 4
ひとこと要約

LinearPartition は、ビームサーチを用いて低確率の構造を pruning することで、RNA フォールディングの分割関数と塩基対確率を線形時間で近似するアルゴリズムである。古典的手法(例:Vienna RNAfold)に比べて、2.5日間かかる計算を 1.3 分にまで短縮するオーダーの高速化を達成した。また、真の塩基対確率との相関性が向上し、長距離塩基対や大規模なRNAスーパーファミリーにおいても精度が向上した。

ABSTRACT

RNA secondary structure prediction is widely used to understand RNA function. Recently, there has been a shift away from the classical minimum free energy (MFE) methods to partition function-based methods that account for folding ensembles and can therefore estimate structure and base pair probabilities. However, the classical partition function algorithm scales cubically with sequence length, and is therefore a slow calculation for long sequences. This slowness is even more severe than cubic-time MFE-based methods due to a larger constant factor in runtime. Inspired by the success of our recently proposed LinearFold algorithm that predicts the approximate MFE structure in linear time, we design a similar linear-time heuristic algorithm, LinearPartition, to approximate the partition function and base pairing probabilities, which is shown to be orders of magnitude faster than Vienna RNAfold and CONTRAfold (e.g., 2.5 days vs. 1.3 minutes on a sequence with length 32,753 nt). More interestingly, the resulting base pairing probabilities are even better correlated with the ground truth structures. LinearPartition also leads to a small accuracy improvement when used for downstream structure prediction on families with the longest length sequences (16S and 23S rRNA), as well as a substantial improvement on long-distance base pairs (500+ nt apart).

研究の動機と目的

  • 長大なRNA配列における古典的手法の立方時間オーダーのボトル neck を解消すること。
  • 長大なRNAにおいても精度を損なわずに塩基対確率を近似できるスケーラブルな手法を開発すること。
  • MEA や ThreshKnot、確率的サンプリングなどの下流応用における実行時間効率を向上させること。
  • 左から右への動的計画法フレームワークにおいてビームプルーニングを適用することで、速度と精度の両方が向上するかを検証すること。
  • 全長mRNA やリボソームRNA における分割関数および塩基対確率の実用的計算を可能にすること。

提案手法

  • LinearPartition は、ビームサイズ $b$ を固定して、活性状態の数を制限する左から右への動的計画法を用いる。
  • すべての $O(n^3)$ 個の可能な構造ではなく、ビーム内での $O(nb^2)$ 個の最も確率の高い構造のみを合計することで、分割関数を近似する。
  • 各位置で部分構造の集合を維持し、累積的な分割関数値に基づいて上位 $b$ 個の状態のみを保持する。
  • LinearFold が $O(nb^2)$ を $O(nb\log b)$ に削減する $k$-ベストパーサーを用いるのに対し、LinearPartition は分割関数推定の精度を保持するために、$O(nb^2)$ の完全な和を計算する。
  • ビームサイズ $b$ が十分に大きい場合には正確な計算が可能であり、$b$ が増加するにつれて精度が向上する。
  • 塩基対確率が妥当な閾値のもとで配列長に比例して増加することに着目し、$O(n)$ 近似の妥当性を裏付ける。

実験結果

リサーチクエスチョン

  • RQ1RNA 分割関数の線形時間ヒューリスティック近似は、塩基対確率推定において高い精度を維持できるか?
  • RQ2左から右への動的計画法フレームワークにおいてビームプルーニングを適用することで、正確な立方時間手法と比較して速度と精度の両方が向上するか?
  • RQ3実験的真値構造との相関性という観点から、LinearPartition の近似精度は Vienna RNAfold よりも優れているか?
  • RQ4特に長大なRNAや長距離塩基対において、LinearPartition は下流の構造予測精度を向上させられるか?
  • RQ5ビームサイズが分割関数近似の精度と実行時間に与える影響は何か?

主な発見

  • LinearPartition は実行時間を $O(n^3)$ から $O(nb^2)$ に短縮し、32,753 nt の配列において 1,200 倍の高速化を達成した(2.5日間 vs. 1.3分)。
  • LinearPartition が得た塩基対確率は、Vienna RNAfold のものよりも実験的真値構造との相関性が高かった。
  • 16S や 23S rRNA ファミリーにおいて、LinearPartition は RNAfold よりも MEA 構造予測の精度が向上した。
  • 長距離塩基対(500 nt 以上離れているもの)において、LinearPartition は古典的手法に比べて顕著な精度向上を示した。
  • ビームサイズ $b=100$ の場合、予測された塩基対確率の平均二乗偏差(RMSD)は 0.005 未満であり、近似の忠実性が非常に高いことを示した。
  • ビームサイズを $b=50$ から $b=100$ に増加させると、PPV と感度が向上し、$b=100$ を超えても安定した。ただし、一部のファミリー(例:16S rRNA)では、より大きな $b$ で効果が薄れたり、わずかな劣化が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。