Skip to main content
QUICK REVIEW

[論文レビュー] Flexible RNA design under structure and sequence constraints using formal languages

Yu Zhou, Yann Ponty|arXiv (Cornell University)|May 16, 2013
RNA and protein synthesis mechanisms参考文献 23被引用数 5
ひとこと要約

本論文は、形式的言語を用いて、複雑な構造的および配列的制約下で柔軟なRNA配列設計を実現する新しいフレームワークを提示する。文脈自由文法(CFG)と有限状態オートマトン(FSA)を統合することで、多様な候補配列を線形時間で効率的に生成可能となる。本手法は、強制的または禁止されたモチーフを含むグローバルサンプリングをサポートし、1件あたりの設計成功率は低いものの、候補生成スループットにおいて既存ツールを上回る。また、エクソンスプライシングエンハンサーに寄与する機能的RNAの設計において実証された。

ABSTRACT

The problem of RNA secondary structure design (also called inverse folding) is the following: given a target secondary structure, one aims to create a sequence that folds into, or is compatible with, a given structure. In several practical applications in biology, additional constraints must be taken into account, such as the presence/absence of regulatory motifs, either at a specific location or anywhere in the sequence. In this study, we investigate the design of RNA sequences from their targeted secondary structure, given these additional sequence constraints. To this purpose, we develop a general framework based on concepts of language theory, namely context-free grammars and finite automata. We efficiently combine a comprehensive set of constraints into a unifying context-free grammar of moderate size. From there, we use generic generic algorithms to perform a (weighted) random generation, or an exhaustive enumeration, of candidate sequences. The resulting method, whose complexity scales linearly with the length of the RNA, was implemented as a standalone program. The resulting software was embedded into a publicly available dedicated web server. The applicability demonstrated of the method on a concrete case study dedicated to Exon Splicing Enhancers, in which our approach was successfully used in the design of \emph{in vitro} experiments.

研究の動機と目的

  • 既存のRNA設計ツールが、必須または禁止されるモチーフのような複雑で位置に依存しない配列制約を処理できないという限界を解消すること。
  • 多様な制約を統合した単一の形式的言語モデルに統合可能な、包括的かつスケーラブルなフレームワークを構築すること。
  • 標的の二次構造およびユーザー定義の配列モチーフと整合するRNA配列の、効率的なランダム生成および全列挙を可能にすること。
  • エクソンスプライシング調節に関与するような生物学的に関連性のあるRNAの設計における本手法の有効性を示すこと。
  • 合成生物学およびRNAナノテクノロジー分野での実用的応用を可能にする、公開可能なウェブサーバーおよびソフトウェアを提供すること。

提案手法

  • 本手法は、文脈自由文法(CFG)と有限状態オートマトン(FSA)を用いてRNA設計の制約をモデル化し、多様な制約を単一でコンactな形式的言語に統合する。
  • 二次構造(構造的制約)とモチーフの存在/非存在(例:配列的制約)を統合したハイブリッド文法を構築し、塩基対結合則とヌクレオチドレベルのルールを同時に捉える。
  • 時間的・空間的計算量がRNA長に線形となる汎用アルゴリズムを用いて、重み付きランダム生成および全列挙を実現する。
  • CFGRNAD と呼ばれるカスタムソフトウェア実装は、組み合わせ文法上で動的計画法を用いて、効率的な配列サンプリングを実現する。
  • FSA部に正規表現を組み込むことで、モチーフの指定を、固定位置または配列内任意の位置に柔軟に設定可能となる。
  • 本手法は、合成生物学およびin vitro検証への応用を想定したウェブサーバーに統合されており、実用的応用を支援する。

実験結果

リサーチクエスチョン

  • RQ1形式的言語ベースのアプローチは、強制的および禁止されるモチーフを含む、幅広い生物学的関連性のある配列制約を、RNA設計において効率的に処理できるか?
  • RQ2本手法の線形時間計算量は、立方時間の代替手法と比較して、候補スループットおよび設計品質の観点でどのように差をつけるか?
  • RQ3配列内にどこにでも出現しうる禁止モチーフのような複雑な制約は、標的構造への適切な折りたたみ確率にどの程度影響を与えるか?
  • RQ4ヒューリスティック手法と比較して、1件あたりの成功率が低い場合でも、十分に大規模かつ多様な候補配列の生成が可能で、実用的意義を有するか?
  • RQ5形式的文法内に非標準塩基対などの構造的モチーフを組み込むと、設計可能性および機能的関連性にどのような影響を与えるか?

主な発見

  • CFGRNAD手法は、RNA長に対して線形時間および線形空間計算量を達成しており、大規模な候補配列群の効率的生成を可能としている。
  • 1件あたりの成功率が低く(30%~2%、長さ30~100 ntの配列で)、NUPACKがたった20件の候補生成に要する時間内に197,000件の候補を生成したため、候補スループットにおいて顕著に優れている。
  • 100 ntの配列では、NUPACKは80%~40%の完全成功確率を示したが、CFGRNADは30%~2%にとどまったが、より大きな候補プールが実用的意義を補った。
  • 構造的感受性(≥90%塩基対類似度)は、CFGRNADで50%~18%であったのに対し、NUPACKでは97%であった。これは、多様性と個々の設計品質の間のトレードオフを示している。
  • 本手法は、エクソンスプライシングエンハンサー(ESE)に寄与する機能的RNAを成功裏に設計し、in vitroでの実証により生物学的関連性と実用的意義が確認された。
  • 本フレームワークは、RNA設計において強制的および禁止モチーフの両方をサポートする唯一の利用可能なツールであり、従来のツールでは実現できなかった応用を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。