Skip to main content
QUICK REVIEW

[论文解读] Flexible RNA design under structure and sequence constraints using formal languages

Yu Zhou, Yann Ponty|arXiv (Cornell University)|May 16, 2013
RNA and protein synthesis mechanisms参考文献 23被引用 5
一句话总结

本文提出了一种新颖的框架,用于在复杂结构和序列约束下灵活设计RNA序列,采用形式语言方法,结合上下文无关文法(CFG)与有限状态自动机(FSA),实现高效、线性时间生成多样化候选序列。该方法支持全局采样,可强制或禁止特定基序,尽管单次设计的成功率较低,但在候选序列生成吞吐量方面优于现有工具,并在设计外显子剪接增强子功能RNA方面得到验证。

ABSTRACT

The problem of RNA secondary structure design (also called inverse folding) is the following: given a target secondary structure, one aims to create a sequence that folds into, or is compatible with, a given structure. In several practical applications in biology, additional constraints must be taken into account, such as the presence/absence of regulatory motifs, either at a specific location or anywhere in the sequence. In this study, we investigate the design of RNA sequences from their targeted secondary structure, given these additional sequence constraints. To this purpose, we develop a general framework based on concepts of language theory, namely context-free grammars and finite automata. We efficiently combine a comprehensive set of constraints into a unifying context-free grammar of moderate size. From there, we use generic generic algorithms to perform a (weighted) random generation, or an exhaustive enumeration, of candidate sequences. The resulting method, whose complexity scales linearly with the length of the RNA, was implemented as a standalone program. The resulting software was embedded into a publicly available dedicated web server. The applicability demonstrated of the method on a concrete case study dedicated to Exon Splicing Enhancers, in which our approach was successfully used in the design of \emph{in vitro} experiments.

研究动机与目标

  • 解决现有RNA设计工具无法处理复杂、非位置性序列约束(如强制或禁止的基序)的局限性。
  • 开发一个统一、可扩展的RNA设计框架,将多种约束整合到单一形式语言模型中。
  • 实现与目标二级结构及用户定义的序列基序兼容的RNA序列的高效随机生成与完整枚举。
  • 展示该方法在设计生物学相关RNA(如参与外显子剪接调控的RNA)中的实用性。
  • 提供公开可用的网络服务器与软件,便于在合成生物学与RNA纳米技术中实际应用。

提出的方法

  • 该方法使用上下文无关文法(CFG)与有限状态自动机(FSA)建模RNA设计约束,将多种约束统一为单一紧凑的形式语言。
  • 将结构约束(二级结构)与序列约束(如基序的有无)整合到混合文法中,同时捕捉碱基配对与核苷酸层级规则。
  • 该框架通过通用算法实现加权随机生成与完整枚举,时间与空间复杂度与RNA长度呈线性关系。
  • 自定义软件实现CFGRNAD通过在组合文法上使用动态规划,高效采样序列。
  • 该方法支持灵活的基序指定——可通过FSA组件中的正则表达式在固定位置或序列任意位置定义基序。
  • 该方法已集成至网络服务器,便于公众访问,支持合成生物学与体外验证等实际应用。

实验结果

研究问题

  • RQ1基于形式语言的方法能否高效处理广泛的生物学相关序列约束(包括强制与禁止的基序)?
  • RQ2与三次方时间复杂度的替代方法相比,该方法的线性时间复杂度在候选序列吞吐量与设计质量方面表现如何?
  • RQ3复杂约束(如可能出现在序列任意位置的禁止基序)对成功折叠为靶向结构的概率有多大影响?
  • RQ4该方法能否生成足够大且多样的候选序列集合,以弥补相较于启发式方法较低的单次设计成功率?
  • RQ5将结构基序(如非经典配对)纳入形式文法,对设计可行性与功能相关性有何影响?

主要发现

  • CFGRNAD方法在RNA长度上实现线性时间与空间复杂度,支持高效生成大规模候选序列集。
  • 尽管单次设计成功率较低——在30–100 nt序列上为30%至2%——但该方法在NUPACK仅能生成20个候选的时长内,成功生成了197,000个候选,实际候选吞吐量显著优于NUPACK。
  • 对于100 nt的序列,NUPACK的完全成功概率为80%至40%,而CFGRNAD仅为30%至2%,但更大的候选池在实践中实现了补偿。
  • 结构敏感度(≥90%碱基配对相似性)方面,CFGRNAD为50%至18%,而NUPACK为97%,表明多样性与个体设计质量之间存在权衡。
  • 该方法成功设计出用于外显子剪接增强子(ESEs)的功能性RNA,体外验证证实其生物学相关性与实际应用价值。
  • 该框架是目前唯一支持RNA设计中强制与禁止基序的可用工具,使以往无法实现的应用成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。