Skip to main content
QUICK REVIEW

[论文解读] Fundamental Limits of DNA Storage Systems

Reinhard Heckel, Ilan Shomorony|arXiv (Cornell University)|May 12, 2017
DNA and Biological Computing参考文献 9被引用 4
一句话总结

本文在一种现实的模型下建立了基于DNA的归档系统的基本存储容量,该模型中数据被写入短的、无序的DNA分子,并通过PCR扩增进行随机抽样读取。论文证明基于索引的编码方案在信息论上是最优的,其容量由覆盖深度与分子长度相对于分子数量的关系决定,并表明高覆盖深度在存储增益上带来边际递减收益,同时显著增加测序成本。

ABSTRACT

Due to its longevity and enormous information density, DNA is an attractive medium for archival storage. In this work, we study the fundamental limits and tradeoffs of DNA-based storage systems under a simple model, motivated by current technological constraints on DNA synthesis and sequencing. Our model captures two key distinctive aspects of DNA storage systems: (1) the data is written onto many short DNA molecules that are stored in an unordered way and (2) the data is read by randomly sampling from this DNA pool. Under this model, we characterize the storage capacity, and show that a simple index-based coding scheme is optimal.

研究动机与目标

  • 表征在现实技术约束下基于DNA的归档系统的根本存储容量。
  • 分析DNA存储系统中存储密度、测序成本与覆盖深度之间的权衡关系。
  • 确定基于索引的编码方案——当前实践中常见的方案——在信息论上是否是最优的。
  • 确定覆盖深度的最优工作点,以实现单位测序成本下的最大存储速率。

提出的方法

  • 作者将DNA存储建模为一个信道,其中M个短DNA分子被写入,N次读取以均匀随机替换的方式抽取,模拟PCR扩增后的随机抽样。
  • 他们将存储容量定义为在假设合成与测序无错误的前提下,可可靠存储的每单位核苷酸的最大比特数。
  • 分析采用渐近区域分析,当M → ∞时,分子长度L相对于log M进行缩放,由参数β = lim L / log M进行参数化。
  • 容量推导为Cs = (1 − e−c)(1 − 1/β) log 4,其中c = N/M为覆盖深度。
  • 该模型假设合成与测序无错误,并由于随机抽样而将问题简化为一个有效删除信道。
  • 通过证明索引不会导致速率损失,且此类方案可达到推导出的容量,从而证明了基于索引的编码的最优性。

实验结果

研究问题

  • RQ1在随机抽样与PCR扩增条件下,基于DNA系统的根本存储容量是多少?
  • RQ2在当前系统中常见的基于索引的编码方案是否在信息论上是最优的?
  • RQ3当L相对于log M增长时,存储容量如何随分子长度L与分子数量M变化?
  • RQ4在存储速率与测序成本之间取得平衡的最优覆盖深度c = N/M是多少?
  • RQ5在实际DNA存储系统中,存储速率与读取速率(即测序成本)之间的最优权衡是什么?

主要发现

  • 存储容量由Cs = (1 − e−c)(1 − 1/β) log 4给出,其中β = lim L / log M,c为覆盖深度。
  • 若β ≤ 1,则无法实现正的存储速率,表明分子长度相对于分子数量存在根本限制。
  • 覆盖深度c = 1时达到最大可能存储速率的63%,c = 2时达到86%,c = 3时达到95%,表明在中等c值后增益呈边际递减。
  • 基于索引的编码在信息论上是最优的,意味着使用唯一头部标识分子不会造成速率损失。
  • 当合成成本为测序成本的10,000至100,000倍时,最优单位比特成本出现在c ≈ 9.2,表明深度测序是低效的。
  • 刻画了(Rs, Rr)可行性区域,表明适度的覆盖深度可在最小化成本与时间的同时,实现大部分存储速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。