Skip to main content
QUICK REVIEW

[论文解读] Sequence-Subset Distance and Coding for Error Control in DNA-based Data Storage

Wentu Song, Kui Cai|arXiv (Cornell University)|Sep 16, 2018
DNA and Biological Computing参考文献 15被引用 7
一句话总结

本文提出了序列子集距离(sequence-subset distance),这是一种新颖的度量方法,将汉明距离推广至无序DNA序列集合,从而为基于DNA的数据存储中的纠错编码设计提供统一框架。作者提出了序列子集码,其纠错能力完全由最小距离决定,并建立了理论界,包括类似Singleton和Plotkin的界,以及特定情况下的最优构造方法。

ABSTRACT

The process of DNA-based data storage (DNA storage for short) can be mathematically modelled as a communication channel, termed DNA storage channel, whose inputs and outputs are sets of unordered sequences. To design error correcting codes for DNA storage channel, a new metric, termed the sequence-subset distance, is introduced, which generalizes the Hamming distance to a distance function defined between any two sets of unordered vectors and helps to establish a uniform framework to design error correcting codes for DNA storage channel. We further introduce a family of error correcting codes, referred to as \emph{sequence-subset codes}, for DNA storage and show that the error-correcting ability of such codes is completely determined by their minimum distance. We derive some upper bounds on the size of the sequence-subset codes including a tight bound for a special case, a Singleton-like bound and a Plotkin-like bound. We also propose some constructions, including an optimal construction for that special case, which imply lower bounds on the size of such codes.

研究动机与目标

  • 为解决DNA基数据存储中的错误控制问题,其中由于混合与测序过程,输入和输出均为无序序列集合。
  • 将DNA存储信道建模为通信系统,其中错误包括序列的删除、插入以及符号级别的替换。
  • 提出一种新的距离度量——序列子集距离,将汉明距离推广至无序序列集合,以实现一致的纠错编码设计。
  • 通过上界(如类似Singleton和Plotkin的界)建立代码大小的理论极限,并提供可实现下界的构造方法。

提出的方法

  • 提出序列子集距离 $ d_S(X_1, X_2) $ 作为两个序列集合之间的度量,定义为匹配序列间最小汉明距离之和,加上未匹配序列的惩罚项。
  • 将序列子集码的最小距离定义为任意两个不同码字之间序列子集距离的最小值,该值完全决定了其纠错能力。
  • 推导出类似Singleton的界:$ |C| \leq 2^{L(n-d+1)} $,适用于长度为 $ n $、最小距离为 $ d $、字母表大小为4的码。
  • 推导出类似Plotkin的界:$ |C| \leq \frac{2L}{2L - d_{\min}} \cdot 2^{L(n-1)} $,当 $ d_{\min} > 2L $ 时成立。
  • 针对 $ d_{\min} = 2L $ 的特殊情况,提供最优构造,达到目前已知最紧的上界。
  • 采用基于匹配的序列集合间配对方法计算距离,确保三角不等式成立,从而验证该度量的有效性。

实验结果

研究问题

  • RQ1如何为无序DNA序列集合之间定义一致的距离度量,以支持DNA存储中的纠错编码设计?
  • RQ2对于给定最小距离的序列子集码,其最大码字大小的理论界是什么?
  • RQ3能否为序列子集码的特定情况推导出最优构造,使其达到理论上的上界?
  • RQ4序列子集距离如何将经典汉明距离推广,以同时处理符号级别和序列级别的错误?
  • RQ5在DNA存储背景下,序列子集距离与码的纠错能力之间存在何种关系?

主要发现

  • 序列子集距离满足三角不等式,证明其作为四元序列幂集上的有效度量。
  • 序列子集码的纠错能力完全由其最小距离决定,与经典编码理论中的结论一致。
  • 针对最小距离 $ d_{\min} = 2L $ 的特殊情况,推导出紧致的码字大小上界,与最优构造结果一致。
  • 建立了类似Singleton的界:$ |C| \leq 2^{L(n - d + 1)} $,将经典Singleton界推广至集合型设置。
  • 推导出类似Plotkin的界:$ |C| \leq \frac{2L}{2L - d_{\min}} \cdot 2^{L(n-1)} $,当 $ d_{\min} > 2L $ 时成立,为高距离约束下的码大小提供限制。
  • 针对 $ d_{\min} = 2L $ 的情况,提供了最优构造,达到目前已知最紧的上界,证实了在此条件下最优码的存在性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。