Skip to main content
QUICK REVIEW

[논문 리뷰] Edit Distance Cannot Be Computed in Strongly Subquadratic Time (unless SETH is false)

Artūrs Bačkurs, Piotr Indyk|arXiv (Cornell University)|2014. 12. 01.
Natural Language Processing Techniques인용 수 7
한 줄 요약

이 논문은 강한 지수 시간 가설(Strong Exponential Time Hypothesis, SETH)이 잘못될 경우를 제외하고는 두 문자열 간의 편집 거리(edit distance) 계산이 강한 의미에서 이차 이하 시간에 수행될 수 없다는 것을 증명한다. 저자들은 정사각형 벡터 문제(Orthogonal Vectors Problem)를 편집 거리로 환원하여, 더 빠른 편집 거리 알고리즘이 존재할 경우 CNF-SAT에 대한 더 빠른 알고리즘이 존재하게 되어 SETH를 위반하게 되며, 이로써 편집 거리가 SETH-어려움(SETHE-hard)임을 입증한다.

ABSTRACT

The edit distance (a.k.a. the Levenshtein distance) between two strings is defined as the minimum number of insertions, deletions or substitutions of symbols needed to transform one string into another. The problem of computing the edit distance between two strings is a classical computational task, with a well-known algorithm based on dynamic programming. Unfortunately, all known algorithms for this problem run in nearly quadratic time. In this paper we provide evidence that the near-quadratic running time bounds known for the problem of computing edit distance might be tight. Specifically, we show that, if the edit distance can be computed in time $O(n^{2-δ})$ for some constant $δ>0$, then the satisfiability of conjunctive normal form formulas with $N$ variables and $M$ clauses can be solved in time $M^{O(1)} 2^{(1-ε)N}$ for a constant $ε>0$. The latter result would violate the Strong Exponential Time Hypothesis, which postulates that such algorithms do not exist.

연구 동기 및 목표

  • 정확한 편집 거리 계산을 위한 조건부 하한을 설정하기 위해.
  • δ>0에 대해 O(n^{2−δ}) 시간 내에 편집 거리를 계산하는 임의의 알고리즘이 존재할 경우, 강한 지수 시간 가설(SETH)을 위반하게 된다는 것을 보여주기 위해.
  • 편집 거리가 SETH-어려움인 문제들 중 하나임을 입증하여, 엄격한 조건부 하한을 가진 문제의 집합에 포함됨을 보여주기 위해.
  • 벡터 가드와 구조화된 시퀀스에서의 패턴 매칭을 사용하여 정사각형 벡터 문제에서 편집 거리로의 환원을 제공하기 위해.

제안 방법

  • 각 벡터 집합 A와 B의 요소에 대해 정사각형성 조건을 인코딩하기 위한 특수한 '가드(gadget)' 시퀀스를 구성한다.
  • 집합 A의 가드 시퀀스를 첫 번째 문자열에, 집합 B의 가드 시퀀스를 두 번째 문자열에 연결한다.
  • 서브스트링 간의 정렬 비용을 측정하기 위해 패턴 매칭 함수 PATTERN(P₁, P₂)를 사용하며, 정렬 비용이 특정 임계값 이하로 떨어지지 않을 조건을 증명한다.
  • 편집 거리의 비용 분리를 보장하기 위해 새로운 기호 '6'을 사용해 대칭적인 접두사와 접미사를 문자열에 추가하는 변환을 적용한다.
  • 정리된 레이마를 활용하여, 정사각형 벡터가 존재하지 않을 경우 편집 거리가 Y로 정확히 일치하고, 정사각형 쌍이 존재할 경우 Y−2로 감소함을 증명한다.
  • 정사각형 벡터 문제를 편집 거리로 환원하며, 더 빠른 편집 거리 알고리즘이 존재할 경우 CNF-SAT에 대한 더 빠른 알고리즘이 존재하게 된다는 점을 보여준다.

실험 결과

연구 질문

  • RQ1편집 거리는 강한 의미에서 이차 이하 시간, 즉 δ>0에 대해 O(n^{2−δ}) 시간 내에 계산될 수 있는가?
  • RQ2넓게 받아들여진 복잡도 가정 하에 정확한 편집 거리 계산에 대한 조건부 하한은 무엇인가?
  • RQ3기존의 SETH-어려움 문제인 정사각형 벡터 문제에서 편집 거리로의 환원이 존재하는가?
  • RQ4동적 프로그래밍을 통한 편집 거리의 구조적 특성은 현재 알려진 알고리즘보다 더 빠른 알고리즘을 가능하게 하는가?

주요 결과

  • 편집 거리가 어떤 δ>0에 대해 O(n^{2−δ}) 시간 내에 계산 가능할 경우, N개의 변수와 M개의 절을 가진 CNF-SAT는 M^{O(1)}2^{(1−ε)N} 시간 내에 풀 수 있다.
  • 이는 이러한 알고리즘이 존재하지 않는다고 주장하는 강한 지수 시간 가설(SETH)을 위반하게 된다.
  • 따라서 편집 거리 문제는 SETH-어려움이며, 이는 강한 의미에서 이차 이하 알고리즘이 존재할 가능성이 낮음을 의미한다.
  • 환원 과정은 벡터 가드와 기호 '6'을 사용한 대칭 패딩을 통해 문자열을 구성하며, 정사각형 벡터가 존재하지 않을 경우 편집 거리가 정확히 Y로, 정사각형 쌍이 존재할 경우 Y−2로 유지됨을 보장한다.
  • 증명은 임의의 낮은 비용의 정렬이 반드시 전체적인 벡터 가드를 정렬해야 하며, 부분적인 정렬은 특수 기호의 강제 삭제 또는 대체로 인해 더 높은 비용을 유발한다는 점에 기반한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.