Skip to main content
QUICK REVIEW

[논문 리뷰] Document Spanners for Extracting Incomplete Information: Expressiveness and Complexity

Francisco Maturana, Cristian Riveros|arXiv (Cornell University)|2017. 07. 04.
Data Quality and Management참고 문헌 15인용 수 4
한 줄 요약

이 논문은 반구조화된 데이터에서 부족하거나 선택적 정보를 처리하기 위해 매핑을 통합한 문서 스펜어를 제안하며, 정규식 공식과 추출 규칙에 기능적 의미 체계를 도입한다. 두 형식 체계 간의 표현력 동등성을 확립하고, 포함성 및 만족 가능성 문제가 PSPACE-완전임을 증명하며, 특정 조건 하에서 쿼리 열거가 다항 시간 지연으로 처리 가능하다는 것을 보여준다.

ABSTRACT

Rule-based information extraction has lately received a fair amount of attention from the database community, with several languages appearing in the last few years. Although information extraction systems are intended to deal with semistructured data, all language proposals introduced so far are designed to output relations, thus making them incapable of handling incomplete information. To remedy the situation, we propose to extend information extraction languages with the ability to use mappings, thus allowing us to work with documents which have missing or optional parts. Using this approach, we simplify the semantics of regex formulas and extraction rules, two previously defined methods for extracting information, extend them with the ability to handle incomplete data, and study how they compare in terms of expressive power. We also study computational properties of these languages, focusing on the query enumeration problem, as well as satisfiability and containment.

연구 동기 및 목표

  • 모든 변수에 값을 할당해야 하는 기존 규칙 기반 정보 추출 시스템의 한계를 해결하여, 누락되거나 선택적인 필드를 포함한 문서에 적합하지 않다는 점을 해결한다.
  • 정규식 기반 및 Datalog 유사 추출 규칙에 대한 기능적 의미 체계를 도입하여 그 해석을 단순화하고 통일한다.
  • 매핑을 통해 선택적 또는 누락된 데이터 구성 요소를 표현할 수 있도록 하여 부분적 또는 불완전한 정보 추출을 가능하게 한다.
  • 새로운 형식 체계의 표현력, 만족 가능성, 포함성 문제를 연구하여 이의 이론적 기초를 더 깊이 이해한다.
  • 정보 추출 시스템에서 다루는 잠재적으로 지수적 출력을 처리하는 데 핵심적인 쿼리 열거의 계산 복잡도를 분석한다.

제안 방법

  • 기존 문서 스펜어를 확장하여 변수에서 스펜으로의 부분 함수인 매핑을 도입하여 선택적 또는 누락된 데이터를 표현한다.
  • 두 형식 체계를 정의한다: 매핑이 포함된 정규식 공식과 매핑이 포함된 Datalog 유사 추출 규칙이며, 모두 기능적 의미 체계를 갖춘다.
  • 스팬너 쿼리의 동작을 모델링하기 위해 결정적 순차적 변수 자동차(VA)를 사용하여, 각 문서-매핑 쌍에 대해 유일한 실행이 보장되며, 점 상호배타적 매핑을 확보한다.
  • 각 형식 체계에 대해 등가의 자동차를 구성하여 두 형식 체계가 표현력 면에서 동등함을 증명한다.
  • 만족 가능성 및 포함성 문제를 변수 자동차 위의 모델 체킹 문제로 환원하여 PSPACE-완전성을 입증한다.
  • 스팬너가 결정적 순차적 VA이며 점 상호배타적 매핑을 갖는 경우, 쿼리 열거가 다항 시간 지연으로 처리 가능하다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1규칙 기반 정보 추출 언어는 표현력 명확성을 유지하면서도, 부족하거나 선택적인 데이터를 처리할 수 있도록 확장될 수 있는가?
  • RQ2매핑을 통한 불완전한 데이터 처리가 가능한 정규식 기반 및 Datalog 유사 스펜어 형식 체계의 표현력은 어떠한가?
  • RQ3새로운 형식 체계에서 만족 가능성 및 포함성 문제의 행동 방식은 어떻게 되며, 그 계산 복잡도는 무엇인가?
  • RQ4새로운 스펜어 형식 체계에서의 쿼리 열거는 처리 가능한가, 그리고 어떤 조건에서 가능한가?
  • RQ5정규식 공식과 추출 규칙의 의미 체계를 절차적 해석(예: 파싱 트리 또는 자동차 구축 기반)이 아닌 완전한 기능적 의미 체계로 만들 수 있는가?

주요 결과

  • 매핑을 통합한 제안된 형식 체계는 누락되거나 선택적인 필드를 포함한 문서에서 부분적 또는 불완전한 정보를 추출할 수 있어, 이전 시스템의 핵심 한계를 극복한다.
  • 매핑이 포함된 정규식 공식과 매핑이 포함된 Datalog 유사 규칙는 표현력 면에서 동등하며, 동일한 스펜어 쿼리 클래스를 표현할 수 있다.
  • 새로운 형식 체계의 만족 가능성 및 포함성 문제는 PSPACE-완전이며, 높은 복잡도이지만 결정 가능하다는 것을 의미한다.
  • 기본 자동차가 결정적이고 순차적이며 점 상호배타적 매핑을 갖는 경우, 새로운 스펜어 형식 체계에서의 쿼리 열거는 다항 시간 지연으로 처리 가능하다.
  • 결정적 순차적 변수 자동차의 사용은 각 문서-매핑 쌍에 대해 고유한 실행을 보장하여 정확하고 효율적인 결정 절차를 가능하게 한다.
  • 이 형식 체계는 절차적 해석을 피하는 기능적 의미 체계를 지원하여, 명확성과 정확성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.