Skip to main content
QUICK REVIEW

[논문 리뷰] Sherlock: A Deep Learning Approach to Semantic Data Type Detection

Madelon Hulsebos, Kevin Hu|arXiv (Cornell University)|2019. 05. 25.
Topic Modeling참고 문헌 27인용 수 12
한 줄 요약

Sherlock는 VizNet 코퍼스의 686,765개의 실제 데이터 컬럼에서 훈련된 다중 입력 신경망을 사용하여 의미적 데이터 유형을 탐지하는 딥러닝 모델이다. 1,588종의 다양한 특징(예: 문자 분포, 워드 임베딩, 파aragraph 벡터 포함)을 활용함으로써 전통적인 규칙 기반 방법과 머신러닝 기반 모델보다 뛰어난 성능을 보이며, 지원 가중 F1 스코어 0.89를 달성한다.

ABSTRACT

Correctly detecting the semantic type of data columns is crucial for data science tasks such as automated data cleaning, schema matching, and data discovery. Existing data preparation and analysis systems rely on dictionary lookups and regular expression matching to detect semantic types. However, these matching-based approaches often are not robust to dirty data and only detect a limited number of types. We introduce Sherlock, a multi-input deep neural network for detecting semantic types. We train Sherlock on $686,765$ data columns retrieved from the VizNet corpus by matching $78$ semantic types from DBpedia to column headers. We characterize each matched column with $1,588$ features describing the statistical properties, character distributions, word embeddings, and paragraph vectors of column values. Sherlock achieves a support-weighted F$_1$ score of $0.89$, exceeding that of machine learning baselines, dictionary and regular expression benchmarks, and the consensus of crowdsourced annotations.

연구 동기 및 목표

  • 일반적으로 더러운 또는 비정형 데이터에서 실패하는 규칙 기반 및 사전 기반 방법의 한계를 해결하기 위해 의미적 데이터 유형을 탐지하는 데 목적이 있다.
  • 장소, 날짜, 이름과 같은 세밀한 의미적 유형을 정확하게 탐지함으로써 데이터 과학 워크플로우를 향상시키기 위해 목적이 있다.
  • 다양한 실세계 데이터셋에 일반화 가능한 확장성 있고 강력한 의미적 유형 탐지 모델을 개발하기 위해 목적이 있다.
  • 기업 또는 도메인 전용 데이터 유형에 맞게 커스터마이징이 가능한 공개된, 재학습이 가능한 시스템을 제공하기 위해 목적이 있다.

제안 방법

  • 모델는 데이터 컬럼에서 추출한 이질적인 특징을 처리하기 위해 다중 입력 딥 네트워크 아키텍처를 사용한다.
  • 특징으로는 통계적 성질(예: 기수성, 유일성), 문자 수준의 분포, 워드 임베딩, 그리고 파aragraph 벡터가 포함된다.
  • 의미적 유형은 DBpedia 온톨로지 매핑을 통해 정확한 매칭을 통해 컬럼 헤더와 78개의 사전 정의된 의미적 유형 간에 유도된다.
  • 훈련 데이터는 컬럼 헤더를 지표 레이블로 사용한 VizNet 코퍼스의 686,765개 컬럼으로 구성된다.
  • 모델는 다중 분류 작업으로 훈련되며, 누락된 값이나 일관되지 않은 포맷과 같은 데이터 품질 문제에 대한 강건성을 향상시키기 위해 최적화된다.
  • Sherlock는 즉시 사용 가능한 파이썬 라이브러리로 제공되며, 커스텀 데이터에 대해 재학습하기 위한 오픈소스 훈련 스크립트를 포함한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 실세계의 더러운 데이터에서 규칙 기반 및 전통적인 머신러닝 접근 방식보다 의미적 데이터 유형 탐지 성능을 뛰어나게 할 수 있는가?
  • RQ2다중 입력 신경망이 문자 수준, 임베딩 기반, 통계적 등 다양한 특징 유형 간의 복잡한 패턴을 탐지하는 데 얼마나 효과적인가?
  • RQ3정제된 또는 합성된 데이터셋 대비 실세계 데이터의 대규모 코퍼스에서 훈련하면 일반화 및 강건성 향상에 얼마나 기여하는가?
  • RQ4딥러닝 모델이 78종의 의미적 유형을 넓게 다루면서도 실용성과 해석 가능성을 유지할 수 있는가?

주요 결과

  • Sherlock는 지원 가중 F1 스코어 0.89를 기록하며, 베이스라인 모델, 사전 검색, 정규표현식 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 모델는 커뮤니티 기반 앙케이트의 공감 결과를 초월하여 의미적 유형 탐지에서 높은 신뢰성과 일관성을 보였다.
  • 워드 임베딩, 문자 분포, 파aragraph 벡터를 포함한 1,588종의 다양한 특징의 사용은 노이즈가 많거나 손상된 데이터에서도 강력한 탐지 성능을 가능하게 했다.
  • 웹 스크래핑된 표, 시각화 시스템, 오픈 데이터 포털 등 다양한 데이터 소스 간에 잘 일반화되었다.
  • 모델, 훈련 스크립트, 데이터셋을 오픈소스로 제공함으로써 향후 연구 및 도메인 전용 데이터 유형에 대한 커스터마이징을 가능하게 하였다.
  • 본 연구는 향후 방향성으로 훈련 데이터 확장, 특징 세트 강화, 의미적 유형 탐지에 대한 공통 기준 표준 수립을 규명하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.