Skip to main content
QUICK REVIEW

[논문 리뷰] DomainNet: Homograph Detection for Data Lake Disambiguation

Aristotelis Leventidis, Laura Rocco|arXiv (Cornell University)|2021. 01. 01.
Data Quality and Management참고 문헌 49인용 수 5
한 줄 요약

DomainNet은 이원 그래프에서 값과 속성 동시 발생 패턴을 모델링하고 네트워크 중심성 측정법을 적용하여 이질적 데이터 레이크 내에서 다의어(동일한 값이 여러 의미를 가짐)를 비지도로 탐지하는 방법을 제안한다. 실제 데이터에서 상위 200개 예측 시 89%의 정밀도를 달성했으며, 합성 기준에서 도메인 탐지 기반 기준 대비 69% 재현율 대비 38% 정밀도로 우수한 성능을 보였다.

ABSTRACT

Modern data lakes are deeply heterogeneous in the vocabulary that is used to describe data. We study a problem of disambiguation in data lakes: how can we determine if a data value occurring more than once in the lake has different meanings and is therefore a homograph? While word and entity disambiguation have been well studied in computational linguistics, data management and data science, we show that data lakes provide a new opportunity for disambiguation of data values since they represent a massive network of interconnected values. We investigate to what extent this network can be used to disambiguate values. DomainNet uses network-centrality measures on a bipartite graph whose nodes represent values and attributes to determine, without supervision, if a value is a homograph. A thorough experimental evaluation demonstrates that state-of-the-art techniques in domain discovery cannot be re-purposed to compete with our method. Specifically, using a domain discovery method to identify homographs has a precision and a recall of 38% versus 69% with our method on a synthetic benchmark. By applying a network-centrality measure to our graph representation, DomainNet achieves a good separation between homographs and data values with a unique meaning. On a real data lake our top-200 precision is 89%.

연구 동기 및 목표

  • 데이터 레이크 내에서 여러 번 나타나지만 서로 다른 의미를 가질 수 있는 데이터 값(다의어)을 레이블이 없거나 스키마 일관성이 없을 경우에도 해석하는 데 도전하는 것.
  • 데이터 레이크 내 대규모 값 동시 발생 네트워크가 비지도로 다의어를 탐지하는 데 활용될 수 있는지 탐색하는 것.
  • 스키마나 메타데이터에 의존하지 않고 테이블 간 동시 발생 패턴에 기반해 다의어를 식별하는 확장 가능한 비지도 방법을 개발하는 것.
  • 다의어가 기존 의미 통합 작업(예: 도메인 탐지)에 미치는 영향을 평가하고, 데이터 품질 및 통합에 있어 다의어 탐지의 유용성을 입증하는 것.

제안 방법

  • 한 쪽 노드 집합은 데이터 값을, 다른 쪽은 속성을 나타내며, 같은 테이블 컬럼에 동시에 나타나는 경우 간선으로 연결하는 이원 그래프를 구축한다.
  • 도메인 중심성 측정법(예: 차수, 고유벡터 중심성, PageRank 유사 점수 등)을 적용하여 그래프 내에서 중심성이 높은 값을 식별함으로써, 다양한 의미적 역할을 할 수 있음을 시사한다.
  • 결과로 도출된 중심성 점수를 사용해 값을 순위 매기고, 높은 중심성 점수를 가진 값을 다의어로 분류함으로써, 다양한 맥락에서 다양한 속성과 동시 발생하는 것으로 간주한다.
  • 다른 방법으로 도메인 탐지(D⁴)를 사용해 값이 여러 의미 도메인에 등장하면 다의어로 간주하는 기준과 비교하여, 더 뛰어난 성능을 입증한다.
  • 합성 및 실제 데이터 기준(TUS, TUS-I)에서 평가하여 의미 수와 데이터 기수의 다양성에 따른 강건성을 점검한다.
  • 커뮤니티 탐지 히우리스틱을 사용해 다의어의 서로 다른 의미를 파악하기 위해 동시 발생 속성의 클러스터를 식별한다.

실험 결과

연구 질문

  • RQ1값-속성 동시 발생 그래프에서 네트워크 중심성이 비지도로 다의어를 효과적으로 식별할 수 있는가?
  • RQ2DomainNet의 성능는 다의어 탐지에 도메인 기반 접근법보다 어떻게 비교되는가?
  • RQ3다의어의 기수(다양한 동시 발생 속성의 수)가 탐지 정확도에 얼마나 영향을 미치는가?
  • RQ4다의어는 기존 의미 통합 작업(예: 도메인 탐지)에 어떤 영향을 미치는가?
  • RQ5이 방법은 빈 값 등가물, 데이터 오류, 다의어 표현 등 다양한 유형의 다의어를 탐지할 수 있는가?

주요 결과

  • 합성 기준에서 DomainNet은 69% 재현율과 38% 정밀도를 달성하여 도메인 탐지 기반 기준을 크게 앞서 갔다.
  • 실제 데이터 레이크에서 DomainNet은 다의어 탐지의 상위 200개 예측에서 89%의 정밀도를 기록했다.
  • 다의어의 기수가 감소함에 따라 정확도가 97%에서 85%로 떨어지는 것으로 나타나, 낮은 동시 발생 다양성에 민감함을 보였다.
  • DomainNet은 빈 값 등가물(예: '.'), 데이터 오류(예: 잘못된 위치에 기재된 회사명), 다의어 표현(예: 'Music Faculty'가 위치 또는 부서로 해석될 수 있음)을 포함한 다양한 유형의 다의어를 성공적으로 탐지했다.
  • 다의어는 도메인 탐지 방법의 성능을 심각하게 저하시켜, 데이터 통합 파이프라인 내에서 이러한 값을 사전에 탐지할 필요성을 부각시켰다.
  • 의미 수가 증가할수록 탐지 정확도가 향상됨에 따라, 의미 수가 많을수록 탐지 성능이 향상되는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.