Skip to main content
QUICK REVIEW

[논문 리뷰] Alaska: A Flexible Benchmark for Data Integration Tasks

Valter Crescenzi, Andrea De Angelis|arXiv (Cornell University)|2021. 01. 27.
Data Quality and Management참고 문헌 31인용 수 4
한 줄 요약

Alaska는 캠코더, 모니터, 노트북 3개 도메인에서 71개의 전자상거래 사이트로부터 70만 건의 제품 사양을 포함한 실제 도메인에서의 데이터 통합 작업을 위한 융통성 있는 벤치마크이다. 이는 체계 일치 및 실체 식별을 지원하며, 정제된 참값을 제공하여 다양한 데이터 특성과 작업 유형에서 데이터 통합 파이프라인의 종단 간 평가를 가능하게 한다.

ABSTRACT

Data integration is a long-standing interest of the data management community and has many disparate applications, including business, science and government. We have recently witnessed impressive results in specific data integration tasks, such as Entity Resolution, thanks to the increasing availability of benchmarks. A limitation of such benchmarks is that they typically come with their own task definition and it can be difficult to leverage them for complex integration pipelines. As a result, evaluating end-to-end pipelines for the entire data integration process is still an elusive goal. In this work, we present Alaska, the first benchmark based on real-world dataset to support seamlessly multiple tasks (and their variants) of the data integration pipeline. The dataset consists of ~70k heterogeneous product specifications from 71 e-commerce websites with thousands of different product attributes. Our benchmark comes with profiling meta-data, a set of pre-defined use cases with diverse characteristics, and an extensive manually curated ground truth. We demonstrate the flexibility of our benchmark by focusing on several variants of two crucial data integration tasks, Schema Matching and Entity Resolution. Our experiments show that our benchmark enables the evaluation of a variety of methods that previously were difficult to compare, and can foster the design of more holistic data integration solutions.

연구 동기 및 목표

  • 데이터 통합 파이프라인의 종단 간 평가를 지원하는 종합적인 벤치마크 부족 문제를 해결한다.
  • 기존의 작업별 특화 벤치마크가 체계 일치나 실체 식별을 분리하여 제한적인 종합 평가를 방해하는 문제를 해결한다.
  • 다양한 구성과 데이터 특성에서 다양한 데이터 통합 기법의 평가를 가능하게 하는 융통성 있고 실제 도메인의 데이터셋을 제공한다.
  • 다양한 사용 사례와 프로파일링 메타데이터를 제공함으로써 통합된 종단 간 데이터 통합 솔루션의 개발을 지원한다.
  • 수동으로 정제된 참값이 있는 실제 도메인 데이터를 사용하여 체계 일치 및 실체 식별 작업의 다양한 유형 간 공정한 방법 비교를 가능하게 한다.

제안 방법

  • 캠코더, 모니터, 노트북 3개 도메인에서 71개의 실제 전자상거래 웹사이트로부터 70만 건의 제품 사양을 수집한다.
  • 맞춤형 웹 크롤러와 Carbonara라는 시스템을 사용하여 데이터를 추출하며, 집계자 및 국가별 변형은 제외한다.
  • 속성 다양성, 텍스트 복잡성, 소스 이질성 등의 다차원적 프로파일링을 수행하여 특정 평가를 위한 선택적 서브셋 선택을 지원한다.
  • 체계 일치 및 실체 식별 작업에 대해 수동으로 참값을 정제하며, 일치/비일치 레이블이 부여된 속성 쌍과 레코드 쌍을 포함한다.
  • 체계 무관 실체 식별 및 중개 체계 일치와 같은 다양한 작업 유형을 지원하도록 벤치마크를 설계하며, 입력 및 평가용으로 구조화된 데이터 형식을 제공한다.
  • 학습용으로 서브셋을 공개하고 나머지 부분은 F-측정치 평가를 위한 경쟁 대회에서 비공개로 유지하여 재현 가능한 벤치마크를 확보한다.

실험 결과

연구 질문

  • RQ1실제 도메인 벤치마크는 통합 파이프라인 내에서 체계 일치 및 실체 식별 작업의 다양한 유형을 융통성 있게 평가할 수 있는가?
  • RQ2실제 전자상거래 소스 간의 데이터 이질성이 데이터 통합 방법의 성능과 평가에 어떤 영향을 미치는가?
  • RQ3정제된 참값이 있는 벤치마크가 다양한 데이터 통합 기법 간의 공정하고 재현 가능한 비교를 어느 정도 가능하게 하는가?
  • RQ4실제 도메인 데이터를 위한 벤치마크가 고립된 작업을 넘어서 복잡한 데이터 통합 파이프라인의 종단 간 평가를 지원할 수 있는가?
  • RQ5데이터 추출 및 융합과 같은 추가 데이터 통합 작업을 지원하기 위해 벤치마크 설계를 어떻게 확장할 수 있는가?

주요 결과

  • Alaska 벤치마크는 3개 도메인에서 71개의 실제 전자상거래 소스로부터 70만 건의 제품 사양을 포함하며, 15만 개의 고유한 속성 이름과 뚜렷한 데이터 이질성을 보인다.
  • 벤치마크는 체계 무관 실체 식별 및 중개 체계 일치와 같은 다양한 작업 유형을 지원하며, 두 작업 모두 레이블이 부여된 데이터를 제공한다.
  • 2020년 SIGMOD 프로그래밍 콘테스트 및 두 차례의 DI2KG 챌린지에서의 초도 배포를 통해 벤치마크의 유용성이 입증되었으며, 학습 및 평가용으로 총 297,651개의 레이블이 부여된 레코드 쌍과 135~189개의 레이블이 부여된 속성 쌍이 공개되었다.
  • 정제된 참값 덕분에 신뢰할 수 있는 F-측정치 계산이 가능했으며, SIGMOD 2020 콘테스트에서 44,039개의 일치 레코드 쌍과 253,612개의 비일치 레코드 쌍이 공개되었다.
  • 벤치마크의 프로파일링 메타데이터를 통해 더 긴 텍스트 기술서나 높은 속성 다양성을 보이는 특정 소스 서브셋을 선택할 수 있다.
  • 향후 확장은 신규 수직 분야(예: 생물학적 데이터), 익명화된 변형, 데이터 추출 및 융합과 같은 추가 작업 지원을 포함하며, 수동 작업 감소를 위해 참값 정제 과정의 자동화 계획이 수립되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.