Skip to main content
QUICK REVIEW

[논문 리뷰] Web Data Knowledge Extraction

Juan M. Tirado, Ovidiu Şerban|arXiv (Cornell University)|2016. 03. 24.
Web Data Mining and Analysis참고 문헌 21인용 수 4
한 줄 요약

이 논문은 도메인 전문가—기술적 배경이 적은 사람들—이 반복 가능하고 구성 가능한 구성 요소를 통해 데이터 추출 파이프라인을 주도할 수 있도록 돕는 전문가 중심의 기계 보조 방법론을 제시한다. 자동화된 구조 분석과 전문가가 이끄는 주석 처리를 통합함으로써 개발자 의존도를 줄이고, 유럽의 이질적인 공공 조달 데이터를 통합 스키마로 성공적으로 추출하여 확장성과 유지보수성을 입증한다.

ABSTRACT

A constantly growing amount of information is available through the web. Unfortunately, extracting useful content from this massive amount of data still remains an open issue. The lack of standard data models and structures forces developers to create adhoc solutions from the scratch. The figure of the expert is still needed in many situations where developers do not have the correct background knowledge. This forces developers to spend time acquiring the needed background from the expert. In other directions, there are promising solutions employing machine learning techniques. However, increasing accuracy requires an increase in system complexity that cannot be endured in many projects. In this work, we approach the web knowledge extraction problem using an expertcentric methodology. This methodology defines a set of configurable, extendible and independent components that permit the reutilisation of large pieces of code among projects. Our methodology differs from similar solutions in its expert-driven design. This design, makes it possible for subject-matter expert to drive the knowledge extraction for a given set of documents. Additionally, we propose the utilization of machine assisted solutions that guide the expert during this process. To demonstrate the capabilities of our methodology, we present a real use case scenario in which public procurement data is extracted from the web-based repositories of several public institutions across Europe. We provide insightful details about the challenges we had to deal with in this use case and additional discussions about how to apply our methodology.

연구 동기 및 목표

  • 도메인 전문가를 데이터 추출 과정의 중심에 두어 웹 지식 추출에서 개발자 의존도를 줄이기.
  • API 또는 표준 형식이 없는 경우에도 비정형적이고 이질적이며 비표준 웹 소스에서 구조화된 데이터를 추출하는 데 도전하는 것.
  • 다양한 데이터 소스와 타깃 데이터베이스를 지원하는 반복 가능하고 모듈화되며 확장 가능한 파이프라인 아키텍처를 설계하는 것.
  • 임의의, 일회성 구현 방식에 비해 유지보수성 향상과 개발 시간 단축을 이루는 것.
  • 공공 조달 데이터에서 다국어 콘텐츠, 일관되지 않은 데이터 품질, 도메인 전문 용어와 같은 실제 문제 상황을 다루는 것.

제안 방법

  • 도메인 전문가가 구성 가능한 파이프라인 시스템을 사용하여 데이터 추출 규칙을 정의하는 전문가 중심의 운영 주기 방법을 적용한다.
  • 기계 보조 구조 분석 컴포넌트를 사용하여 HTML을 분석하고 XML로 변환하며, 추천 XPath 표현식을 제공함으로써 전문가의 주석 처리를 안내한다.
  • 데이터 구조를 사전 기반 접근 방식으로 표현하여 평면적 및 계층적 매핑을 모두 지원함으로써 데이터 모델링의 유연성을 확보한다.
  • MITFORD 프레임워크는 선언적 구성 형식을 사용하여 XML에서 관계형 데이터베이스로의 매핑을 가능하게 하여 데이터 변환을 코드에서 분리한다.
  • 병렬 처리와 종속성 관리를 통한 파이프라인 설계로 성능과 신뢰성을 향상시킨다.
  • 자동 검증 검사와 샘플 문서 테스트를 통해 XML 및 HTML 매핑 수준에서 검증을 수행한다.

실험 결과

연구 질문

  • RQ1프로그래밍 전문 지식이 없이 도메인 전문가가 웹 데이터 추출을 주도할 수 있도록 하는 방법은 무엇인가?
  • RQ2기계 보조 구조 분석이 웹 추출 과정에서 데이터 필드 식별 및 주석 처리에 소요되는 수작업을 얼마나 줄일 수 있는가?
  • RQ3반복 가능하고 모듈화된 파이프라인 아키텍처는 일회성 솔루션에 비해 개발 시간 단축과 유지보수성 향상에 얼마나 기여하는가?
  • RQ4제안된 방법론은 이질적이고 비표준적이며 다국어 공공 조달 소스에서 데이터 추출에 얼마나 효과적인가?
  • RQ5메타데이터, API 또는 표준 형식이 없는 상황에서 실제 웹 데이터 추출 시 발생하는 주요 과제는 무엇인가?

주요 결과

  • 전문가 중심의 방법론을 통해 기술적 배경이 적은 도메인 전문가가 개발자 참여 최소화로도 전체 데이터 추출 파이프라인을 구성하고 관리할 수 있었다.
  • 기계 보조 구조 분석의 활용으로 복잡한 HTML 문서에서 데이터 필드 식별 및 주석 처리에 소요되는 시간과 노력이 감소했다.
  • 모듈화되고 반복 가능한 구성 요소 덕분에 다양한 데이터 소스 간 개발 시간 단축과 코드 유지보수성 향상이 이루어졌다.
  • 시스템은 형식과 데이터 품질 수준이 다른 14개의 유럽 데이터 소스에서 공공 조달 데이터를 성공적으로 추출하고 정규화했다.
  • 각 소스의 데이터베이스에는 평균 10,000~100,000건의 항목이 저장되었으며, 평균 항목 크기는 10~50KB로, 확장성을 입증했다.
  • 검증 결과, 추출된 데이터의 95%가 사전 정의된 구조적 및 의미적 일관성 기준을 충족하여 파이프라인의 신뢰성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.