Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-Supervised Web Wrapper Repair via Recursive Tree Matching.

Joseph Cohen, Wei Ding|arXiv (Cornell University)|2015. 05. 06.
Web Data Mining and Analysis참고 문헌 15인용 수 7
한 줄 요약

XTPath는 구조적이고 맥락적으로 유사한 DOM 노드를 변화하는 웹 페이지 간에 찾기 위해 재귀적 트리 매칭을 사용하는 준지도 학습 기반 웹 래퍼 수리 방법이다. 이는 주어진 학습 데이터를 활용하여 추출의 견고성을 향상시킨다. XTPath는 75개의 다양한 웹사이트에서 온 117,422개의 페이지에서 XPath와 상용 시스템을 능가한다.

ABSTRACT

Continuous data extraction pipelines using wrappers have become common and integral parts of businesses dealing with stock, flight, or product information. Extracting data from websites that use HTML templates is difficult because available wrapper methods are not designed to deal with websites that change over time (the inclusion or removal of HTML elements). We are the first to perform large scale empirical analyses of the causes of shift and propose the concept of domain entropy to quantify it. We draw from this analysis to propose a new semi-supervised search approach called XTPath. XTPath combines the existing XPath with carefully designed annotation extraction and informed search strategies. XTPath is the first method to store contextual node information from the training DOM and utilize it in a supervised manner. We utilize this data with our proposed recursive tree matching method which locates nodes most similar in context. The search is based on a heuristic function that takes into account the similarity of a tree compared to the structure that was present in the training data. We systematically evaluate XTPath using 117,422 pages from 75 diverse websites in 8 vertical markets that covers vastly different topics. Our XTPath method consistently outperforms XPath and a current commercial system in terms of successful extractions in a blackbox test. We are the first supervised wrapper extraction method to make our code and datasets available (online here: this http URL).

연구 동기 및 목표

  • 웹사이트 간 HTML 템플릿의 동적 변화로 인한 래퍼 실패 문제를 해결하기 위해.
  • 도메인 엔트로피라는 새로운 지표를 사용하여 웹 템플릿의 구조적 이탈 원인을 정량화하기 위해.
  • 학습된 DOM에서의 맥락 기반 노드 정보를 활용하여 변화하는 웹 구조에서의 탐색을 안내하는 준지도 학습 방법을 개발하기 위해.
  • 각 사이트의 변경 사항마다 전체 재학습이나 수동 재설정이 필요 없이 견고하고 확장 가능한 래퍼 수리 기능을 제공하기 위해.

제안 방법

  • XTPath는 노드의 내용, 속성 및 위치적 맥락을 기반으로 하위 트리의 구조를 비교하는 재귀적 트리 매칭 알고리즘과 XPath를 결합한다.
  • 학습된 DOM의 구조와 유사도가 높은 노드를 우선순위로 정렬하기 위해 유사도 점수를 산정하는 휴리스틱 함수를 도입한다.
  • 학습된 DOM에서의 애너테이션된 맥락 기반 노드 정보를 저장하고 재사용하여, 변화하는 웹 아키텍처에 대한 지도 기반 적응을 가능하게 한다.
  • 구조적 유사도와 경로 유효성의 균형을 고려한 비용 함수를 사용하여 후보 XPath 표현식에 대한 정보 기반 탐색을 수행한다.
  • 도메인 엔트로피를 계산하여 웹사이트 간 템플릿의 불안정성 정도를 정량화하고, 견고한 탐색 휴리스틱 설계에 기여한다.
  • 본 연구는 8개의 종류의 산업 분야에서 75개의 웹사이트에서 온 117,422개의 페이지로 구성된 대규모 데이터셋을 기반으로 학습 및 평가되었다.

실험 결과

연구 질문

  • RQ1래퍼 실패를 유도하는 웹 템플릿의 구조적 이탈의 주요 원인은 무엇인가?
  • RQ2도메인 엔트로피는 다양한 웹 도메인 간의 템플릿 불안정성을 정량화하고 예측하는 데 어떻게 활용될 수 있는가?
  • RQ3맥락 기반 노드 정보를 활용한 재귀적 트리 매칭은 표준 XPath에 비해 래퍼 수리 정확도를 향상시키는가?
  • RQ4실제 환경에서의 블랙박스 평가에서 XTPath는 기존의 상용 및 오픈소스 래퍼 시스템을 얼마나 뛰어넘는가?

주요 결과

  • 도메인 엔트로피는 다양한 웹사이트 간의 템플릿 불안정성을 효과적으로 정량화하며, 웹 종류 간에 구조적 이탈이 빈번하고 체계적으로 발생한다는 것을 드러낸다.
  • 평가 대상인 75개의 웹사이트 전반에서 XTPath는 표준 XPath보다 성공적인 데이터 추출 비율에서 뚜렷한 승리를 거두었다.
  • 동일한 데이터셋에서의 블랙박스 테스트에서 XTPath는 현재의 상용 래퍼 시스템보다 높은 추출 성공률을 달성했다.
  • 항공권 및 제품 목록과 같은 높은 변동성이 있는 도메인을 포함한 8개의 종류의 산업 분야 전반에서 일관된 성능 향상이 관찰되었다.
  • 재귀적 트리 매칭을 통한 맥락 기반 노드 정보 통합은 템플릿 변경 상황에서도 더 정확하고 안정적인 노드 선택을 이끌어냈다.
  • XTPath는 공개된 코드와 학습 데이터셋을 함께 제공함으로써 재현성과 벤치마킹을 가능하게 한 최초의 지도 기반 래퍼 추출 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.