Skip to main content
QUICK REVIEW

[논문 리뷰] Simplified DOM Trees for Transferable Attribute Extraction from the Web

Yichao Zhou, Ying Sheng|arXiv (Cornell University)|2021. 01. 07.
Web Data Mining and Analysis참고 문헌 45인용 수 11
한 줄 요약

이 논문은 시각적 특징 없이 간소화된 DOM 트리만을 사용하여 웹 페이지의 속성 추출을 위한 이식 가능한 방법인 SimpDOM을 제안한다. DOM 트리 내의 구조적 맥락과 노드 간 관계를 활용함으로써 SimpDOM은 최신 기술 수준의 성능을 달성하여 이전 방법 대비 F1 점수를 1.44% 향상시키고, 교차 종류 적응적 소수 샘플 설정에서 외부 도메인 지식을 사용할 경우 추가로 1.37% 향상시킨다.

ABSTRACT

There has been a steady need to precisely extract structured knowledge from the web (i.e. HTML documents). Given a web page, extracting a structured object along with various attributes of interest (e.g. price, publisher, author, and genre for a book) can facilitate a variety of downstream applications such as large-scale knowledge base construction, e-commerce product search, and personalized recommendation. Considering each web page is rendered from an HTML DOM tree, existing approaches formulate the problem as a DOM tree node tagging task. However, they either rely on computationally expensive visual feature engineering or are incapable of modeling the relationship among the tree nodes. In this paper, we propose a novel transferable method, Simplified DOM Trees for Attribute Extraction (SimpDOM), to tackle the problem by efficiently retrieving useful context for each node by leveraging the tree structure. We study two challenging experimental settings: (i) intra-vertical few-shot extraction, and (ii) cross-vertical fewshot extraction with out-of-domain knowledge, to evaluate our approach. Extensive experiments on the SWDE public dataset show that SimpDOM outperforms the state-of-the-art (SOTA) method by 1.44% on the F1 score. We also find that utilizing knowledge from a different vertical (cross-vertical extraction) is surprisingly useful and helps beat the SOTA by a further 1.37%.

연구 동기 및 목표

  • 최소한의 인간 레이블링으로 다양한 새로운 웹사이트에서 구조화된 속성을 추출하는 데 도전한다.
  • 계산 비용이 높은 시각적 특징에 의존하거나 DOM 트리 내의 노드 관계를 모델링하지 못하는 기존 방법의 한계를 극복한다.
  • 소수의 레이블 예시로도 다양한 웹 종류(예: 책, 영화, 일자리)에 일반화 가능한 단일 단계, 이식 가능한 모델을 개발한다.
  • 다른 도메인에서의 지식이 소수 샘플 추출 성능을 향상시키는 데 얼마나 효과적인지 탐색한다.
  • 렌더링 기반 또는 이중 단계 모델의 대안으로서 확장 가능하고 효율적인 웹 속성 추출 방법을 제공한다.

제안 방법

  • 속성 추출에 있어 의미적으로 관련 있는 구조만 유지하고 비필수 노드를 제거하여 간소화된 DOM 트리를 구성한다.
  • 이웃 노드들로부터의 맥락적 특징을 집계하여 풍부한 노드 표현을 생성하며, 'by'와 같은 의미적 신호나 속성 값의 동시 발생과 같은 요소에 집중한다.
  • 시각적 렌더링 없이도 근접성과 계층적 관계를 인코딩하는 트리 구조 인식 표현을 사용해 노드 수준의 맥락을 모델링한다.
  • 노드의 맥락적 표현을 기반으로 각 노드의 속성 유형(예: 저자, 가격)을 예측하는 단일 단계 분류 모델을 훈련한다.
  • 새로운 웹사이트나 도메인의 소수 샘플로 미세조정하여 전이 학습을 가능하게 하며, 관련 종류의 지식을 활용한다.
  • 웹사이트에 독립적인 신호(예: 'by' 다음에 저자 이름이 오는 것)와 종류에 독립적인 패턴(예: 그룹화된 속성 클러스터)을 포괄하는 간소화된 이웃 정의를 사용한다.

실험 결과

연구 질문

  • RQ1시각적 특징에 의존하지 않고도 DOM 트리 기반 방법이 다양한 웹 종류 간에 강력한 이식성을 달성할 수 있는가?
  • RQ2동일 도메인의 소수의 레이블링된 웹사이트만을 사용할 경우, 종내 소수 샘플 속성 추출이 얼마나 효과적인가?
  • RQ3다른 종류의 지식(외부 도메인)을 활용할 경우, 소수 샘플 속성 추출 성능 향상에 어느 정도 기여하는가?
  • RQ4DOM 트리 내에서 속성 값 식별에 가장 유용한 구조적 및 의미적 신호는 무엇인가?
  • RQ5F1 점수 및 일반화 능력 측면에서 제안된 방법은 최신 기술 수준의 접근 방식과 어떻게 비교되는가?

주요 결과

  • SimpDOM는 SWDE 데이터셋에서 종내 소수 샘플 추출 설정에서 최신 기술 수준 방법 대비 F1 점수 1.44% 향상시켰다.
  • 다른 종류에서의 외부 도메인 지식을 활용할 경우, SimpDOM는 최신 기술 수준 대비 추가로 1.37% 향상되어 강력한 이식성 잠재력을 입증했다.
  • k=3일 때 가장 유용한 외부 도메인 종류를 지식 소스로 사용할 경우, 모든 종류에서 평균 F1 점수 93%를 달성했다.
  • 교차 종류 지식 전이의 대칭 히트맵 분석 결과, 일부 종류 쌍(예: 책과 nbaplayer, 일자리와 영화) 간 상호 이점이 나타나 공통된 구조적 패턴이 있음을 시사한다.
  • 간소화된 트리 이웃을 통해 'by' 다음에 저자 이름이 오는 등의 의미적 신호와 ISBN, 출판사 등과 같은 그룹화된 속성 값들을 효과적으로 포착한다.
  • 렌더링이 필요 없고 메모리 집약적인 이미지 저장 및 복잡한 전처리 파이프라인을 제거함으로써, 시각적 특징 기반 및 이중 단계 모델보다 SimpDOM이 우수한 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.