Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Wrappers for Large Scale Web Extraction

Nilesh Dalvi, Ravi Kumar|arXiv (Cornell University)|2011. 03. 12.
Web Data Mining and Analysis참고 문헌 17인용 수 11
한 줄 요약

이 논문은 웹 스케일에서 웹 정보 추출을 높은 정확도로 달성하기 위해 노이즈가 있는 비지도 학습 데이터에 강건한 웹퍼터 알고리즘을 설계함으로써, 자동 웹퍼터 유도를 위한 새로운 프레임워크를 제안한다. 사전과 정규표현식에서 유도된 저비용의 노이즈 있는 레이블을 활용함으로써, 사이트 수준의 비용이 많이 드는 감독 학습이 필요 없어지며, 이로 인해 완전히 비지도 학습이 가능해지고, Yahoo!에서 실제 서비스에 구현된 바에 따라 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

We present a generic framework to make wrapper induction algorithms tolerant to noise in the training data. This enables us to learn wrappers in a completely unsupervised manner from automatically and cheaply obtained noisy training data, e.g., using dictionaries and regular expressions. By removing the site-level supervision that wrapper-based techniques require, we are able to perform information extraction at web-scale, with accuracy unattained with existing unsupervised extraction techniques. Our system is used in production at Yahoo! and powers live applications.

연구 동기 및 목표

  • 대규모 웹 데이터 추출을 위한 웹퍼터 유도에서 높은 비용이 드는 사이트 수준의 감독 학습 문제를 해결한다.
  • 수동으로 레이블링된 학습 데이터가 필요 없이 웹 페이지에서 정확한 정보 추출을 가능하게 한다.
  • 사전과 정규표현식과 같은 히우리스틱 기반의 방법으로 생성된 노이즈가 많은 자동 레이블을 견딜 수 있는 프레임워크를 개발한다.
  • 비지도 학습 기법을 활용해 웹 스케일의 정보 추출에서 생산 수준의 정확도를 달성한다.
  • 비지도 추출 방법과 실무에 적용 가능한 정확도 사이의 격차를 메운다.

제안 방법

  • 학습 데이터의 노이즈에 강건한 웹퍼터 유도 프레임워크를 설계하여, 저품질의 자동 생성 레이블을 사용할 수 있도록 한다.
  • 사전과 정규표현식과 같은 약한 감독 신호를 활용해 대규모의 노이즈가 있는 학습 예제를 생성한다.
  • 학습 중에 노이즈 있는 학습 데이터의 모순을 식별하고 수정하는 노이즈에 강건한 학습 알고리즘을 적용한다.
  • 노이즈 있는 데이터에서 추출 규칙을 학습하기 위해 확률적 또는 판별 모델을 활용하며, 오류 전파를 최소화한다.
  • 학습된 웹퍼터를 수백만 개의 웹 페이지를 처리할 수 있는 확장 가능한 파이프라인에 통합한다.
  • 실제 웹 데이터에 대한 평가와 기존의 비지도 방법과의 비교를 통해 프레임워크의 강건성과 정확도를 검증한다.

실험 결과

연구 질문

  • RQ1웹퍼터 유도가 대량의 노이즈가 있는 자동 생성 학습 데이터를 처리할 수 있도록 충분히 강건하게 만들 수 있는가?
  • RQ2정확도를 유지하면서 웹 추출에서 사이트 수준의 감독 학습을 얼마나 줄일 수 있는가?
  • RQ3사전, 정규표현식 등 히우리스틱 기반의 레이블링 방법이 노이즈에 강건한 학습과 결합될 경우 얼마나 효과적인가?
  • RQ4완전히 비지도 웹퍼터 유도 시스템이 실세계 웹 데이터에서 생산 수준의 정확도를 달성할 수 있는가?
  • RQ5기존의 비지도 또는 약한 감독 기반의 웹 추출 기법에 비해 제안된 프레임워크는 얼마나 높은 성능 향상을 이룰 수 있는가?

주요 결과

  • 제안된 프레임워크는 사이트 수준의 감독 학습이 전혀 필요 없이도 높은 추출 정확도를 달성하며, 완전히 비지도 학습이 가능하다.
  • 사전과 정규표현식을 통해 생성된 노이즈 있는 학습 데이터에서 성공적으로 학습하여 레이블링 비용을 크게 감소시켰다.
  • Yahoo!에서 실제 서비스에 구현된 결과, 기존의 비지도 추출 기법보다 뛰어난 정확도를 보였다.
  • 웹 스케일의 데이터에 대해 효과적으로 확장 가능하여, 생산 환경에서 대규모 정보 추출을 지원한다.
  • Yahoo!에서 실제 서비스에 배포되어 라이브 애플리케이션을 구동하며, 강건성과 실용적 타당성을 입증했다.
  • 학습 데이터의 노이즈를 효과적으로 완화하면서도 추출 정밀도를 유지함으로써 이전의 비지도 방법보다 뛰어난 성능을 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.