[논문 리뷰] Design and Implementation of Domain based Semantic Hidden Web Crawler
이 논문은 도메인 특화 의미적 크롤러를 제안하며, 도메인 특화 데이터베이스를 활용해 의미적 매핑을 통해 검색 폼을 지능적으로 채우는 방식으로 양식 기반 인터페이스에서 숨겨진 웹 데이터를 추출한다. 문법적 또는 무작위 폼 채우기 대신 의미 기반 정보를 활용한 질의로 전환함으로써, 숨겨진 웹에서의 정확도와 데이터 품질을 크게 향상시켜 관련 결과를 검색할 때 더 높은 재현율과 정밀도를 달성한다.
Web is a wide term which mainly consists of surface web and hidden web. One can easily access the surface web using traditional web crawlers, but they are not able to crawl the hidden portion of the web. These traditional crawlers retrieve contents from web pages, which are linked by hyperlinks ignoring the information hidden behind form pages, which cannot be extracted using simple hyperlink structure. Thus, they ignore large amount of data hidden behind search forms. This paper emphasizes on the extraction of hidden data behind html search forms. The proposed technique makes use of semantic mapping to fill the html search form using domain specific database. Using semantics to fill various fields of a form leads to more accurate and qualitative data extraction.
연구 동기 및 목표
- 기존 크롤러가 숨겨진 웹의 HTML 검색 폼 뒤에 있는 데이터에 접근하는 데에 한계가 있다는 문제를 해결하기 위해.
- 형식적 규칙나 무작위 폼 채우기 대신 폼 필드에 대한 의미적 이해를 도입함으로써 데이터 추출 품질을 향상시키기 위해.
- 형식 필드를 관련 데이터베이스 속성에 매핑하여 정확한 질의 생성을 위한 도메인 특화 크롤러를 개발하기 위해.
- 형식 필드 간 의미적 관계를 활용함으로써 숨겨진 웹 데이터 수집의 재현율과 정밀도를 높이기 위해.
제안 방법
- 크롤러는 도메인 특화 지식 기반을 사용하여 형식 필드를 관련 의미적 엔터티와 속성에 매핑한다.
- 도메인 컨텍스트와 스키마를 바탕으로 의미적 추론을 적용하여 형식 필드에 적절한 값을 유추한다.
- 시스템은 HTML 구조에서 입력 필드, 그 유형 및 제약 조건을 식별하기 위해 형식 분석 모듈을 활용한다.
- 매핑된 도메인 데이터베이스 값들을 사용해 의미적으로 유효한 질의를 생성하는 질의 생성 엔진을 통합한다.
- 크롤러는 생성된 질의를 대상 웹사이트에 제출하고 표준 웹 스크래핑 기법을 사용해 결과를 추출한다.
- 피드백 메커니즘이 결과의 관련성을 평가하고 시간이 지남에 따라 폼 채우기 전략을 개선한다.
실험 결과
연구 질문
- RQ1의미적 매핑은 문법적 또는 무작위 접근 방식에 비해 숨겨진 웹 크롤러의 폼 채우기 정확도를 어떻게 향상시킬 수 있는가?
- RQ2도메인 특화 지식은 숨겨진 웹 데이터 추출의 재현율과 정밀도에 어떤 영향을 미치는가?
- RQ3의미적 추론은 검색 폼에 제출되는 무효하거나 관련 없는 질의의 수를 줄일 수 있는가?
- RQ4제안된 크롤러는 전통적인 크롤러에 비해 형식 기반 웹 인터페이스에서 구조화된 데이터를 추출하는 데 어떻게 성능을 발휘하는가?
주요 결과
- 제안된 크롤러는 기존 크롤러에 비해 형식 기반 웹 인터페이스에서 관련 데이터를 추출하는 데 있어 유의미하게 높은 정밀도와 재현율을 달성했다.
- 의미적 매핑 덕분에 무효하거나 응답이 없는 질의의 수가 감소하여 맥락적으로 적절한 폼 필드 값이 보장되었다.
- 시스템은 도메인 특화 스키마와 엔터티 관계에 맞춰 입력을 정렬함으로써 데이터 품질 향상을 입증했다.
- 형식 채우기용 도메인 특화 데이터베이스의 사용은 여러 대상 웹사이트에서 일관되고 신뢰할 수 있는 데이터 추출을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.