Skip to main content
QUICK REVIEW

[논문 리뷰] Rules of Acquisition for Mementos and Their Content

Shawn Jones, Harihar Shankar|arXiv (Cornell University)|2016. 02. 19.
Web Data Mining and Analysis참고 문헌 12인용 수 4
한 줄 요약

이 논문은 여러 아카이브를 통해 웹 메모를 획득하고 추출하는 데 있어 핵심적인 과제를 규명하며, HTTP 기반 검색이 비표준 리디렉션, 자바스크립트 기반 리디렉션, 일관되지 않은 HTML 렲영으로 인해 자주 실패함을 드러낸다. 저자들은 일반적으로 PhantomJS와 같은 도구가 필요하며, lxml 및 Beautiful Soup와 같은 파싱 라이브러리가 손상되거나 아카이브에 의해 수정된 HTML을 처리하는 데 어려움을 겪어, 디지털 보존 및 링크 부서짐 방지 노력의 텍스트 추출 신뢰도에 심각한 영향을 미친다고 보여준다.

ABSTRACT

Text extraction from web pages has many applications, including web crawling optimization and document clustering. Though much has been written about the acquisition of content from live web pages, content acquisition of archived web pages, known as mementos, remains a relatively new enterprise. In the course of conducting a study with almost 700,000 web pages, we encountered issues acquiring mementos and extracting text from them. The acquisition of memento content via HTTP is expected to be a relatively painless exercise, but we have found cases to the contrary. We also find that the parsing of HTML, already known to be problematic, can be more complex when one attempts to extract the text of mementos across many web archives, due to issues involving different memento presentation behaviors, as well as the age of the HTML in their mementos. For the benefit of others acquiring mementos across many web archives, we document those experiences here.

연구 동기 및 목표

  • 연구 목적으로 다수의 웹 아카이브에서 메모의 확보 신뢰성과 일관성을 조사하기 위해.
  • 표준 HTTP 방법을 사용할 때 웹 아카이브에서 메모의 텍스트를 검색하고 추출하는 데 있어 기술적 장애를 특정하기 위해.
  • 다양한 웹 아카이브가 브랜딩, 리디렉션, HTML 렌더링을 통해 메모 콘텐츠를 수정함으로써 텍스트 추출에 영향을 미치는 방식을 기록하기 위해.
  • 일반적인 텍스트 추출 도구(예: lxml, Beautiful Soup)가 메모 콘텐츠에서의 효과를 평가하고 파싱의 극단적 케이스를 식별하기 위해.
  • 디지털 보존 및 의미 분석을 위해 아카이브 간 메모 콘텐츠를 비교하고자 하는 연구자들에게 실용적인 해결책과 인식 제고를 제공하기 위해.

제안 방법

  • 표준 HTTP GET을 사용하여 웹 아카이브에서 메모를 검색하고, 직접 검색이 실패하는 경우를 식별하기 위해 cURL을 사용하였다.
  • WebCite 및 인터넷 아카이브 메모의 경우, 특히 자바스크립트 기반 리디렉션과 프레임 기반 콘텐츠 로딩을 처리하기 위해 커스터마이징된 스크립트를 사용한 PhantomJS를 활용하였다.
  • 아카이브에서 제공하는 인코딩이 실패할 경우 UTF-8으로 기본 설정하는 대체 문자 인코딩 탐지 알고리즘을 구현하였다.
  • lxml 및 Beautiful Soup를 사용해 HTML을 파싱하였으며, 열리지 않은 태그, 손상된 noscript 요소, 특수 문자 인코딩을 처리할 때의 제한 사항을 기록하였다.
  • 브랜딩 및 네비게이션 요소를 제거하여 텍스트 비교에 왜곡을 일으키지 않도록 아카이브별 콘텐츠 제거 기법을 개발하였다.
  • 파싱 불일치로 인해 텍스트 비교에 영향을 미칠 수 있는 비표준 태그 표현 방식(예: <와 > 대신 &lt;와 &gt;)을 가진 메모는 버리기로 하였다.

실험 결과

연구 질문

  • RQ1웹 아카이브가 메모를 제공할 때 비표준 HTTP 동작을 얼마나 많이 따르는가, 특히 리디렉션 처리 측면에서?
  • RQ2아카이브 간 HTML 렌더링 및 콘텐츠 수정의 차이가 텍스트 추출 정확도와 일관성에 어떤 영향을 미치는가?
  • RQ3다양한 아카이브의 메모 콘텐츠를 처리할 때 표준 파싱 라이브러리(예: Beautiful Soup, lxml)의 한계는 무엇인가?
  • RQ4메모에 포함된 인코딩 문제와 손상된 HTML이 텍스트 추출 및 아카이브 간 비교에 어떤 영향을 미치는가?
  • RQ5직접 HTTP 방법 대비 브라우저 시뮬레이션 도구(예: PhantomJS)를 사용한 메모 확보의 성능 및 신뢰성 상충 요소는 무엇인가?

주요 결과

  • 데이터셋의 약 25%의 메모는 비표준 HTTP 동작(예: 자바스크립트 리디렉션, 프레임 기반 콘텐츠 로딩)으로 인해 표준 HTTP GET만으로 확보할 수 없었다.
  • WebCite는 세션 기반 리디렉션과 프레임 로딩을 처리하기 위해 PhantomJS가 필요했으며, 거의 10만 개의 메모를 확보하는 데 1개월이 넘는 시간이 소요되었고, 이는 인터넷 아카이브의 약 2주 대비 상당히 길었다.
  • 인터넷 아카이브는 종종 HTTP 302 리디렉션을 자바스크립트 시뮬레이션 리디렉션으로 대체하여 실제 메모 콘텐츠에 접근하려면 클라이언트 사이드 실행이 필요했다.
  • lxml에서 열리지 않은 태그와 손상된 noscript 요소를 처리할 때 문제가 발생하여, 잘못된 DOM 상태 파싱으로 인해 텍스트 전체를 잃는 경우가 있었다.
  • 일부 아카이브는 <와 >를 &lt;와 &gt;로 대체하여, 파싱 도구가 이를 실제 텍스트로 해석해 잘못된 태그를 생성하고 텍스트 비교 결과에 왜곡을 일으켰다.
  • 문자 인코딩이 자주 잘못 보고되었으며, 신뢰할 수 있는 텍스트 추출을 위해 UTF-8 백업이 포함된 커스터마이징된 탐지 알고리즘을 필요로 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.