Skip to main content
QUICK REVIEW

[논문 리뷰] Building a Web-Scale Dependency-Parsed Corpus from CommonCrawl

Alexander Panchenko, Eugen Ruppert|arXiv (Cornell University)|2017. 10. 04.
Topic Modeling참고 문헌 23인용 수 8
한 줄 요약

이 논문은 공통 크롤링 웹 아카이브의 365백만 개 문서에서 구축된 DepCC를 제시한다. 이는 현재까지 공개된 바 있는 가장 큰 의존성 구문 분석 및 명명된 실체 태깅이 된 영어 코퍼스이다. 저자들은 확장 가능한 MapReduce 파이프라인을 사용하여 데이터를 정제하고 중복 제거하며 언어학적 태깅을 수행함으로써 고성능 NLP 모델을 가능하게 했다. DepCC에서 학습된 분포적 동사 유사도 모델은 SimVerb3500 벤치마크에서 이전 최고 성능 모델을 능가하며, 웹 스케일의 언어학적 자원의 가치를 입증한다.

ABSTRACT

We present DepCC, the largest-to-date linguistically analyzed corpus in English including 365 million documents, composed of 252 billion tokens and 7.5 billion of named entity occurrences in 14.3 billion sentences from a web-scale crawl of the extsc{Common Crawl} project. The sentences are processed with a dependency parser and with a named entity tagger and contain provenance information, enabling various applications ranging from training syntax-based word embeddings to open information extraction and question answering. We built an index of all sentences and their linguistic meta-data enabling quick search across the corpus. We demonstrate the utility of this corpus on the verb similarity task by showing that a distributional model trained on our corpus yields better results than models trained on smaller corpora, like Wikipedia. This distributional model outperforms the state of art models of verb similarity trained on smaller corpora on the SimVerb3500 dataset.

연구 동기 및 목표

  • 기존 대규모 코퍼스의 한계, 즉 크기 제한, 언어학적 태깅 부족, 접근성 부족, 특히 웹 스케일 데이터의 경우를 해결하기 위해.
  • 원시 Common Crawl WET 덤프를 언어학적으로 풍부하고 중복 제거된, 검색 가능한 코퍼스로 변환하기 위한 확장 가능하고 자동화된 파이프라인을 개발하기 위해.
  • 고성능 NLP 작업을 지원하기 위해 웹 스케일이면서 의존성 구문 분석 및 명명된 실체 태깅이 된 코퍼스를 구축하기 위해.
  • 더 작은 코퍼스로 학습된 모델과 비교해, DepCC 기반으로 학습된 모델이 동사 유사도 벤치마크에서 성능 향상을 보임을 보여줌으로써 코퍼스의 유용성을 입증하기 위해.
  • 코퍼스 및 관련 도구(인덱스, API, 웹 인터페이스)를 공개하여 NLP 연구에서 널리 접근하고 재사용할 수 있도록 하기 위해.

제안 방법

  • 코퍼스는 원시 웹 페이지에서 추출된 텍스트를 포함하는 Common Crawl WET 아카이브에서 구축된다.
  • MinHash와 샤이닝을 사용한 near-duplicate 제거를 통해, MapReduce 기반 파이프라인이 문서 중복 제거를 수행한다.
  • 각 문서에 대해 다국어 형태소 태거, 의존성 파서(Stanford CoreNLP), 명명된 실체 인식기(Stanford NER)를 적용한다.
  • 문장마다 언어학적 메타데이터(품사, 의존성 관계, NER)와 추적 가능성을 위한 증거 정보(원본 URL, 오프셋)를 함께 저장한다.
  • 문장과 언어학적 특징에 대해 역색인을 구축하여 웹 인터페이스 또는 REST API를 통해 빠른 검색을 가능하게 한다.
  • 모든 전처리 및 태깅 단계는 코퍼스 전반에 걸쳐 동일하게 적용되어 일관성과 확장 가능성을 보장한다.

실험 결과

연구 질문

  • RQ1공개 웹에서 유래한 대규모 언어학적 태깅된 코퍼스가 위키피디아와 같은 더 작은 코퍼스보다 분포적 모델 학습에 더 우수한 성능을 낼 수 있는가?
  • RQ2코퍼스 크기와 언어학적 풍부성(의존성 구문 분석, NER)이 동사 유사도 작업 성능에 얼마나 기여하는가?
  • RQ3확장 가능하고 자동화된 파이프라인이 웹 스케일 데이터를 효과적으로 정제하고 중복 제거하며 태깅하여 NLP 연구에 활용할 수 있는가?
  • RQ4웹 스케일이면서 의존성 구문 분석된 코퍼스에서 학습된 분포적 모델이 SimVerb3500에서 최첨단 성능을 달성할 수 있는가?
  • RQ5이러한 코퍼스가 문법 인식 단어 임베딩 및 기타 NLP 모델 학습을 위한 실용적이고 즉시 사용 가능한 자원으로 기능할 수 있는가?

주요 결과

  • DepCC 코퍼스는 365백만 개 문서, 2520억 토큰, 143억 개 문장, 75억 개의 명명된 실체 발생을 포함하며, 현재까지 공개된 바 있는 가장 큰 의존성 구문 분석 영어 코퍼스이다.
  • DepCC에서 학습된 분포적 동사 유사도 모델은 SimVerb3500 데이터셋에서 스피어만 상관계수 0.782를 기록하여 이전 최고 성능을 초월했다.
  • 동일한 초모수를 사용하더라도, 위키피디아나 다른 더 작은 코퍼스로 학습된 모델보다 DepCC 기반 모델이 성능이 뛰어나, 코퍼스 크기와 언어학적 깊이의 영향을 입증한다.
  • 성능 향상은 스케일과 문법적 특징의 조합 덕분으로, 모델이 의존성 구문 분석을 활용해 동사 사용의 구조적 패턴을 포착하기 때문이다.
  • 코퍼스는 웹 인터페이스와 REST API를 통해 효율적인 검색을 가능하게 하며, 증거 추적 기능을 통해 재현 가능성과 데이터 기원 추적을 보장한다.
  • 이 방법론은 확장 가능하고 재사용 가능하며, 동일한 파이프라인을 활용해 다른 언어로도 확장할 수 있는 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.