Skip to main content
QUICK REVIEW

[논문 리뷰] Mining Naturally-occurring Corrections and Paraphrases from Wikipedia's Revision History

Aurélien Max, Guillaume Wisniewski|arXiv (Cornell University)|2022. 02. 25.
Wikis in Education and Collaboration참고 문헌 10인용 수 55
한 줄 요약

WiCoPaCo는 Wikipedia 개정의 로컬하게 편집된 재작성의 방대한 코퍼스로, 철자 수정 및 패러프레이즈 생성 연구 및 응용을 가능하게 합니다. 풍부한 메타데이터를 갖춘 맥락 내 수정 쌍을 제공하며, 프랑스어 중심 데이터셋에서 시작합니다.

ABSTRACT

Naturally-occurring instances of linguistic phenomena are important both for training and for evaluating automatic processes on text. When available in large quantities, they also prove interesting material for linguistic studies. In this article, we present a new resource built from Wikipedia's revision history, called WiCoPaCo (Wikipedia Correction and Paraphrase Corpus), which contains numerous editings by human contributors, including various corrections and rewritings. We discuss the main motivations for building such a resource, describe how it was built and present initial applications on French.

연구 동기 및 목표

  • Wikipedia 개정에서 로컬적으로 발생하는 재작성의 대규모 자원을 NLP 응용을 위해 생성한다.
  • 철자 수정, 패러프레이즈 생성 및 관련 작업의 연구와 평가를 가능하게 한다.
  • 감독 학습과 평가를 지원하기 위한 메타데이터와 맥락을 제공한다.
  • 데이터 활용도를 보여주기 위해 프랑스어를 대상으로 초기 활용 사례를 시연한다.

제안 방법

  • 가장 긴 공통 부분 수열을 사용하여 연속되는 Wikipedia 버전 간 차이를 계산해 로컬 수정 사항을 추출한다.
  • 수정 구간을 최대 일곱 단어로 제한하고 텍스트를 정규화한다(de-wikification, 토큰화).
  • 의미를 변경하는 수정이나 구두점을 포함한 편집을 제거하기 위한 수제 필터링 규칙을 적용하고 전체 문단 맥락을 기록한다.
  • 맥락, 원문 및 수정 구간, 그리고 사용자 정보를 포함한 Wikipedia 식별자를 저장하되 봇 편집은 제외한다.
  • 주석 및 재사용을 위한 고유 수정 식별자를 가진 XML을 출력한다.
  • 프랑스어 데이터를 사용한 철자 수정 및 패러프레이즈 생성 분석으로 활용 사례를 시연한다.

실험 결과

연구 질문

  • RQ1Wikipedia 개정 이력이 NLP 작업에 적합한 대규모로 자연적으로 발생하는 재작성들을 산출할 수 있는가?
  • RQ2코퍼스에서 어떤 유형의 로컬 재작성(철자 수정, 패러프레이즈 등)이 지배적이며 이를 어떻게 특징화할 수 있는가?
  • RQ3실무에서 WiCoPaCo가 철자 수정 및 패러프레이즈 생성 자원으로 얼마나 효과적인가?
  • RQ4다른 언어 및 위키에 대해 이 방법론을 재현하여 다국어 자원을 구축할 수 있는가?

주요 결과

  • WiCoPaCo는 맥락 속에 408,816개의 수정이 포함되어 있다.
  • 본 자원은 철자 수정, 패러프레이즈, 의미 변화 등 다양한 재작성 유형을 지원한다.
  • 프랑스어의 경우, 이 코퍼스는 철자 오류 분석 및 형태-통사적 재작성 패턴 연구를 가능하게 한다.
  • 후보 생성 소스의 조합은 철자 교정 후보 커버리지를 크게 개선한다(hunspell, 잦은 수정 패턴, 코퍼스에서 유도된 수정).
  • 철자 수정 실험에서 non-word 오류와 real-word 오류는 각각 72,493건과 74,100건으로 추출되었다.
  • 철자 수정 후보 평가에서 방법을 결합할 때 가장 높은 커버리지를 보이며, non-word 오류에 대해 96.8%, real-word 오류에 대해 92.6%에 도달한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.