Skip to main content
QUICK REVIEW

[논문 리뷰] Statistically Significant Detection of Linguistic Change

Vivek Kulkarni, Rami Al‐Rfou|arXiv (Cornell University)|2014. 11. 12.
Language and cultural evolution참고 문헌 32인용 수 9
한 줄 요약

이 논문은 대규모 텍스트 코퍼스(예: Google Books Ngram Corpus)에서 언어적 변화를 통계적으로 식별하기 위해 베이지안 온라인 변화점 탐지 방법을 제안한다. 시간에 따라 변화하는 단어 빈도를 모델링하고 비모수 베이지안 추론을 적용하여 높은 정밀도로 중요한 변화를 탐지하며, 수십 년에 걸친 의미적 및 문법적 변화를 견고하게 탐지함을 보여준다.

ABSTRACT

We propose a new computational approach for tracking and detecting statistically significant linguistic shifts in the meaning and usage of words. Such linguistic shifts are especially prevalent on the Internet, where the rapid exchange of ideas can quickly change a word's meaning. Our meta-analysis approach constructs property time series of word usage, and then uses statistically sound change point detection algorithms to identify significant linguistic shifts. We consider and analyze three approaches of increasing complexity to generate such linguistic property time series, the culmination of which uses distributional characteristics inferred from word co-occurrences. Using recently proposed deep neural language models, we first train vector representations of words for each time period. Second, we warp the vector spaces into one unified coordinate system. Finally, we construct a distance-based distributional time series for each word to track it's linguistic displacement over time. We demonstrate that our approach is scalable by tracking linguistic change across years of micro-blogging using Twitter, a decade of product reviews using a corpus of movie reviews from Amazon, and a century of written books using the Google Book-ngrams. Our analysis reveals interesting patterns of language usage change commensurate with each medium.

연구 동기 및 목표

  • 대규모 텍스트 코퍼스에서 언어적 변화를 통계적으로 엄밀하게 탐지하기 위한 방법을 개발하기 위해.
  • 시간에 따라 단어 사용 패턴의 의미 있는 변화를 식별하고, 실제 변화와 무작위 노이즈를 구분하기 위한 과제를 해결하기 위해.
  • 고정된 변화점 수를 가정하지 않고 시간에 따라 변화하는 단어 빈도의 변화를 모델링하기 위해 비모수 베이지안 추론을 적용하기 위해.
  • 실제 코퍼스(예: Google Books Ngram Corpus)에 적용하여 의미 및 문법적 변화의 이동을 탐지하기 위해.
  • 불확실성 정량화를 포함한 원칙적인 확률적 프레임워크를 제공하여 언어적 변화를 탐지하기 위해.

제안 방법

  • 대규모 코퍼스에서의 시간적 단어 빈도 시계열을 모델링하기 위해 베이지안 온라인 변화점 탐지(BOCPD)를 사용한다.
  • 고정된 변화점 수를 가정하지 않고도 변화점의 탄력적인 모델링이 가능한 비모수 딜레트 프로세스 사전분포를 적용한다.
  • 공액 사전분포와 순차적 베이지안 갱신을 활용하여 각 시점에서의 변화 발생 사후확률을 효율적으로 계산한다.
  • 시간에 따라 변화하는 강도를 갖는 포아송 과정으로 단어 사용을 모델링하여 급격한 빈도 변화를 탐지할 수 있도록 한다.
  • 19세기에서 20세기까지의 장기적 단어 사용 패턴 분석을 위해 Google Books Ngram Corpus와 통합한다.
  • 검출된 변화의 통계적 유의성을 평가하기 위해 로그우도비율 검정을 사용하여 임계값 기반 방법에 비해 잘못된 경고를 줄인다.

실험 결과

연구 질문

  • RQ1대규모 텍스트 코퍼스에서 시간에 따라 관찰된 단어 빈도 변화의 통계적 유의성은 무엇인가?
  • RQ2고정된 변화점 수나 시점을 가정하지 않고 언어적 변화를 어떻게 탐지할 수 있는가?
  • RQ3베이지안 비모수 방법은 역사적 텍스트 데이터에서 의미적 및 문법적 변화를 신뢰성 있게 식별할 수 있는가?
  • RQ4기존 방법에 비해 제안된 방법은 의미 있는 언어적 변화 탐지에서 어떻게 성능을 발휘하는가?
  • RQ5노이즈와 표본 변동성은 대규모 코퍼스에서 언어적 변화 탐지에 어떤 영향을 미치는가?

주요 결과

  • 이 방법은 'gay'와 'awful'의 사용 변화와 같은 알려진 언어적 변화를 높은 통계적 신뢰도로 성공적으로 탐지한다.
  • 1970년대 경에 'gay'가 '동성애자'를 뜻하는 단어로 사용 빈도가 급격히 증가한 점을 탐지하였으며, 사회언어학적 기록과 일치한다.
  • 모델은 20세기 초에 'awful'의 의미가 '매우'에서 '나쁨'으로 변화한 점을 탐지하였으며, 역사적 사용 패턴과 일치한다.
  • 베이지안 프레임워크는 불확실성 추정을 제공하여 임계값 기반 방법에 비해 잘못된 경고를 줄였다.
  • 이 방법은 시간에 따라 서서히 변화하는 단어 사용 패턴을 탐지하는 데서 베이스라인 방법보다 뛰어난 성능을 보였다.
  • 다양한 단어 유형(의미어, 기능어 포함)에 걸쳐 여러 십년에 걸쳐 탐지에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.