Skip to main content
QUICK REVIEW

[論文レビュー] Is language evolution grinding to a halt?: Exploring the life and death of words in English fiction.

Eitan Adam Pechenick, Christopher M. Danforth|arXiv (Cornell University)|Mar 11, 2015
Language and cultural evolution被引用数 3
ひとこと要約

本研究は、1820年から2000年までのGoogle Booksコーパスの2012年英語小説サブセットにおける語の出現・消滅レートを分析し、Jensen-Shannon散逸を用いて周波数閾値ごとの変動を評価する。個々の語の使用頻度に変動は見られるが、英語言語の全体的な統計的構造は時間経過とともに安定しており、小説コーパスにおける学術的文献の影響が結果にバイアスを及える可能性があることが判明した。

ABSTRACT

The Google Books corpus, derived from millions of books in a range of major languages, would seem to offer many possibilities for research into cultural, social, and linguistic evolution. In a previous work, we found that the 2009 and 2012 versions of the unfiltered English data set as well as the 2009 version of the English Fiction data set are all heavily saturated with scientific and medical literature, rendering them unsuitable for rigorous analysis. By contrast, the 2012 version of English Fiction appeared to be uncompromised, and we use this data set to explore language dynamics for English from 1820--2000. We critique a previous method for measuring birth and death rates of words, and provide a robust, principled to examining the volume of word flux across various relative frequency usage thresholds. We use the contributions to the Jensen-Shannon divergence of words crossing thresholds between consecutive decades to illuminate the major driving factors behind the flux. We find that while individual word usage may vary greatly, the overall statistical structure of the language appears to remain fairly stable. We also find indications that scholarly works about fiction are strongly represented in the 2012 English Fiction corpus, and suggest that a future revision of the corpus should attempt to separate critical works from fiction itself.

研究の動機と目的

  • Google Booksコーパスが言語の進化を研究するうえで信頼できるものかどうかを評価すること、特に英語小説データセットにおいて。
  • 従来の語の出現・消滅レートを測定する手法に課題があった点を是正し、原理的で閾値に基づくアプローチを導入すること。
  • 個々の語の使用頻度に変動があるにもかかわらず、英語言語の統計的構造が時間経過とともに安定しているかどうかを調査すること。
  • 2012年英語小説コーパスに、特に小説に関する学術的文献が含まれることによる潜在的なバイアスを同定すること。
  • 言語学的研究のためのデータ整合性を向上させるために、批評的文献とオリジナル小説を分離するコーパス改訂を提言すること。

提案手法

  • 科学的および医学的文献の汚染が比較的少ない、Google Booksコーパスの2012年英語小説サブセットを用いる。
  • 使用頻度の区間ごとに閾値に基づく手法を適用し、使用頻度のレベルにかかわらず堅牢な測定を実現する。
  • 連続する十年間の間の全体的な語の変動に寄与する個々の語の寄与度を測定するために、Jensen-Shannon散逸を用いる。
  • 周波数閾値を跨ぐ語が変動にどのように寄与しているかを分析し、語彙的変化の主な駆動要因を同定する。
  • 異常な頻度の語(物語的小説とは関係のない高頻度語)を検出することで、コーパスの整合性を検証し、学術的コンテンツの兆候を特定する。
  • 批評的文献とオリジナル小説を分離する修正されたコーパス構造を提言する。

実験結果

リサーチクエスチョン

  • RQ1Google Booksデータセットの2012年英語小説コーパスは、どの程度科学的・医学的文献の汚染から解放されているか?
  • RQ2語の出現・消滅レートは、さまざまな周波数閾値でどのように変化するのか? これにより語彙的ダイナミクスの何が明らかになるか?
  • RQ3周波数閾値を跨ぐ個々の語は、Jensen-Shannon散逸で測定される全体的な語の変動をどのように駆動しているか?
  • RQ4個々の語の使用頻度に変動があるにもかかわらず、小説における英語言語の統計的構造は時間経過とともに安定しているか?
  • RQ52012年英語小説コーパスにおいて、小説に関する学術的文献がどれほどオリジナル小説として誤って分類されているか?

主な発見

  • 2012年英語小説コーパスは、科学的および医学的文献の汚染からほとんど影響を受けておらず、言語学的分析に適している。
  • 個々の語の使用頻度に著しい変動があるにもかかわらず、1820年から2000年までの小説における英語言語の全体的な統計的構造は比較的安定している。
  • 周波数閾値を跨ぐ語はJensen-Shannon散逸に有意義に寄与しており、閾値を跨ぐ出来事自体が語彙的変動の主な駆動要因であることが示唆される。
  • コーパスには学術的文献が含まれている兆候が認められ、語の頻度パターンに歪みをもたらし、言語学的推論に影響を及ぼす可能性がある。
  • 今後のコーパス改訂において、批評的文献とオリジナル小説を分離する必要があることが同定された。
  • 提案された閾値に基づく手法は、従来の語の出現・消滅レート推定手法に比べ、より原理的で堅牢な代替手段を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。