Skip to main content
QUICK REVIEW

[論文レビュー] Entropic analysis of the role of words in literary texts

Marcelo A. Montemurro, Damián H. Zanette|arXiv (Cornell University)|Sep 12, 2001
Fractal and DNA sequence analysis被引用数 5
ひとこと要約

本稿では、文法的知識を事前前提とせず、テキストの部品ごとの語の分布に基づくエントロピー的測度を提案し、文学的コーパスにおける語の言語的役割を定量化する。シャノンエントロピーを部品ごとの語頻度に適用することで、明確なクラスタリングパターンが明らかになる。固有名詞や貴族階級の称号はエントロピーが低く(局所的使用)、代名詞は高頻度で多様な分布を示し、名詞や形容詞といった内容語は、意味的役割と関連した体系的な統計的規則性を示す。

ABSTRACT

Beyond the local constraints imposed by grammar, words concatenated in long sequences carrying a complex message show statistical regularities that may reflect their linguistic role in the message. In this paper, we perform a systematic statistical analysis of the use of words in literary English corpora. We show that there is a quantitative relation between the role of content words in literary English and the Shannon information entropy defined over an appropriate probability distribution. Without assuming any previous knowledge about the syntactic structure of language, we are able to cluster certain groups of words according to their specific role in the text.

研究の動機と目的

  • 局所的な文法的規則を超えた大規模文学的テキストにおける語の分布の統計的規則性を特定すること。
  • シャノンエントロピーに基づく情報理論的で文法的でないアプローチを用いて、語の言語的役割を定量化すること。
  • 事前の言語的ラベルなしに、語の種別(例:代名詞、名詞、動詞)をその分布パターンに従って分類すること。
  • 言語のグローバルな構造的パターンが、テキスト部品にわたる語の統計的分布から生じるかどうかを調査すること。
  • エントロピーに基づく測度が、文法的構造に依存しない形で言語の階層的組織を明らかにできることを示すこと。

提案手法

  • 文学コーパスをP個の異なる部品(例:幕、章、巻)に分割し、局所的な語頻度の文脈を定義する。
  • 各語について、それぞれの部品における頻度 f_i = n_i / N_i を計算する。ここで n_i は部品iにおける語の出現回数、N_i は部品iの総語数である。
  • 各部品における語出現の確率分布 p_i = f_i / Σf_j を定義する。これは、語が各部品に出現する可能性を表す。
  • 正規化されたシャノンエントロピー S = -1/lnP Σ p_i ln p_i を計算する。ここで 0 ≤ S ≤ 1 であり、分布の均一性を測定する。
  • 分布の不均一性を頻度 n にスケーリングした量 (1 - S)n を用い、それを語の頻度 n に対してプロットする。
  • ランダムコーパスモデルを適用して、語の分布における非ランダムで統計的に有意なパターンを分離する。

実験結果

リサーチクエスチョン

  • RQ1テキスト部品にわたる語の分布パターンから、文法的構造を仮定せずに言語的役割を特定できるか?
  • RQ2代名詞、固有名詞、一般名詞などの異なる語の種別は、その分布エントロピーと頻度においてどのように異なるか?
  • RQ3語の使用における統計的規則性は、文学的テキストにおける長距離的構造的組織をどの程度反映しているか?
  • RQ4高頻度であるにもかかわらず、なぜ代名詞はテキスト部品にわたって予想外に不均一な分布を示すのか?
  • RQ5エントロピーに基づく測度は、分布パターンのみに依存して機能語と内容語を区別できるか?

主な発見

  • 固有名詞は、(1 - S)n ≈ n に近い恒等線に集約しており、エントロピーが低く、テキスト部品にわたり局所的に使用されていることが示唆される。
  • 王や公爵といった貴族階級の称号を表す名詞は、体系的に低エントロピーかつ高頻度を示し、登場人物中心の物語的役割を反映している。
  • 代名詞は高頻度であるが、分布に著しい不均一性を示し、エントロピー値は均一から大きく離れている。これは、複雑な物語的役割を果たしている可能性を示唆する。
  • 一般名詞や形容詞は中程度のエントロピーと頻度を示し、動詞や副詞よりもランダムから離れた分布を示している。
  • 動詞と副詞は、(1 - S)n 対 n 平面上で最も広範な分布を示しており、より均一かつ文脈に依存しない使用傾向があることが示唆される。
  • 同じクラスタリングパターンが、ディケンズやスティーブンソンの作品を含む複数の文学コーパスで一貫して観察され、本手法の堅牢性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。