Skip to main content
QUICK REVIEW

[論文レビュー] On the Entropy of Written Spanish

Fabio G. Guerrero|arXiv (Cornell University)|Jan 30, 2009
Algorithms and Data Compression参考文献 8被引用数 10
ひとこと要約

本稿では、12部の文学的作品およびEFE通信社の279,917語のニューズリポートを含む自然言語コーパスを用いた統計的手法により、スペイン語のエントロピーを分析している。n=1から18までのn-gram、ダイグラム、トライグラム、および文字のエントロピーを、頻度に基づく大数の法則を用いて計算し、1次マルコフモデルで生成された人工スペイン語と比較した。その結果、自然スペイン語は合成モデルよりもエントロピーが低く、本物の言語にはより高い予測可能性と構造的整合性があることが示された。

ABSTRACT

This paper reports on results on the entropy of the Spanish language. They are based on an analysis of natural language for n-word symbols (n = 1 to 18), trigrams, digrams, and characters. The results obtained in this work are based on the analysis of twelve different literary works in Spanish, as well as a 279917 word news file provided by the Spanish press agency EFE. Entropy values are calculated by a direct method using computer processing and the probability law of large numbers. Three samples of artificial Spanish language produced by a first-order model software source are also analyzed and compared with natural Spanish language.

研究の動機と目的

  • 複数の言語的単位(n-gram、ダイグラム、トライグラム、文字)を用いて、書かれたスペイン語の情報エントロピーを定量化すること。
  • 現実世界のコーパスを用いて、自然スペイン語の予測可能性と統計的構造を評価すること。
  • 1次マルコフモデルで生成された人工スペイン語のエントロピーと、自然スペイン語のエントロピーを比較すること。
  • 有限のテキストサンプルからのエントロピー推定に、大数の法則がどの程度有効に機能するかを評価すること。
  • 情報理論および計算言語学の応用分野におけるスペイン語の言語複雑性に関する実証的データを提供すること。

提案手法

  • エントロピーは、大規模なテキストコーパスからの観測頻度に基づく直接法によって計算される。
  • 有限の自然言語テキストサンプルからの確率推定に、大数の法則が適用される。
  • テキストサンプルには、12部の文学的作品およびスペイン通信社EFEの279,917語のニューズリポートが含まれる。
  • n-gramエントロピーは、n=1から18までの語の連鎖、およびダイグラムとトライグラムについて計算される。
  • 人工スペイン語テキストは1次マルコフモデルを用いて生成され、自然言語サンプルと比較される。
  • エントロピー値は、言語的単位の経験的確率分布から導出される。

実験結果

リサーチクエスチョン

  • RQ1n-gram長n=1から18の範囲で、書かれたスペイン語のエントロピーはどのように変化するか?
  • RQ21次マルコフモデルで生成された人工スペイン語と比較して、自然スペイン語のエントロピーはどの程度異なるか?
  • RQ3大数の法則は、有限のテキストサンプルから安定したエントロピー推定値を提供するか?
  • RQ4ダイグラムおよびトライグラムのエントロピーは、書かれたスペイン語の構造的予測可能性をどのように反映するか?
  • RQ5エントロピー分析は、スペイン語の情報含量と冗長性に関するどのような洞察を提供するか?

主な発見

  • 書かれたスペイン語のエントロピーはn-gram長が増加するにつれて低下しており、より長い語の連鎖では高い予測可能性が示されている。
  • 自然スペイン語は1次マルコフモデルで生成された人工スペイン語よりもエントロピーが低く、本物の言語にはより高い構造的規則性があることが示唆された。
  • トライグラムエントロピー値はユニグラムエントロピーと比べて顕著に低く、スペイン語の語の連鎖に強い局所的依存関係があることを反映している。
  • 十分に大きなテキストサンプルに大数の法則を適用することで、安定的かつ信頼性の高いエントロピー推定値が得られた。
  • 279,917語のEFEニューズリポートコーパスは、複数の言語的単位において一貫したエントロピー傾向を示しており、研究手法の妥当性が裏付けられた。
  • 1次モデルで生成された人工スペイン語は、自然スペイン語よりもエントロピーが高く、実際の言語は単純な確率的モデルよりも制約が多く、よりランダム性が低いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。