[论文解读] On the Entropy of Written Spanish
本文使用统计方法对自然语言语料库中的书面西班牙语熵进行分析,涵盖12部文学作品和来自埃菲通讯社的279,917词新闻电讯稿。通过频率大数定律计算n-gram(n=1至18)、二元组、三元组及字符的熵值,与一阶马尔可夫模型生成的合成西班牙语进行比较,发现自然西班牙语的熵低于合成模型,表明真实语言具有更高的可预测性和结构性。
This paper reports on results on the entropy of the Spanish language. They are based on an analysis of natural language for n-word symbols (n = 1 to 18), trigrams, digrams, and characters. The results obtained in this work are based on the analysis of twelve different literary works in Spanish, as well as a 279917 word news file provided by the Spanish press agency EFE. Entropy values are calculated by a direct method using computer processing and the probability law of large numbers. Three samples of artificial Spanish language produced by a first-order model software source are also analyzed and compared with natural Spanish language.
研究动机与目标
- 量化书面西班牙语在多种语言单位(n-gram、二元组、三元组、字符)上的信息熵。
- 利用真实世界语料库评估自然西班牙语语言的可预测性和统计结构。
- 比较自然西班牙语与一阶马尔可夫模型生成的合成西班牙语的熵值。
- 评估大数定律在从有限文本样本估计熵值方面的有效性。
- 为信息论和计算语言学应用提供关于西班牙语复杂性的实证数据。
提出的方法
- 基于大文本语料库中观察到的频率,使用直接法计算熵值。
- 应用大数定律,从自然语言文本的有限样本中估计概率。
- 文本样本包括12部文学作品和来自西班牙通讯社埃菲的279,917词新闻电讯稿。
- 计算n=1至18的词序列n-gram熵值,以及二元组和三元组的熵值。
- 使用一阶马尔可夫模型生成合成西班牙语文本,并与自然语言样本进行比较。
- 熵值基于语言单位的经验概率分布推导得出。
实验结果
研究问题
- RQ1当测量不同n-gram长度(n=1至18)时,书面西班牙语的熵值是多少?
- RQ2自然西班牙语的熵与一阶马尔可夫模型生成的合成西班牙语的熵相比如何?
- RQ3大数定律在多大程度上能从有限文本样本中提供稳定的熵估计?
- RQ4二元组和三元组的熵值如何反映书面西班牙语的结构可预测性?
- RQ5熵分析为西班牙语的信息含量和冗余性提供了哪些见解?
主要发现
- 随着n-gram长度的增加,书面西班牙语的熵值降低,表明长序列具有更高的可预测性。
- 自然西班牙语的熵值低于一阶马尔可夫模型生成的合成西班牙语,表明真实语言具有更强的结构性规律。
- 三元组熵值显著低于一元组熵值,反映出西班牙语词序中存在强烈的局部依赖性。
- 当应用于足够大的文本样本时,大数定律能提供稳定且可靠的熵估计。
- 279,917词的埃菲新闻电讯稿语料库在多个语言单位上呈现出一致的熵趋势,验证了该方法的有效性。
- 由一阶模型生成的合成西班牙语熵值高于自然西班牙语,表明真实语言比简单的随机模型更具约束性、更不随机。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。