[论文解读] A New Look at the Classical Entropy of Written English
本文提出一种基于计算的直接方法,利用2030万字符的文本数据,应用香农信息论原理估算书面英语的熵与冗余度。研究报告的熵值约为每字符1.3比特,并为语言建模提供了新见解,对抄袭检测和社交媒体消息传递效率具有启示意义。
A simple method for finding the entropy and redundancy of a reasonable long sample of English text by direct computer processing and from first principles according to Shannon theory is presented. As an example, results on the entropy of the English language have been obtained based on a total of 20.3 million characters of written English, considering symbols from one to five hundred characters in length. Besides a more realistic value of the entropy of English, a new perspective on some classic entropy-related concepts is presented. This method can also be extended to other Latin languages. Some implications for practical applications such as plagiarism-detection software, and the minimum number of words that should be used in social Internet network messaging, are discussed.
研究动机与目标
- 通过真实文本数据,提供更准确且基于实证的书面英语熵值估算。
- 通过从第一原理出发的直接计算,重新评估经典熵相关概念。
- 探索熵测量在抄袭检测和社交媒体消息传递等领域的实际应用。
- 将该方法扩展至其他拉丁字母语言。
- 通过使用更大、更具代表性的文本样本,纠正并更新先前对英语熵与冗余度的估算。
提出的方法
- 本研究处理了一段2030万字符的书面英语语料库,通过直接统计字符及字符序列的频率。
- 使用香农公式计算熵:H = -Σ p_i log₂ p_i,应用于字符级别和n-gram级别分布。
- 冗余度通过公式 R = 1 - (H / H_max) 推导得出,其中 H_max 为给定字符集的最大可能熵值。
- 分析涵盖长度从1到500个字符的符号序列,以评估长程依赖性。
- 计算不同n-gram长度下的熵值加权平均,以反映整体语言结构。
- 通过迭代修正(包括更新的冗余度计算和更正的参考文献)对方法进行验证与优化。
实验结果
研究问题
- RQ1当直接基于大规模真实文本语料库计算时,书面英语的实际熵值是多少?
- RQ2与基于较小或代表性不足样本的经典估算相比,书面英语的冗余度如何?
- RQ3书面英语中的长程依赖性在多大程度上影响熵值估算?
- RQ4该计算方法能否推广至其他拉丁字母语言?
- RQ5准确的熵值对抄袭检测和数字通信等应用具有何种实际意义?
主要发现
- 基于2030万字符的文本样本,书面英语的熵值估算约为每字符1.3比特。
- 书面英语的冗余度计算结果约为86%,表明语言结构具有高度可预测性。
- 本研究通过使用更大、更具代表性的数据集和优化的平均方法,纠正了先前的估算结果。
- 该方法表明,随着n-gram长度的增加,熵值下降,反映出长序列中可预测性增强。
- 结果支持在实际系统(如抄袭检测软件)中使用基于熵的度量指标。
- 该方法可扩展至其他拉丁字母语言,为语言熵分析提供可扩展的框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。