Skip to main content
QUICK REVIEW

[论文解读] Entropic analysis of the role of words in literary texts

Marcelo A. Montemurro, Damián H. Zanette|arXiv (Cornell University)|Sep 12, 2001
Fractal and DNA sequence analysis被引用 5
一句话总结

本文提出一种基于文本分区中文本词分布的熵度量方法,用于在不依赖先验句法知识的前提下量化文学语料中词语的语言角色。通过分析各部分特定词频的香农熵,该方法揭示了明显的聚类模式:专有名词和贵族头衔表现出低熵(使用局部化),代词呈现高频且分布异质的特征,而名词和形容词等内容词则表现出与语义角色相关的系统性统计规律。

ABSTRACT

Beyond the local constraints imposed by grammar, words concatenated in long sequences carrying a complex message show statistical regularities that may reflect their linguistic role in the message. In this paper, we perform a systematic statistical analysis of the use of words in literary English corpora. We show that there is a quantitative relation between the role of content words in literary English and the Shannon information entropy defined over an appropriate probability distribution. Without assuming any previous knowledge about the syntactic structure of language, we are able to cluster certain groups of words according to their specific role in the text.

研究动机与目标

  • 识别大规模文学文本中超越局部句法规则的词分布统计规律。
  • 基于香农熵的信息论方法,以非句法方式量化词语的语言角色。
  • 根据其分布模式对词类(如代词、名词、动词)进行分类,而无需事先的语言学标注。
  • 探究语言中的全局结构模式是否源于文本分区间词的统计分布。
  • 证明基于熵的度量能够揭示独立于语法结构的语言层次组织。

提出的方法

  • 将文学语料库划分为 P 个不同部分(如幕、章、卷),以定义局部词频上下文。
  • 对每个词,计算其在每部分中的频率,f_i = n_i / N_i,其中 n_i 为词频,N_i 为第 i 部分的总词数。
  • 在 P 个部分上定义概率分布 p_i = f_i / Σf_j,表示该词在各部分中出现的可能性。
  • 计算归一化的香农熵 S = -1/lnP Σ p_i ln p_i,其中 0 ≤ S ≤ 1,以量化分布的均匀性。
  • 使用量值 (1 - S)n 作为按频率缩放的分布异质性度量,将其与词频 n 绘制成图。
  • 应用随机语料模型以分离词分布中非随机且具有统计显著性的模式。

实验结果

研究问题

  • RQ1在不假设句法结构的前提下,能否通过文本分区间的词分布模式揭示词语的语言角色?
  • RQ2不同词类(如代词、专有名词、普通名词)在分布熵和频率上如何不同?
  • RQ3词使用中的统计规律在多大程度上反映了文学文本中的长程结构组织?
  • RQ4为何代词尽管频率很高,却在文本部分间表现出出人意料的异质性分布?
  • RQ5基于熵的度量能否仅凭分布模式区分功能词与内容词?

主要发现

  • 专有名词聚集在恒等线附近,(1 - S)n ≈ n,表明熵低且在文本部分中高度局部化使用。
  • 指代贵族的名词(如 King, Duke)表现出系统性低熵和高频率,反映出其在人物驱动叙事中的作用。
  • 代词尽管频率极高,却表现出显著的分布异质性,熵值远非均匀,暗示其具有复杂叙事角色。
  • 普通名词和形容词表现出中等熵和频率,其分布比动词和副词更远离随机。
  • 动词和副词在 (1 - S)n 与 n 的平面上表现出最广泛的分布,表明其使用更均匀且对上下文不那么依赖。
  • 相同的聚类模式在多个文学语料库中(包括狄更斯和斯蒂文森的作品)一致出现,证实了该方法的稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。