Skip to main content
QUICK REVIEW

[论文解读] Modeling Language Change in Historical Corpora: The Case of Portuguese

Marcos Zampieri, Shervin Malmasi|arXiv (Cornell University)|Sep 30, 2016
Natural Language Processing Techniques参考文献 33被引用 7
一句话总结

本文提出了一种监督式机器学习方法,用于使用词项独元组(word unigrams)和词性(POS)n-gram对历史葡萄牙语语料库中的时间文本分类。该方法利用支持向量机(SVM)在100年或50年时间区间的分类中实现了99.8%的准确率,表明词性特征可揭示语法和风格上的变化,例如19至20世纪形容词使用频率的上升;而古语词则成为16世纪文本的强标记。

ABSTRACT

This paper presents a number of experiments to model changes in a historical Portuguese corpus composed of literary texts for the purpose of temporal text classification. Algorithms were trained to classify texts with respect to their publication date taking into account lexical variation represented as word n-grams, and morphosyntactic variation represented by part-of-speech (POS) distribution. We report results of 99.8% accuracy using word unigram features with a Support Vector Machines classifier to predict the publication date of documents in time intervals of both one century and half a century. A feature analysis is performed to investigate the most informative features for this task and how they are linked to language change.

研究动机与目标

  • 探究词汇和形态句法特征是否能有效预测语料库中历史文本的出版时间。
  • 评估监督学习分类器(特别是SVM)在使用词项独元组和POS分布进行时间分类时的性能。
  • 识别并分析与时间跨度中语言变化相关联的最具信息量的特征。
  • 探讨利用人工生成的训练和测试实例来应对历史语料库中数据稀缺问题的可行性。
  • 考察时间区间粒度(100年 vs. 50年)对分类准确率和语言可解释性的影响。

提出的方法

  • 构建了一个涵盖16世纪至20世纪初的历史葡萄牙语语料库(Colonia),并标注了词性(POS)标签。
  • 提取词项独元组和POS n-gram作为语言特征,以表征词汇和形态句法的变异。
  • 训练支持向量机(SVM)分类器,以预测预设时间区间(100年和50年跨度)内的出版时间。
  • 通过组合同一时期的文本片段来生成合成训练和测试实例,实现数据增强,以应对数据量不足的问题。
  • 利用训练后的SVM进行特征重要性分析,识别最具区分性的词汇和POS模式。
  • 对关键特征进行语言学解释,将其与已记录的语言演变现象(如古语词和风格转变)相联系。

实验结果

研究问题

  • RQ1词项独元组和POS n-gram是否能有效将历史葡萄牙语文本分类至100年和50年的时区?
  • RQ2与词汇特征(词项独元组)相比,形态句法特征(POS n-gram)在预测出版时间方面表现如何?
  • RQ3哪些特定的语言特征对时间分类最具信息量,它们如何反映实际的语言演变?
  • RQ4人工生成的训练实例在低资源历史文本分类中能在多大程度上提升性能?
  • RQ5不同的时间区间粒度(100年 vs. 50年)如何影响分类准确率和语言演变的可检测性?

主要发现

  • 仅使用词项独元组特征,SVM分类器在100年时间区间的文本分类中达到了99.8%的准确率。
  • 在50年时间区间中,同一模型同样保持99.8%的准确率,表明词汇特征在细粒度时间划分中也具有极强的区分能力。
  • 仅使用POS n-gram时,分类器在100年区间的准确率为90.7%,在50年区间的准确率为90.1%,表明语法和句法模式是强有力的时间指标。
  • 最具信息量的特征包括如 'per' 和 'pera' 等古语词,这些词在16世纪文本中极具特征性,反映出拉丁语的影响。
  • 19至20世纪形容词使用频率的增加被POS n-gram捕捉到,表明这是文本风格随时间演变的一种表现。
  • 特征分析表明,POS n-gram受主题特异性影响较小,更直接关联于语法和风格的演变,因此在检测结构性语言变化方面具有重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。