[论文解读] Authorship Identification in Bengali Literature: a Comparative Analysis
本文提出了一种基于风格特征与机器学习的新型孟加拉语文学作者识别系统,表明SVM在性能上优于统计模型及其他分类器。该研究识别出一系列关键风格标记——如词长、关键词重叠率及短语频率——这些特征即使在缺乏体裁或时间线索的情况下,也能稳定地区分作者。
Stylometry is the study of the unique linguistic styles and writing behaviors of individuals. It belongs to the core task of text categorization like authorship identification, plagiarism detection etc. Though reasonable number of studies have been conducted in English language, no major work has been done so far in Bengali. In this work, We will present a demonstration of authorship identification of the documents written in Bengali. We adopt a set of fine-grained stylistic features for the analysis of the text and use them to develop two different models: statistical similarity model consisting of three measures and their combination, and machine learning model with Decision Tree, Neural Network and SVM. Experimental results show that SVM outperforms other state-of-the-art methods after 10-fold cross validations. We also validate the relative importance of each stylistic feature to show that some of them remain consistently significant in every model used in this experiment.
研究动机与目标
- 开发一种基于机器学习的孟加拉语文学作者识别系统,该语言为低资源语言,且此前在风格语言学研究方面较为有限。
- 在相同特征集上,比较统计相似性模型(余弦相似度、卡方检验、欧几里得距离)与机器学习模型(SVM、决策树、神经网络)的性能表现。
- 识别并验证在不同模型中区分作者的风格特征的相对重要性。
- 通过分析经过筛选的孟加拉语文学文本语料库,为未来印度语言的风格语言学研究建立基准。
提出的方法
- 使用轻量级解析器对孟加拉语文本进行预处理,以提取词性、短语边界及句子分割信息。
- 在词元、短语和上下文层级上提取11个归一化的风格特征,包括词长、标点符号数量、名词/动词短语频率以及关键词重叠率。
- 应用TF-IDF识别每位作者的前50个高频关键词(排除停用词),以形成作者特定的关键词集合。
- 采用10折交叉验证评估模型性能,以防止因数据集规模有限而导致的过拟合。
- 使用SVM、决策树和神经网络分类器比较预测准确率及特征重要性。
- 通过逐个移除单一特征进行消融研究,以衡量其对模型准确率的影响,并评估特征的相关性。
实验结果
研究问题
- RQ1在控制体裁与时间周期的前提下,机器学习模型能否有效利用风格特征识别孟加拉语文学文本中的作者?
- RQ2统计相似性度量(余弦相似度、卡方检验、欧几里得距离)与机器学习模型(SVM、DT、NN)在孟加拉语作者识别中的表现如何比较?
- RQ3在孟加拉语作者识别中,哪些风格特征在不同机器学习模型中表现出最一致的重要性?
- RQ4特征消融如何影响模型准确率?哪些特征对性能差异的贡献最大?
- RQ5作者识别系统中主要的误分类来源是什么?它们与作者特定的写作模式有何关联?
主要发现
- SVM在所有模型中平均准确率最高,且在10折交叉验证中性能方差显著更低,表明其具有更强的鲁棒性。
- 词长特征在所有模型中始终为最重要特征,其次为与目标作者的关键词重叠率(KW(R)、KW(A)、KW(O))及名词短语频率。
- 对话长度与未知词数量等特征在SVM中重要性较高,但在决策树与神经网络模型中影响较小,表明特征重要性具有模型依赖性。
- Cohen’s Kappa分析显示,决策树与神经网络模型之间具有高度的一致性,但两者准确率均低于SVM,表明SVM具有更强的判别能力。
- 该系统对作者R存在过估计倾向,可能由于该作者语料库的训练数据多样性较低且结构不够严谨。
- 消融研究显示,若移除如词长或关键词重叠等关键特征,准确率下降最为显著,证实了这些特征在作者区分中的核心作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。