Skip to main content
QUICK REVIEW

[论文解读] N-gram and Neural Language Models for Discriminating Similar Languages

Andre Cianflone, Leila Kosseim|arXiv (Cornell University)|Aug 11, 2017
Authorship Attribution and Profiling参考文献 13被引用 3
一句话总结

本文在2016年DSL共享任务中评估了基于字符的n-gram模型与双向LSTM的卷积神经网络(CLSTM)模型在区分相似语言中的表现。n-gram模型取得了88.45%的准确率,排名第七;而CLSTM模型在极少调参的情况下达到78.45%的准确率,表明在训练数据有限的情况下,传统n-gram模型在该任务上仍优于早期的神经网络模型。

ABSTRACT

This paper describes our submission (named clac) to the 2016 Discriminating Similar Languages (DSL) shared task. We participated in the closed Sub-task 1 (Set A) with two separate machine learning techniques. The first approach is a character based Convolution Neural Network with a bidirectional long short term memory (BiLSTM) layer (CLSTM), which achieved an accuracy of 78.45% with minimal tuning. The second approach is a character-based n-gram model. This last approach achieved an accuracy of 88.45% which is close to the accuracy of 89.38% achieved by the best submission, and allowed us to rank #7 overall.

研究动机与目标

  • 评估基于字符的n-gram模型与神经网络模型在区分相似语言方面的有效性。
  • 评估深度神经网络(如CLSTM)是否能在低资源环境下超越传统n-gram模型,用于语言变体的区分。
  • 研究区分密切相关的语言(特别是西班牙语变体与法语方言)所面临的挑战。
  • 确定命名实体是否显著影响语言识别性能。
  • 探索在无需语言学标注的情况下,直接使用原始文本训练语言区分模型的可行性。

提出的方法

  • 在DSL 2016报纸语料库(Set A)上训练了一个n=7的基于字符的n-gram模型,用于封闭赛道提交。
  • 采用1D卷积层后接双向LSTM层的混合CLSTM模型,处理原始字符序列。
  • n-gram模型使用字符级频率向量作为特征,采用SVM进行分类。
  • CLSTM模型在字符级输入上进行端到端训练,未进行任何语言学预处理。
  • 两个模型均在DSL 2016共享任务的相同保留测试集上进行评估。
  • 模型性能通过12种语言变体(包括地区性西班牙语、法语及其他国家变体)的宏F1和准确率进行衡量。

实验结果

研究问题

  • RQ1在训练数据有限的情况下,基于字符的n-gram模型能否在区分相似语言任务中实现高准确率?
  • RQ2当训练数据稀缺时,CLSTM模型是否能在语言区分任务中超越传统n-gram模型?
  • RQ3错误分类在不同语言组之间如何分布,特别是对西班牙语和法语等密切相关的语言变体?
  • RQ4命名实体在相似语言区分任务中的语言识别性能中起到多大影响?
  • RQ5区分相似语言变体是否需要采用两级分层分类方法?

主要发现

  • 基于字符的n-gram模型在DSL 2016共享任务的封闭赛道中取得了88.45%的准确率,17名参赛者中排名第7。
  • CLSTM模型在极少调参的情况下达到78.45%的准确率,显著低于n-gram基线模型。
  • n-gram模型在所有语言组中表现稳健,F1分数在0.70至0.95之间,对马来语和印度尼西亚语的区分最准确(F1=0.99)。
  • CLSTM模型在西班牙语变体上表现最差,特别是墨西哥西班牙语,F1仅为0.46,表明西班牙语方言之间存在高度混淆。
  • 不同语言组之间的错误分类稀疏且统计上不显著,表明两级分层方法可能并非必要。
  • 出人意料的是,从训练数据中移除命名实体仅导致准确率下降1–2个百分点,表明命名实体并非主要的区分信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。