Skip to main content
QUICK REVIEW

[论文解读] Comparing Approaches to Dravidian Language Identification

Tommi Jauhiainen, Tharindu Ranasinghe|arXiv (Cornell University)|Mar 9, 2021
Natural Language Processing Techniques参考文献 44被引用 12
一句话总结

本论文在德鲁维迪亚语语言识别(DLI)共享任务中评估了两种方法——基于自适应语言模型的朴素贝叶斯模型与微调过的Transformer模型,该任务涉及在罗马字母书写系统中识别卡纳达语、马拉雅拉姆语和泰米尔语的混合语种YouTube评论。朴素贝叶斯模型以0.92的宏平均F1得分获得第二名,优于基于Transformer的模型,表明尽管在其他自然语言处理领域深度学习占据主导地位,传统方法在低资源、混合语种语言识别任务中依然具有竞争力。

ABSTRACT

This paper describes the submissions by team HWR to the Dravidian Language Identification (DLI) shared task organized at VarDial 2021 workshop. The DLI training set includes 16,674 YouTube comments written in Roman script containing code-mixed text with English and one of the three South Dravidian languages: Kannada, Malayalam, and Tamil. We submitted results generated using two models, a Naive Bayes classifier with adaptive language models, which has shown to obtain competitive performance in many language and dialect identification tasks, and a transformer-based model which is widely regarded as the state-of-the-art in a number of NLP tasks. Our first submission was sent in the closed submission track using only the training set provided by the shared task organisers, whereas the second submission is considered to be open as it used a pretrained model trained with external data. Our team attained shared second position in the shared task with the submission based on Naive Bayes. Our results reinforce the idea that deep learning methods are not as competitive in language identification related tasks as they are in many other text classification tasks.

研究动机与目标

  • 评估传统模型与深度学习模型在罗马字母书写系统中的混合德鲁维迪亚语语言识别任务中的表现。
  • 探究基于Transformer的模型是否在低资源、混合语种语言识别任务中优于经典方法。
  • 评估预处理选择(如大小写规范化和字符级n-gram)对模型性能的影响。
  • 比较自适应语言模型与预训练Transformer模型在具有挑战性的多语言、混合语种数据集上的有效性。
  • 增进对为何在某些语言识别场景中深度学习模型表现不佳的理解,尽管其在其他自然语言处理任务中表现出色。

提出的方法

  • 采用基于字符级n-gram训练的自适应语言模型的朴素贝叶斯分类器,包括小写和原始大小写两种变体。
  • 使用多语言BERT和XLM-R large模型,并在DLI数据集上端到端微调以实现基于Transformer的方法。
  • 通过使用不同随机种子的多个Transformer模型进行投票集成策略,以提高预测的鲁棒性。
  • 使用0.8:0.2的训练-验证划分,通过网格搜索优化超参数(初始学习率=1e-5,训练轮数=3)。
  • 使用测试集上的宏平均F1进行模型评估,最终预测基于集成模型中概率最高的结果。
  • 通过消融研究评估预处理的影响,包括大小写规范化和非字母字符的使用,以评估特征重要性。

实验结果

研究问题

  • RQ1基于自适应语言模型的朴素贝叶斯分类器是否在混合德鲁维迪亚语语言识别任务中优于基于Transformer的模型?
  • RQ2如大小写规范化和非字母字符的包含等预处理选择如何影响该任务的性能?
  • RQ3预训练的Transformer模型在涉及德鲁维迪亚语的低资源、混合语种罗马字母文本上的泛化能力如何?
  • RQ4为何在该语言识别场景中,Transformer模型的表现不如更简单的模型?
  • RQ5集成策略是否能提升Transformer模型在这一具有挑战性的低资源语言识别任务中的性能?

主要发现

  • 朴素贝叶斯分类器获得了0.92的宏平均F1得分,在DLI共享任务中并列第二名。
  • 基于Transformer的模型获得了0.89的宏平均F1得分,比朴素贝叶斯模型低3个百分点。
  • 尽管后者在许多自然语言处理任务中被视为最先进模型,朴素贝叶斯模型仍表现更优。
  • 朴素贝叶斯模型中使用原始大小写和非字母字符显示出提升潜力,这一结论由消融实验结果支持。
  • 模型之间的性能差距表明,预训练的Transformer模型可能因在预训练阶段缺乏对混合语种、低资源、罗马字母德鲁维迪亚语文本的接触而表现不佳。
  • 结果表明,深度学习方法在语言识别任务中并非总是更优,尤其是在低资源或高度混合语种的场景下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。