Skip to main content
QUICK REVIEW

[论文解读] German Dialect Identification Using Classifier Ensembles

Alina Maria Ciobanu, Shervin Malmasi|arXiv (Cornell University)|Jul 22, 2018
Authorship Attribution and Profiling参考文献 12被引用 4
一句话总结

本论文提出了一种基于SVM的集成分类器,用于德语方言识别,利用字符和词n-gram特征并结合TF-IDF加权,以区分四种瑞士德语方言(巴塞尔、伯尔尼、卢塞恩、苏黎世)。该系统在VarDial 2018共享任务中测试集上的F1得分为62.03%,在八支队伍中排名第三,其中字符4-gram与由四个分类器组成的集成模型表现最优。

ABSTRACT

In this paper we present the GDI_classification entry to the second German Dialect Identification (GDI) shared task organized within the scope of the VarDial Evaluation Campaign 2018. We present a system based on SVM classifier ensembles trained on characters and words. The system was trained on a collection of speech transcripts of five Swiss-German dialects provided by the organizers. The transcripts included in the dataset contained speakers from Basel, Bern, Lucerne, and Zurich. Our entry in the challenge reached 62.03% F1-score and was ranked third out of eight teams.

研究动机与目标

  • 开发一种从语音转录文本中稳健分类瑞士德语方言的系统。
  • 通过使用多样化特征类型的集成学习方法提升方言识别性能。
  • 评估字符n-gram与词n-gram结合TF-IDF加权在方言分类中的有效性。
  • 在GDI 2018共享任务中跻身前列,延续先前在作者画像与方言识别方面的研究工作。

提出的方法

  • 训练了14个独立的SVM分类器作为集成模型,每个分类器使用不同的特征类型:字符n-gram(n=1至8)、词n-gram(n=1至3)以及词k-跳变大词组(k=1至3)。
  • 所有基分类器均采用线性核的LinearSVC,并使用L2正则化,超参数C通过在{10⁻³, ..., 10³}范围内进行网格搜索进行调优。
  • 通过多数投票策略组合集成模型的预测结果,当出现平票时按标签升序顺序决定。
  • 对所有特征类型应用TF-IDF加权,以突出具有区分性的n-gram并减少高频词的过度表示。
  • 最优集成模型由四个使用字符n-gram(n∈{2, 3, 4, 5})的分类器组成,其选择基于开发集上的性能表现。
  • 系统在GDI 2018数据集上进行训练与评估,该数据集包含来自巴塞尔、伯尔尼、卢塞恩和苏黎世的24,849个转录语音样本。

实验结果

研究问题

  • RQ1与单个分类器相比,SVM分类器的集成是否能提升方言识别的准确率?
  • RQ2在瑞士德语方言分类中,字符n-gram或词n-gram特征类型中哪一种表现更优?
  • RQ3通过集成学习结合多种特征类型,是否能降低分类错误率,尤其是减少相似方言之间的误判?
  • RQ4该系统在未见方言上的表现如何?特征工程对模型泛化能力有何影响?

主要发现

  • 表现最佳的单个分类器使用字符4-gram,其在开发集上的F1得分为0.621。
  • 由四个使用字符n-gram(n=2至5)的分类器组成的最优集成模型,在开发集上的F1得分为0.638。
  • 最终提交的系统采用相同的四类字符n-gram特征,在测试集上取得0.6203的F1得分,在共享任务中排名第三。
  • 该系统显著优于随机基线,后者在测试集上的F1得分为0.2521。
  • 混淆矩阵分析显示,卢塞恩(LU)方言最常被误分类为伯尔尼(BE)方言,表明这两种方言具有高度相似性。
  • 最具信息量的字符4-gram因方言而异,表现出不同模式,例如伯尔尼方言中出现'|n¨ac| aus |seit|nei|',而巴塞尔方言中则为'|uns|aabe|kha|rlig|'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。