[论文解读] A Fast, Compact, Accurate Model for Language Identification of Codemixed Text
该论文提出CMX,一种用于混合语言文本中细粒度语言识别的快速、紧凑且准确的模型,采用前馈网络结合全局约束解码器,对100种语言的每个词元进行语言预测。该模型在混合语言数据集上实现了19.5%的绝对准确率提升,相比之前模型提速800倍,并通过选择性分组dropout和合成训练数据增强了对非正式文本的鲁棒性。
We address fine-grained multilingual language identification: providing a language code for every token in a sentence, including codemixed text containing multiple languages. Such text is prevalent online, in documents, social media, and message boards. We show that a feed-forward network with a simple globally constrained decoder can accurately and rapidly label both codemixed and monolingual text in 100 languages and 100 language pairs. This model outperforms previously published multilingual approaches in terms of both accuracy and speed, yielding an 800x speed-up and a 19.5% averaged absolute gain on three codemixed datasets. It furthermore outperforms several benchmark systems on monolingual language identification.
研究动机与目标
- 为解决社交媒体和用户生成内容中普遍存在但先前模型研究不足的混合语言文本中细粒度、词元级语言识别挑战。
- 开发一种在100种语言及100对语言组合(包括单语和混合语言输入)中均保持高准确率和高速度的模型。
- 通过基于语言模式生成合成混合语言样本,缓解词元级标注数据稀缺的问题。
- 通过一种新颖的特征dropout策略,提升对非正式文本(包括拼写错误、音译和缩写)的鲁棒性。
- 设计一种全局约束解码机制,在保持速度的同时减少语言切换的过度预测。
提出的方法
- 使用包含字符n-gram、书写系统和词典特征的前馈神经网络,独立预测每个词元的语言分布。
- 全局约束解码器施加语言切换惩罚,并在整句话范围内强制执行双语约束,以提升标签一致性。
- 应用选择性分组dropout,平衡字符级与词级特征,防止在非正式文本中词级特征压倒n-gram特征。
- 通过使用真实世界混合语言模式混合100种语言的单语句子,生成200万条合成混合语言训练数据。
- 构建了一个包含25,000个句子(33万词元)的真实世界混合语言语料库,用于评估,涵盖英语-西班牙语、英语-印地语和英语-印尼语的混合。
- 模型端到端训练,并在三个混合语言数据集(GY-Mix、Twitter-Mix、Web-Mix6)和一个单语语料库(KB-Mono56)上进行评估。
实验结果
研究问题
- RQ1单一模型是否能在100种语言及100对语言组合(包括混合语言和单语文本)中实现高准确率和高速度的细粒度语言识别?
- RQ2与基线解码策略相比,全局约束解码器在减少语言切换过度预测方面效果如何?
- RQ3选择性分组dropout在提升对包含拼写错误和音译的非正式文本的鲁棒性方面有多大的改善作用?
- RQ4合成训练数据在提升未在真实标注数据中出现的语言对上的泛化能力方面贡献有多大?
- RQ5CMX的紧凑变体是否能在显著降低内存使用量的同时保持具有竞争力的性能?
主要发现
- CMX在三个混合语言数据集上的准确率相比之前最先进模型提升了19.5%的绝对值,尤其在更短、更具歧义性的输入上提升最大。
- 在单语文本上,CMX相比基准模型准确率提升1.1%(错误率降低24%),展现出强大的泛化能力。
- 该模型比现有词元级语言识别系统快800倍,解码速度达每秒20.6万个字符。
- 全局约束解码器将每句话平均预测语言数从1.5降低至1.27,有效缓解了过度预测问题,同时仅使运行时间增加7%。
- 在50%特征dropout下,模型在拼写错误词元上的准确率达到95.3%,而无dropout时仅为72.1%,显示出对非正式文本的强大鲁棒性。
- CMX的紧凑变体将参数量从3000万降至90万,同时保持了具有竞争力的性能,使其适用于资源受限环境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。