Skip to main content
QUICK REVIEW

[论文解读] CALCS 2021 Shared Task: Machine Translation for Code-Switched Data

Shuguang Chen, Gustavo Aguilar|arXiv (Cornell University)|Feb 19, 2022
Natural Language Processing Techniques被引用 10
一句话总结

本论文介绍了代码混用社交媒体数据的机器翻译(MT)共享任务,重点关注英-印地英语(Hinglish)、英-西班牙英语(Spanglish)以及英-现代标准阿语-阿拉伯语(MSAE-Arabic)双向翻译。论文提供了精心筛选的数据集、基于mBART和mT5的基线模型,并报告了12.67 BLEU的英-印地英语翻译最先进结果以及25.72 BLEU的MSAE-阿拉伯语到英语的最先进结果,凸显了在代码混用MT中语法、句法和语义方面的挑战。

ABSTRACT

To date, efforts in the code-switching literature have focused for the most part on language identification, POS, NER, and syntactic parsing. In this paper, we address machine translation for code-switched social media data. We create a community shared task. We provide two modalities for participation: supervised and unsupervised. For the supervised setting, participants are challenged to translate English into Hindi-English (Eng-Hinglish) in a single direction. For the unsupervised setting, we provide the following language pairs: English and Spanish-English (Eng-Spanglish), and English and Modern Standard Arabic-Egyptian Arabic (Eng-MSAEA) in both directions. We share insights and challenges in curating the "into" code-switching language evaluation data. Further, we provide baselines for all language pairs in the shared task. The leaderboard for the shared task comprises 12 individual system submissions corresponding to 5 different teams. The best performance achieved is 12.67% BLEU score for English to Hinglish and 25.72% BLEU score for MSAEA to English.

研究动机与目标

  • 为解决在多语言、非正式语境下代码混用社交媒体文本缺乏标准化机器翻译资源的问题。
  • 创建一个社区共享任务,以实现对代码混用语言对的机器翻译系统评估与推进。
  • 为代码混用MT精心筛选高质量、多样化的评估数据,重点关注不规则语法和句法歧义等语言挑战。
  • 利用mBART和mT5等多语言模型提供强大的基线,以建立性能基准。
  • 研究训练集与测试集之间的数据重叠以及归一化对评估指标(尤其是BLEU分数)的影响。

提出的方法

  • 任务包含有监督和无监督设置,参赛者需将单语英语翻译为如印地英语、西班牙英语和MSAE等代码混用语言。
  • 数据集通过扩展现有的CALCS数据集构建,聚焦于具有句内代码混用特征的社交媒体文本。
  • 基线系统基于mBART和mT5开发,使用筛选后的代码混用平行数据进行微调。
  • 评估采用BLEU分数,并引入归一化步骤以去除重叠标记(如用户名、URL、表情符号),以减少数据泄露。
  • 通过人工检查预测结果进行错误分析,以识别模型输出中的语法和语义错误。
  • 排行榜结果来自5支团队的12个独立系统提交,性能在多个语言对上进行衡量。

实验结果

研究问题

  • RQ1将单语社交媒体文本翻译为代码混用语言时,其关键语言与结构挑战是什么?
  • RQ2不规则语法、非标准句法和歧义词汇项在代码混用设置下如何影响机器翻译性能?
  • RQ3训练集与测试集之间的数据重叠在多大程度上会夸大代码混用MT评估中的BLEU分数?
  • RQ4与定制架构相比,mBART和mT5等多语言预训练模型在代码混用MT中的表现如何?
  • RQ5在最先进的代码混用MT系统中,主要错误类型是语法错误还是语义错误?

主要发现

  • 最佳系统在英-印地英语翻译任务中取得了12.67 BLEU的得分,优于基线系统。
  • 在MSAE-阿拉伯语到英语方向,最佳系统取得了25.72 BLEU,表明在阿拉伯语代码混用配对中表现更强。
  • Echo系统(将输入作为输出)在归一化前的BLEU得分为6.84,归一化后降至0.71,凸显了数据泄露问题。
  • 归一化显著降低了所有系统的BLEU分数,降幅在0.43至6.13分之间,表明数据重叠严重夸大了性能指标。
  • 人工错误分析显示,语法错误(如词序错误、代词误用)和语义错误(如部分或无关翻译)是主要的失败模式。
  • 尽管存在性能差距,基于Transformer的模型如mBART仍被广泛采用,并构成大多数高性能系统的核心。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。