[论文解读] Borrowing or Codeswitching? Annotating for Finer-Grained Distinctions in Language Mixing
本文提出了一种新的西班牙语-英语语码混用及词汇借用的Twitter语料库,采用细粒度的词粒度标注,明确区分两种现象,并提供明确的标注指南。使用基于Transformer的模型(如mBERT和BETO),F1得分超过96.6,表明细粒度标注有助于更准确地建模社交媒体文本中的语言混用现象。
We present a new corpus of Twitter data annotated for codeswitching and borrowing between Spanish and English. The corpus contains 9,500 tweets annotated at the token level with codeswitches, borrowings, and named entities. This corpus differs from prior corpora of codeswitching in that we attempt to clearly define and annotate the boundary between codeswitching and borrowing and do not treat common "internet-speak" ('lol', etc.) as codeswitching when used in an otherwise monolingual context. The result is a corpus that enables the study and modeling of Spanish-English borrowing and codeswitching on Twitter in one dataset. We present baseline scores for modeling the labels of this corpus using Transformer-based language models. The annotation itself is released with a CC BY 4.0 license, while the text it applies to is distributed in compliance with the Twitter terms of service.
研究动机与目标
- 为解决现有语码混用语料库中语码混用与借用之间界限模糊的问题。
- 创建一个明确标注词汇借用与真实语码混用的数据集,避免将网络俚语误判为语码混用。
- 提供一个用于训练和评估多语言社交媒体文本中更细粒度语言混用现象的资源。
- 制定标注指南,基于语言学标准明确界定语码混用与借用的边界。
- 通过将形态句法层面的语码混用与音系及形态上已适应的借用区分开来,实现对语言混用现象更精确的建模。
提出的方法
- 对9,500条Twitter推文进行词粒度标注,标注内容包括语码混用、借用、命名实体、标点符号及其他非语言标记。
- 将语码混用定义为符合两种语言语法规范的句内混用,将借用定义为已融入目标语言音系与形态的词汇项。
- 将常见网络俚语(如'lol')排除在语码混用标注之外,将其视为已确立的借用词或社交媒体用语。
- 采用标准化的80/10/10训练-开发-测试划分方案,用于基线模型在标注数据集上的评估。
- 评估了四种基于Transformer的模型:mBERT、BETO、RoBERTa-BNE和RoBERTa-Twitter,使用默认超参数及Hugging Face Transformers库。
- 采用微平均的精确率、召回率和F1分数评估模型在词粒度分类任务中的表现。
实验结果
研究问题
- RQ1如何通过明确的标注指南在多语言社交媒体文本中区分语码混用与借用?
- RQ2现有语码混用语料库在多大程度上将借用与真实语码混用混淆,特别是在网络俚语情境下?
- RQ3不同预训练的Transformer模型在需要区分语码混用与借用的细粒度任务中表现如何?
- RQ4模型性能是否与训练数据多样性相关,尤其是对语码混用中方言和语用变体的捕捉能力?
- RQ5在该任务上,是否由单语社交媒体数据训练的模型(如RoBERTa-Twitter)能优于多语言或单语特定语言的模型?
主要发现
- mBERT和BETO模型分别取得了96.65和96.64的最高F1得分,表明其在细粒度语码混用与借用分类任务中表现优异。
- 尽管RoBERTa-BNE参数量更大(1350亿token),但其性能低于BETO和mBERT,表明该任务中数据多样性可能比模型规模更为关键。
- 基线F1得分约96.6,略低于LinCE基准报告的数值(mBERT的F1为98.53),可能是因为区分借用与语码混用增加了任务复杂性。
- 将'lol'等网络俚语从语码混用标签中排除,视作已确立的借用词,使数据集更具语言学准确性,更真实反映双语现象。
- 标注方案成功区分了借用与语码混用,模型表现和语言学理论的一致性表明数据中无系统性误标现象。
- 该语料库以CC BY 4.0许可发布,支持NLP研究中的再利用,且原始文本符合Twitter的服务条款。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。