[论文解读] Improved Sentiment Detection via Label Transfer from Monolingual to Synthetic Code-Switched Text
本文提出 CSGen 方法,通过基于短语结构解析的片段替换与翻译对齐,将单语句子的情感标签迁移至合成的代码混用版本,从而实现对英语-孟加拉语代码混用文本的情感检测准确率最高提升 7.20%,并通过合成数据增强缓解类别不平衡,在仇恨言论检测中实现 6% 的 F1 值提升。
Multilingual writers and speakers often alternate between two languages in a single discourse, a practice called "code-switching".Existing sentiment detection methods are usually trained on sentiment-labeled monolingual text.Manually labeled code-switched text, especially involving minority languages, is extremely rare.Consequently, the best monolingual methods perform relatively poorly on code-switched text.We present an effective technique for synthesizing labeled code-switched text from labeled monolingual text, which is more readily available.The idea is to replace carefully selected subtrees of constituency parses of sentences in the resource-rich language with suitable token spans selected from automatic translations to the resource-poor language.By augmenting scarce human-labeled code-switched text with plentiful synthetic code-switched text, we achieve significant improvements in sentiment labeling accuracy (1.5%, 5.11%, 7.20%) for three different language pairs (English-Hindi, English-Spanish and English-Bengali).We also get significant gains for hate speech detection: 4% improvement using only synthetic text and 6% if augmented with real text.
研究动机与目标
- 为解决低资源语言对中人工标注的代码混用文本稀缺问题。
- 提升当前单语模型难以应对的社交媒体代码混用文本中的情感检测性能。
- 开发一种数据驱动、无需语法规则的高质量、情感准确的合成代码混用句子生成方法。
- 证明仅使用合成数据或与真实数据结合,可超越仅在稀缺真实标注代码混用数据上训练的模型。
- 通过生成平衡的合成训练数据,缓解仇恨言论检测中的标签不平衡问题。
提出的方法
- CSGen 使用短语结构解析器识别单语源句中的句法子树,以确定潜在的代码混用位置。
- 利用神经机器翻译模型将源句翻译为目标语言,生成平行句对。
- 基于情感显著性和句法边界选择源句中的片段进行替换,优先选择承载观点的成分。
- 通过词嵌入相似度和基于注意力的对齐方法,在目标语言翻译中搜索语义和句法最匹配的片段。
- 将选定的目标语言片段替换源句中的对应片段,更新解析树,生成带有原始情感标签的合成代码混用句子。
- 该方法避免使用语言语法规则或代码混用规则,转而依赖自动对齐与相似性度量,以确保流畅性与连贯性。
实验结果
研究问题
- RQ1能否通过单语情感标注数据生成的合成代码混用文本,提升低资源语言对的情感检测性能?
- RQ2合成数据在多大程度上可单独匹配或超越仅在有限真实代码混用数据上训练的模型性能?
- RQ3合成数据增强对仇恨言论检测的影响如何,特别是在存在类别不平衡的情况下?
- RQ4在合成数据生成中导致模型性能下降的主要失败模式是什么?
- RQ5当训练数据与测试数据之间存在领域差异时,基于合成代码混用文本训练的模型泛化能力如何受到影响?
主要发现
- 在英语-孟加拉语代码混用文本上,与仅使用真实数据训练的模型相比,合成数据增强使情感检测准确率提升了 7.20%。
- 在英语-西班牙语任务中,结合合成与真实数据后,准确率提升了 5.11%。
- 在英语-印地语情感检测中,推特数据集提升 1.5%,Facebook 数据集提升 0.97%,表明存在中等程度的领域依赖性。
- 仅使用合成数据时,在 EN_HI 推特数据上准确率比真实数据低 5.04%,但在标签平衡后,仇恨言论检测的 F1 值仍比真实数据高出 4%。
- 在仇恨言论检测中,结合合成与真实数据使 F1 值相比仅使用真实数据提升了 6%,主要归因于合成数据集的类别不平衡问题得到缓解。
- 错误分析揭示了两种主要失败模式:混合片段中情感极性冲突,以及情感内容微弱或模糊,尤其在涉及多个主体时更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。