[论文解读] GupShup: An Annotated Corpus for Abstractive Summarization of Open-Domain Code-Switched Conversations
本文提出了 GupShup,这是首个针对开放领域印地语-英语混用对话的抽象摘要任务的大规模标注语料库,包含超过 6,800 个对话,配有由人工标注的英文和印地语-英语摘要。多语言 mBART 和多视角序列到序列模型在英文摘要生成任务中表现最佳,但在印地语-英语摘要生成任务中性能显著下降,凸显了当前模型在混用语言文本理解方面存在的关键差距。
Code-switching is the communication phenomenon where speakers switch between different languages during a conversation. With the widespread adoption of conversational agents and chat platforms, code-switching has become an integral part of written conversations in many multi-lingual communities worldwide. This makes it essential to develop techniques for summarizing and understanding these conversations. Towards this objective, we introduce abstractive summarization of Hindi-English code-switched conversations and develop the first code-switched conversation summarization dataset - GupShup, which contains over 6,831 conversations in Hindi-English and their corresponding human-annotated summaries in English and Hindi-English. We present a detailed account of the entire data collection and annotation processes. We analyze the dataset using various code-switching statistics. We train state-of-the-art abstractive summarization models and report their performances using both automated metrics and human evaluation. Our results show that multi-lingual mBART and multi-view seq2seq models obtain the best performances on the new dataset
研究动机与目标
- 为解决现实聊天应用中混用语言对话的抽象摘要任务缺乏高质量多语言数据集的问题。
- 构建一个大规模、人工标注的印地语-英语混用对话数据集,包含对应的英文和印地语-英语摘要。
- 在混用语言文本上评估最先进抽象摘要模型的性能,并结合自动评估与人工评估指标进行分析。
- 探究自然语言处理中混用语言带来的挑战,特别是摘要任务中的挑战,并识别模型在处理混合语言输入时的局限性。
- 确立 GupShup 作为未来多语言、混用语言对话理解与摘要研究的基准。
提出的方法
- 通过将单语 SAMSum 语料库中的一小部分对话和摘要手动翻译成印地语-英语,构建数据集,以保留自然的混用语言模式。
- 数据收集过程由多名标注员参与,以确保语言多样性与一致性,并制定了严格的摘要与混用语言标注指南。
- 最终语料库包含 6,831 个对话(共 76,330 条话语),配有并行的英文和印地语-英语摘要,构成一个并行的单语与混用语言语料库。
- 在英文摘要上微调最先进抽象摘要模型(包括 mBART、PEGASUS、BART 和多视角序列到序列模型),并使用自动指标(ROUGE、BLEURT)和人工评估进行评估。
- 在 100 个随机抽取的摘要上进行了人工评估,评估标准包括连贯性、一致性、流畅性和相关性,评分采用 1–5 分制。
- 计算自动指标与人工判断之间的斯皮尔曼等级相关系数,以验证 ROUGE 和 BLEURT 等指标在混用语言摘要任务中的可靠性。
实验结果
研究问题
- RQ1现有抽象摘要模型在生成印地语-英语混用对话摘要方面的有效性如何?
- RQ2在生成印地语-英语摘要时,单语摘要与混用语言摘要之间存在多大的性能差距?
- RQ3在混用语言摘要背景下,哪些自动指标与人工判断的相关性最强?
- RQ4多任务学习或多视角建模能否提升混用语言数据上的摘要性能?
- RQ5多语言模型(如 mBART)相较于单语言模型,在处理混用语言输入时表现如何?
主要发现
- 多语言 mBART 和多视角序列到序列模型在英文摘要生成任务中表现最佳,在自动评估与人工评估中均优于其他模型。
- 在生成印地语-英语摘要时性能显著下降,所有模型均表现出明显衰退,表明其在混用语言文本上的泛化能力较差。
- 尽管 mBART 在 25 种语言上进行预训练,其在印地语-英语摘要上的表现仍劣于英文摘要,与多语言鲁棒性的预期相悖。
- BLEURT 和基于召回率的指标(如 ROUGE)与人工判断的相关性最强,表明其在评估混用语言摘要任务中具有可靠性。
- 人工评估显示,多视角和 PEGASUS 模型在连贯性和结构质量方面得分最高,而 mBART 和多视角模型在事实一致性与相关性方面表现更优。
- 该数据集提供了 74,798 对句子的并行单语与混用语言语料库,为未来在混用语言 NLP 中的翻译与数据增强研究提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。