[论文解读] CrossSum: Beyond English-Centric Cross-Lingual Summarization for 1,500+ Language Pairs
CrossSum 引入了目前公开可用的最大规模跨语言摘要数据集,包含超过 1500 种语言对的 168 万条样本,通过多语言摘要的跨语言检索构建而成。该研究提出了一种多阶段采样策略以及 LaSE——一种基于嵌入的评估指标,使端到端 XLS 模型能够超越英语实现泛化,在各类语言对上的 ROUGE 和 LaSE 分数均优于基线模型。
We present CrossSum, a large-scale cross-lingual summarization dataset comprising 1.68 million article-summary samples in 1,500+ language pairs. We create CrossSum by aligning parallel articles written in different languages via cross-lingual retrieval from a multilingual abstractive summarization dataset and perform a controlled human evaluation to validate its quality. We propose a multistage data sampling algorithm to effectively train a cross-lingual summarization model capable of summarizing an article in any target language. We also introduce LaSE, an embedding-based metric for automatically evaluating model-generated summaries. LaSE is strongly correlated with ROUGE and, unlike ROUGE, can be reliably measured even in the absence of references in the target language. Performance on ROUGE and LaSE indicate that our proposed model consistently outperforms baseline models. To the best of our knowledge, CrossSum is the largest cross-lingual summarization dataset and the first ever that is not centered around English. We are releasing the dataset, training and evaluation scripts, and models to spur future research on cross-lingual summarization. The resources can be found at https://github.com/csebuetnlp/CrossSum
研究动机与目标
- 为解决缺乏大规模、非以英语为中心的跨语言摘要数据集的问题,此类数据集限制了低资源语言的研究。
- 克服流水线方法和以英语为中间语言的模型在跨语言摘要中的局限性。
- 利用多语言抽象摘要数据进行跨语言检索,开发一种可扩展、高质量的数据整理方法。
- 设计一种多阶段采样策略,使端到端模型能够有效训练任意源语言-目标语言对。
- 提出 LaSE,一种无参考文本的评估指标,与 ROUGE 强相关,并支持低资源语言的评估。
提出的方法
- 使用跨语言检索将多语言 XL-Sum 数据集中的平行文章对齐,形成 1500 多种语言对的文本-摘要配对。
- 通过‘诱导对’和‘隐式泄漏’控制手段对数据集进行整理,以在保持对齐质量的同时最大化覆盖范围。
- 提出多阶段语言采样(MLS)算法,通过固定目标语言构建小批量数据,提升训练稳定性和泛化能力。
- 使用 mT5-base 在 CrossSum 上进行微调,批量大小为 256,采样因子 α=0.25,并丢弃样本数少于 30 的配对。
- 推理阶段,解码器使用语言特定的 BOS 标记进行初始化,并采用带长度惩罚的束搜索进行可控生成。
- 引入 LaSE 作为基于嵌入的指标,可在目标语言无参考摘要的情况下,计算生成摘要与参考摘要之间的语义相似度。
实验结果
研究问题
- RQ1能否通过多语言抽象摘要的自动对齐,有效构建大规模、非以英语为中心的跨语言摘要数据集?
- RQ2与标准采样或一对多/多对一训练方案相比,多阶段采样策略是否能显著提升模型在多样化源-目标语言对上的泛化能力?
- RQ3LaSE 是否可作为可靠的无参考文本评估指标,与 ROUGE 强相关,并支持低资源语言的评估?
- RQ4在高资源和低资源语言对上,基于 CrossSum 训练的端到端跨语言模型性能与流水线基线模型及一对多/多对一模型相比如何?
- RQ5所提出的训练策略在多大程度上缓解了数据不平衡问题,并提升了低资源语言对的表现?
主要发现
- CrossSum 是目前公开可用的最大规模抽象式跨语言摘要数据集,包含 168 万条样本,覆盖 1500 多种语言对,且是首个不以英语为中心的数据集。
- 所提出的多阶段采样策略(m2m-tgt)在 42% 的语言对上显著优于标准采样(m2m-large),尤其在低资源语言对上表现更优。
- m2m-tgt 模型在各类语言对上均优于所有基线模型,包括一对多和先摘要再翻译的模型。
- LaSE 与 ROUGE-Lin (2004) 显示出强相关性,相关系数较高,证明其作为可靠无参考评估指标的有效性。
- 消融实验表明,固定小批量中的目标语言(m2m-tgt)优于固定源语言(m2m-src),后者表现显著更差。
- 人工评估在九种语言(从高资源到低资源)中均确认了高对齐准确率,验证了数据集的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。