[论文解读] VieSum: How Robust Are Transformer-based Models on Vietnamese Summarization?
本文使用两个数据集(Wikilingua 和 Vietnews)评估了基于 Transformer 的编码器-解码器模型在越南语抽象文本摘要任务中的鲁棒性。研究发现,多语言模型(如 mT5 和 mBART)在基于 Wikipedia 的数据上显著优于单语模型(如 PhoBERT 和 ViBERT),凸显了预训练数据质量的重要性,并表明通过更强的单语模型仍有提升空间。
Text summarization is a challenging task within natural language processing that involves text generation from lengthy input sequences. While this task has been widely studied in English, there is very limited research on summarization for Vietnamese text. In this paper, we investigate the robustness of transformer-based encoder-decoder architectures for Vietnamese abstractive summarization. Leveraging transfer learning and self-supervised learning, we validate the performance of the methods on two Vietnamese datasets.
研究动机与目标
- 调查预训练的基于 Transformer 的模型在越南语抽象摘要任务中的鲁棒性。
- 比较单语越南语模型(如 PhoBERT、ViBERT)与多语言模型(如 mT5、mBART)在越南语摘要任务中的性能表现。
- 分析预训练数据分布与规模对越南语等低资源自然语言处理设置中模型性能的影响。
- 评估迁移学习与自监督预训练是否能提升越南语中的抽象摘要性能。
- 通过在两个公开可用的越南语摘要数据集上微调模型,为未来研究提供基准。
提出的方法
- 基于 Vaswani 等人(2017)提出的架构,微调基于编码器-解码器的 Transformer 模型,使用预训练的编码器与解码器。
- 采用 BERT2BERT 架构(Rothe 等人,2019),将预训练模型适配为序列到序列的摘要生成任务。
- 使用两个数据集:Wikilingua(基于 Wikipedia 的数据)和 Vietnews(越南媒体新闻文章),两者均包含人工标注的摘要。
- 使用 ROUGE-1、ROUGE-2 和 ROUGE-L 指标评估模型性能,衡量生成摘要与参考摘要之间的 n-gram 重叠与最长公共子序列重叠。
- 在相同的微调设置下,训练并比较单语模型(PhoBERT、ViBERT)与多语模型(mBERT、mBART、mT5)。
- 在基础模型的初始预训练过程中,利用自监督预训练目标(如掩码语言建模,MLM)进行训练。
实验结果
研究问题
- RQ1单语越南语预训练模型与多语言模型在越南语文本的抽象摘要任务中表现如何?
- RQ2预训练数据的质量与领域是否显著影响越南语受限领域摘要任务的模型性能?
- RQ3与随机初始化相比,引入预训练解码器在多大程度上能提升摘要生成性能?
- RQ4尽管未在越南语数据上进行特定微调,mT5 和 mBART 等多语言模型是否能有效泛化到越南语摘要任务?
- RQ5在越南新闻与维基百科风格文档中,PhoBERT 与 ViBERT 作为单语模型相较于多语言模型的相对性能如何?
主要发现
- 在 Wikilingua 数据集上,mT5 取得了最高的 ROUGE 分数,ROUGE-1 为 55.27,ROUGE-2 为 27.63,ROUGE-L 为 38.30,优于所有其他模型。
- 在 Wikilingua 数据集上,mBART 表现第二佳,ROUGE-1 为 55.21,ROUGE-2 为 25.69,ROUGE-L 为 37.33。
- 在 Vietnews 数据集上,PhoBERT2PhoBERT 模型表现最佳(ROUGE-1: 60.37,ROUGE-2: 29.12,ROUGE-L: 39.44),优于多语言模型。
- 单语模型 PhoBERT2PhoBERT 显著优于其随机权重基线模型(RND2RND),在 Wikilingua 上所有 ROUGE 指标均提升了 2–4%。
- 多语言模型如 mT5 和 mBART 在 Vietnews 数据集上仅比 RND2RND 基线模型有微弱提升,表明其在新闻领域文本上的迁移能力有限。
- 在大规模、多样化语料(如 mT5 和 mBART 使用的 Common Crawl)上进行预训练,可提升在维基百科风格、受限领域数据上的性能,但对特定领域新闻文本的性能提升有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。