Skip to main content
QUICK REVIEW

[论文解读] BARTpho: Pre-trained Sequence-to-Sequence Models for Vietnamese

Nguyen Luong Tran, Duong Minh Le|arXiv (Cornell University)|Sep 20, 2021
Topic Modeling被引用 6
一句话总结

本论文提出 BARTpho,这是首个针对越南语的大规模单语序列到序列预训练模型,提供音节级和词级两种变体。该模型基于 20GB 越南语语料库,采用 BART 的去噪自编码器框架进行训练,在越南语文本摘要和大小写/标点符号恢复任务中,无论是自动评估还是人工评估,均优于 mBART,为生成式越南语自然语言处理任务树立了新的最先进水平。

ABSTRACT

We present BARTpho with two versions, BARTpho-syllable and BARTpho-word, which are the first public large-scale monolingual sequence-to-sequence models pre-trained for Vietnamese. BARTpho uses the "large" architecture and the pre-training scheme of the sequence-to-sequence denoising autoencoder BART, thus it is especially suitable for generative NLP tasks. We conduct experiments to compare our BARTpho with its competitor mBART on a downstream task of Vietnamese text summarization and show that: in both automatic and human evaluations, BARTpho outperforms the strong baseline mBART and improves the state-of-the-art. We further evaluate and compare BARTpho and mBART on the Vietnamese capitalization and punctuation restoration tasks and also find that BARTpho is more effective than mBART on these two tasks. We publicly release BARTpho to facilitate future research and applications of generative Vietnamese NLP tasks. Our BARTpho models are available at https://github.com/VinAIResearch/BARTpho

研究动机与目标

  • 为解决越南语缺乏大规模单语序列到序列预训练模型的问题,此类模型对生成式自然语言处理任务至关重要。
  • 探讨在越南语这种具有独特音节-词结构的语言中,词分割对预训练效果的影响。
  • 提升在下游生成式任务(如文本摘要、大小写恢复和标点符号恢复)中的表现。
  • 公开发布高质量、可访问的预训练模型,作为未来越南语自然语言处理研究的强基准。
  • 证明针对特定语言的单语模型在越南语自然语言处理任务中优于多语言模型。

提出的方法

  • 使用 BART 的去噪自编码器框架,在 20GB 单语越南语语料库上,对 BARTpho 音节版和 BARTpho 词版两种变体进行预训练。
  • 采用大规模模型架构,使用与 BART 相同的预训练目标,通过掩码和重建序列来学习上下文表征。
  • 对 BARTpho 词版使用 VnCoreNLP 中的 RDRSegmenter 进行词分割,以处理词级输入。
  • 使用标准微调流程,并基于验证损失的早停策略,在下游任务上微调模型。
  • 使用标准指标评估性能:摘要任务使用 ROUGE,大小写和标点符号恢复任务使用 F1。
  • 利用 Hugging Face 的 transformers 和 fairseq 库,实现所发布模型的便捷集成与部署。

实验结果

研究问题

  • RQ1与多语言基线相比,单语序列到序列预训练是否能显著提升越南语生成式自然语言处理任务的性能?
  • RQ2在越南语序列到序列模型中,词级预训练是否优于音节级预训练?
  • RQ3BARTpho 在恢复自动语音识别转录本中的大小写和标点符号方面,与 mBART 相比效果如何?
  • RQ4BARTpho 是否能在越南语文本摘要任务中达到最先进水平?
  • RQ5语言结构(尤其是词分割)在多大程度上影响预训练序列到序列模型在越南语中的表现?

主要发现

  • BARTpho 在越南语文本摘要任务中优于 mBART,在自动评估(ROUGE)和人工评估中均达到新的最先进水平。
  • 与 mBART 相比,BARTpho 词版在大小写恢复任务中 F1 提高 1.1%,在标点符号恢复任务中 F1 提高 0.7%。
  • 在标点符号恢复任务中,BARTpho 词版获得最高的整体 F1 分数,优于 BARTpho 音节版和 mBART。
  • 在中文句号(Period)标点符号上,mBART 略高于 BARTpho(BARTpho 词版和音节版分别高出 0.14% 和 0.4%),但差距极小。
  • 在逗号(Comma)和问号(Question)标点符号上,BARTpho 音节版和 BARTpho 词版均显著优于 mBART,性能差距明显。
  • 在所有任务中,BARTpho 词版始终优于 BARTpho 音节版,表明词分割能提升越南语中预训练的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。