[论文解读] Data Augmentation for Neural Machine Translation using Generative Language Model
本文提出了一种基于提示的神经机器翻译数据增强方法,利用 GPT-3.5-turbo 生成合成平行句,且无需额外训练成本。通过对比三种提示策略——改写、多目标翻译和叙事生成,结果表明叙事生成产生的数据最具多样性,相比基线模型 BLEU 分数提升 0.68,在数据量加倍时达到最佳性能 29.17 BLEU。
Despite the rapid growth in model architecture, the scarcity of large parallel corpora remains the main bottleneck in Neural Machine Translation. Data augmentation is a technique that enhances the performance of data-hungry models by generating synthetic data instead of collecting new ones. We explore prompt-based data augmentation approaches that leverage large-scale language models such as ChatGPT. To create a synthetic parallel corpus, we compare 3 methods using different prompts. We employ two assessment metrics to measure the diversity of the generated synthetic data. This approach requires no further model training cost, which is mandatory in other augmentation methods like back-translation. The proposed method improves the unaugmented baseline by 0.68 BLEU score.
研究动机与目标
- 为解决神经机器翻译(NMT)中大规模平行语料稀缺的问题,特别是低资源语言或领域中的问题。
- 探索使用类似 ChatGPT 的大型生成语言模型进行基于提示的数据增强,以生成无需微调的合成平行数据。
- 评估不同提示设计(改写、多目标翻译和叙事生成)对数据多样性和模型性能的影响。
- 通过原始句与合成句之间的余弦相似度和 BLEU 分数,衡量生成合成数据的多样性。
- 证明数据多样性对于提升 NMT 性能至关重要,尤其是在领域分布偏移或数据稀缺的情况下。
提出的方法
- 采用三种基于提示的方法生成合成平行数据:对源句和目标句进行改写、为每个源句生成多个翻译(多目标),以及在源语言中生成三句话的叙事并随后翻译(叙事生成)。
- 通过 OpenAI API 使用特定模板调用 GPT-3.5-turbo 模型,提示设计旨在保持语义的同时增加变化。
- 使用 LASER 编码器计算句向量,通过原始句与合成句对之间的余弦相似度作为多样性度量指标。
- 通过原始句与合成句目标句之间的 BLEU 分数衡量词汇相似度,以评估词汇差异程度。
- 在原始数据和增强数据上微调 mBART-50 模型,并使用 SacreBLEU 在保留的测试集上进行评估。
- 实验将增强比例从 0.5 倍到 3.0 倍原始训练数据规模进行变化,最佳模型检查点基于验证 BLEU 分数选取。
实验结果
研究问题
- RQ1使用生成语言模型进行基于提示的数据增强是否能在不增加额外训练成本的情况下提升 NMT 性能?
- RQ2不同提示策略(改写、多目标翻译和叙事生成)如何影响合成平行数据的多样性和质量?
- RQ3通过嵌入相似度和 BLEU 分数衡量的数据多样性,在多大程度上与 NMT 模型性能的提升相关?
- RQ4基于叙事的增强方法是否能缓解分布外幻觉问题,并在低资源设置下提升模型鲁棒性?
- RQ5哪种提示设计能实现相对于未增强基线的最高 BLEU 分数提升?
主要发现
- 当合成数据增强至原始数据的 2.0 倍时,叙事方法达到最高的 BLEU 分数 29.17,优于 28.49 的基线分数。
- 改写和多目标方法在增强比例增加时 BLEU 分数持续下降,表明数据多样性有限且可能存在过拟合。
- 叙事方法在原始句与合成句之间产生最低的余弦相似度(0.596)和 BLEU 分数(2.908),证实其具有更高的数据多样性。
- 改写方法的余弦相似度最高(0.900),BLEU 分数也最高(23.409),表明与原始句子变化极小。
- 多目标方法表现出中等多样性,余弦相似度为 0.825,BLEU 分数为 15.543,但其在模型性能上仍逊于叙事方法。
- 本研究证实,生成多样化合成数据对于缩小训练数据分布与真实世界语言分布之间的差距至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。