Skip to main content
QUICK REVIEW

[论文解读] Prompting PaLM for Translation: Assessing Strategies and Performance

David Vilar, Markus Freitag|arXiv (Cornell University)|Nov 16, 2022
Natural Language Processing Techniques被引用 15
一句话总结

本文评估了PaLM在机器翻译中少样本提示策略的表现,发现示例质量比选择方法或输入相似性更为关键。利用近期的WMT测试集、BLEURT及人工评估,结果表明PaLM的翻译性能虽强,但仍落后于监督式SOTA系统,且固定高质量提示优于随机选择。

ABSTRACT

Large language models (LLMs) that have been trained on multilingual but not parallel text exhibit a remarkable ability to translate between languages. We probe this ability in an in-depth study of the pathways language model (PaLM), which has demonstrated the strongest machine translation (MT) performance among similarly-trained LLMs to date. We investigate various strategies for choosing translation examples for few-shot prompting, concluding that example quality is the most important factor. Using optimized prompts, we revisit previous assessments of PaLM's MT capabilities with more recent test sets, modern MT metrics, and human evaluation, and find that its performance, while impressive, still lags that of state-of-the-art supervised systems. We conclude by providing an analysis of PaLM's MT output which reveals some interesting properties and prospects for future work.

研究动机与目标

  • 系统评估PaLM在机器翻译中少样本提示策略的表现。
  • 评估示例选择策略与示例质量对翻译质量的影响孰大。
  • 利用现代测试集、BLEURT及人工评估重新评估PaLM的MT性能,以确保与SOTA系统的公平比较。
  • 分析训练数据重叠对自动指标得分及系统比较的影响。
  • 探索固定高质量提示是否能优于动态随机选择的提示。

提出的方法

  • 使用固定提示模板并结合不同的示例选择策略:基于句向量的随机选择与k近邻(kNN)选择。
  • 采用近期的WMT测试集(德语/中文使用WMT21,法语使用WMT14)进行评估,以避免数据泄露。
  • 以BLEURT作为主要自动指标,替代BLEU,因其与人类判断的对齐性更优。
  • 通过专家参与的人工评估,辅以详细的错误分类,分析指标之外的翻译质量。
  • 在五轮实验中对比固定提示(基于保留数据上的最大似然概率选择)与随机提示选择的表现。
  • 分析测试集与PaLM训练数据重叠对BLEU与BLEURT得分的影响,区分原始、清理后及无重叠的测试场景。

实验结果

研究问题

  • RQ1在提示PaLM进行翻译时,示例质量是否比选择策略或输入相似性更为重要?
  • RQ2当使用现代测试集与指标评估时,PaLM的少样本翻译性能与最先进的监督式系统相比如何?
  • RQ3测试集参考文本与PaLM训练数据的重叠在多大程度上导致自动指标得分偏差?
  • RQ4单个固定高质量提示是否能优于动态随机选择的提示?
  • RQ5PaLM翻译中的典型错误模式是什么?与监督式系统相比有何异同?

主要发现

  • 在PaLM翻译的少样本提示中,示例质量是最关键的影响因素,其重要性超过选择策略或输入相似性。
  • 尽管表现令人印象深刻,但当使用近期WMT测试集与BLEURT及人工评估时,PaLM的翻译性能仍落后于最先进的监督式机器翻译系统。
  • 随机提示选择导致性能波动较大:在1,000个句子中,有516个句子在两次运行间的BLEURT差异超过1分,凸显了对示例选择的敏感性。
  • 通过保留数据上的最大似然概率选择的固定提示,在所有语言对上均优于或至少匹配五次随机提示选择的平均表现,表明其为更安全、更可靠的策略。
  • 测试集与PaLM训练数据的重叠导致原始与清理后测试集之间出现2.6个BLEU点的差距,但该效应小于预期,且无法完全解释系统间性能差异。
  • BLEURT对重叠的敏感性低于BLEU,重叠引起的差异约为0.3个BLEURT点,表明其在比较评估中可能更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。