[论文解读] Chain-of-Dictionary Prompting Elicits Translation in Large Language Models
本文提出链式词典提示(Chain-of-Dictionary Prompting, CoD),一种零样本提示框架,通过将多语言词典作为外部知识串联起来,提升大型语言模型(LLMs)在多语言神经机器翻译中的表现。CoD 将翻译性能最高提升 13 倍 chrF++ 分数——例如,在英-塞尔维亚语(西里尔字母)任务中,从 3.08 提升至 42.63——并优于 few-shot 上下文学习,尤其在低资源语言上表现更优。
Large language models (LLMs) have shown surprisingly good performance in multilingual neural machine translation (MNMT) even when trained without parallel data. Yet, despite the fact that the amount of training data is gigantic, they still struggle with translating rare words, particularly for low-resource languages. Even worse, it is usually unrealistic to retrieve relevant demonstrations for in-context learning with low-resource languages on LLMs, which restricts the practical use of LLMs for translation -- how should we mitigate this problem? To this end, we present a novel method, CoD, which augments LLMs with prior knowledge with the chains of multilingual dictionaries for a subset of input words to elicit translation abilities for LLMs. Extensive experiments indicate that augmenting ChatGPT with CoD elicits large gains by up to 13x chrF++ points for MNMT (3.08 to 42.63 for English to Serbian written in Cyrillic script) on FLORES-200 full devtest set. We further demonstrate the importance of chaining the multilingual dictionaries, as well as the superiority of CoD to few-shot demonstration for low-resource languages.
研究动机与目标
- 解决大型语言模型(LLMs)在翻译罕见词汇时表现不佳的问题,尤其是在低资源语言中。
- 克服 few-shot 上下文学习的局限性,后者在低资源语言翻译中常无法检索到相关示范。
- 通过整合多语言词汇知识而不进行模型微调,提升零样本多语言神经机器翻译(MNMT)性能。
- 证明将多语言词典串联起来可提升推理能力与翻译准确性,优于孤立或未串联的词汇提示。
提出的方法
- 在标准翻译提示中加入多语言词典条目的链式结构,其中每个词通过多种语言的翻译相连(例如:'limit' → 'Grenze' → 'çäk')。
- 将提示设计为包含类似推理的词典映射链作为中间步骤,受 Chain-of-Thought(CoT)提示的启发。
- 使用高资源语言(如英语、德语)作为链中的中间连接,以提升跨语言迁移能力和鲁棒性。
- 将 CoD 提示应用于 FLORES-200 基准的零样本推理,使用 ChatGPT 等模型而无需任何微调。
- 设计链式结构以保持跨语言的语义等价性,确保翻译路径连贯且语义一致。
- 使用 FLORES-200 完整开发测试集的 chrF++ 评估性能,对比 CoD 与标准提示及 few-shot 上下文学习。

实验结果
研究问题
- RQ1将多语言词典作为外部知识串联起来,能否显著提升低资源语言对的零样本翻译性能?
- RQ2在低资源语言的翻译质量方面,CoD 与 few-shot 上下文学习相比表现如何?
- RQ3CoD 的性能提升是否依赖于词典链的结构,还是仅依赖于孤立的词汇映射?
- RQ4链中中间语言的选择是否会影响翻译性能,特别是在使用非拉丁字母的语言中?
- RQ5CoD 能否在多种语言对中实现泛化,包括使用不同书写系统的语言对?
主要发现
- 在英-塞尔维亚语(西里尔字母)翻译任务中,CoD 在 FLORES-200 完整开发测试集上实现最高 13 倍 chrF++ 分数的提升,从 3.08 提升至 42.63。
- 串联多语言词典至关重要——分离词映射或使用未串联的词典会导致性能显著下降。
- CoD 优于 few-shot 上下文学习,尤其在低资源语言上,因为相关示范往往不可用或无关。
- 使用英语或德语等高资源语言作为链中的中间连接可提升性能,而使用与目标语言相似的语言则可能降低结果。
- 该方法在 FLORES-200 的 200 个语言对中均表现稳健,对高资源语言影响极小,表明其具有广泛适用性。
- CoD 能够在标准提示完全失效的语言中实现翻译,例如在低资源西里尔字母语言中,展示了其激发潜在翻译能力的能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。