[论文解读] A Benchmark for Learning to Translate a New Language from One Grammar Book
本文提出了MTOB,一个用于评估英语与卡拉芒语(Kalamang)之间零样本机器翻译的基准,卡拉芒语是一种母语者少于200人的低资源语言,仅使用一本语法书及相关语言学资料。尽管大语言模型表现强劲,但其在卡拉芒语到英语和英语到卡拉芒语翻译任务上的chrF得分仅为44.7和45.8,低于人类表现(51.6和57.0 chrF),凸显了仅从极少量自然语言解释中学习真正未见过的语言,而非大规模网络数据,所面临的挑战。
Large language models (LLMs) can perform impressive feats with in-context learning or lightweight finetuning. It is natural to wonder how well these models adapt to genuinely new tasks, but how does one find tasks that are unseen in internet-scale training sets? We turn to a field that is explicitly motivated and bottlenecked by a scarcity of web data: low-resource languages. In this paper, we introduce MTOB (Machine Translation from One Book), a benchmark for learning to translate between English and Kalamang -- a language with less than 200 speakers and therefore virtually no presence on the web -- using several hundred pages of field linguistics reference materials. This task framing is novel in that it asks a model to learn a language from a single human-readable book of grammar explanations, rather than a large mined corpus of in-domain data, more akin to L2 learning than L1 acquisition. We demonstrate that baselines using current LLMs are promising but fall short of human performance, achieving 44.7 chrF on Kalamang to English translation and 45.8 chrF on English to Kalamang translation, compared to 51.6 and 57.0 chrF by a human who learned Kalamang from the same reference materials. We hope that MTOB will help measure LLM capabilities along a new dimension, and that the methods developed to solve it could help expand access to language technology for underserved communities by leveraging qualitatively different kinds of data than traditional machine translation.
研究动机与目标
- 评估大语言模型是否能仅通过一本可读的人类语法书,而非大规模网络爬取数据,学习翻译一种真正未见过的语言。
- 建立一个基准,模拟通过精选自然语言解释而非大规模平行语料库进行第二语言学习的过程。
- 衡量大语言模型与人类在使用相同有限语言资源时的表现差距,为模型能力提供现实的下限。
- 通过展示田野语言学记录等质性不同的数据可使边缘语言实现翻译,推动语言技术的公平性。
提出的方法
- 该基准MTOB仅使用一本可自由使用许可的语法书、一份双语词表,以及一小部分卡拉芒语-英语双语语料(英语少于25万词符,卡拉芒语少于2.5万词符)作为唯一的训练与评估数据。
- 模型通过提示方式接收语法书和参考材料,采用零样本或上下文学习设置,模拟人类通过教科书学习的过程。
- 评估采用chrF++作为主要指标,衡量模型输出与参考翻译之间的n元语法精确率与召回率。
- 人类表现通过一位研究人员(第一作者)仅从相同材料中学习卡拉芒语并翻译测试集来确立,提供人类水平的表现基线。
- 测试了多种检索增强提示策略,包括检索相关词汇、句子或语法解释,以提升翻译的忠实度。
- 任务被设定为上下文学习或检索增强生成,避免微调,以强调从极少量自然语言输入中学习的能力。
实验结果
研究问题
- RQ1大语言模型能否在未接触大规模网络数据的前提下,仅通过一本语法书学习翻译卡拉芒语这类低资源语言?
- RQ2当大语言模型与人类均从同一有限语言资源学习时,其在该任务上的表现与人类表现相比如何?
- RQ3在模型被限制于单一语言知识来源的前提下,检索增强提示策略在多大程度上能提升翻译质量?
- RQ4与从大规模平行语料库学习相比,仅通过语法书中的自然语言解释(类似于第二语言习得)学习是否会产生不同的性能表现模式?
- RQ5该基准能否作为评估大语言模型在真正未见过的、低资源语言任务上泛化能力的有意义代理?
主要发现
- 大语言模型在使用语法书进行上下文学习时,卡拉芒语到英语翻译的chrF得分为44.7,英语到卡拉芒语翻译为45.8,表明性能较强但尚未完全掌握。
- 人类表现(由仅从相同材料学习的科研人员测得)分别为51.6和57.0 chrF,显示出模型与人类之间存在显著差距。
- 表现最佳的模型设置(Claude 2搭配检索上下文)仍出现错误,例如错误地将'suka'(本应使用其名词化形式)误用为动词'想要',表明形态学理解仍存在顽固性误解。
- 检索语法解释可提升翻译的忠实度,但若过度依赖句法规则而缺乏语义基础,也可能引入生硬或错误表达。
- 该基准揭示,当前大语言模型在真正未见过的语言中,即使有详细自然语言描述,仍难以应对复杂的形态句法结构。
- 结果表明,当前大语言模型尚无法仅通过一本书完全掌握一种语言,反映出在低资源、高结构语言中,上下文学习仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。