[论文解读] word2word: A Collection of Bilingual Lexicons for 3,564 Language Pairs
word2word 从 OpenSubtitles2018 中使用基于计数的模型,利用单语和跨语言词语共现模式,提取了涵盖 62 种语言的 3,564 对语言对的大规模、公开可用的双语词典。该方法实现了高覆盖率和具有竞争力的翻译质量,并通过开源 Python 工具包实现了对自定义平行语料库的便捷访问与扩展。
We present word2word, a publicly available dataset and an open-source Python package for cross-lingual word translations extracted from sentence-level parallel corpora. Our dataset provides top-k word translations in 3,564 (directed) language pairs across 62 languages in OpenSubtitles2018 (Lison et al., 2018). To obtain this dataset, we use a count-based bilingual lexicon extraction model based on the observation that not only source and target words but also source words themselves can be highly correlated. We illustrate that the resulting bilingual lexicons have high coverage and attain competitive translation quality for several language pairs. We wrap our dataset and model in an easy-to-use Python library, which supports downloading and retrieving top-k word translations in any of the supported language pairs as well as computing top-k word translations for custom parallel corpora.
研究动机与目标
- 为解决在多样化语言对,尤其是非印欧语系语言中,自由获取且高覆盖率的双语词典稀缺的问题。
- 克服现有资源(如 Wiktionary)的局限性,后者通常重定向至词元形式而非提供直接的词对翻译。
- 开发一种可扩展的开源解决方案,用于在大量语言对中提取每个源词的 top-k 词对翻译。
- 通过用户友好的 Python 接口,使该方法在低资源机器翻译和跨语言嵌入任务中具有实际应用价值。
- 将该方法扩展至 OpenSubtitles2018 之外的自定义平行语料库,以支持特定领域应用。
提出的方法
- 该方法使用基于计数的双语词典抽取模型,同时考虑源-目标词共现和源词自相关性。
- 基于 OpenSubtitles2018 中句子对齐的平行语料库中的共现计数,计算翻译概率。
- 通过基于互信息或点互信息(PMI)得分对目标词进行排序,计算每个源词的 top-k 翻译。
- 该方法应用于 OpenSubtitles2018 数据集中全部 3,564 个有向语言对,覆盖 62 种语言。
- 生成的词典被封装为 Python 库,支持程序化访问,并可扩展用于自定义语料处理。
- 该系统支持下载和查询任意支持语言对的翻译,以及在新平行语料库上进行训练。
实验结果
研究问题
- RQ1基于计数的模型,若同时利用单语和跨语言共现模式,是否能在大量语言对中生成高覆盖率的双语词典?
- RQ2与现有基准相比,所提取词典在翻译质量和覆盖率方面的表现如何?
- RQ3该方法在多大程度上可扩展至非印欧语系语言和低资源语言对?
- RQ4开源 Python 工具包是否能促进其在低资源机器翻译或跨语言迁移学习等下游 NLP 任务中的便捷集成?
- RQ5该模型如何处理词形复杂或功能罕见的词形,如韩语의 '먹다' 或法语的 'travaillé'?
主要发现
- word2word 数据集为 3,564 个有向语言对(涵盖 62 种语言)提供了 top-k 词对翻译,平均每个词典包含 127,023 个条目,每词平均有 8.8 个翻译。
- 对于英语-西班牙语等主要语言对,数据集包含 6140 万条句子,超过 10 万个唯一源词,且翻译覆盖率高。
- 模型实现了具有竞争力的翻译质量,体现在常见词如 'exceptional' 和 'whether' 的 top-5 列表中翻译结果排名靠前。
- 系统成功捕捉了词形变化和屈折形式,例如法语的 'exceptionnel' 和 'exceptionnelles' 对应 'exceptional'。
- Python 工具包支持高效检索与扩展,可处理 OpenSubtitles2018 之外的自定义平行语料库。
- 该数据集在低资源语言对中表现出强覆盖能力,包括韩语-英语和越南语-英语,每对均包含超过 80,000 个唯一翻译。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。