Skip to main content
QUICK REVIEW

[论文解读] Huge Automatically Extracted Training Sets for Multilingual Word Sense Disambiguation

Tommaso Pasini, Francesco Elia|arXiv (Cornell University)|May 12, 2018
Natural Language Processing Techniques参考文献 1被引用 6
一句话总结

本文提出了六个大规模、多语言、自动标注的词义消歧(WSD)数据集,涵盖英语及五种主要欧洲和亚洲语言,基于 BabelNet 和 Wikipedia 构建。通过利用一种半自动系统 Train-o-Matic,作者生成了数百万条带有词义标注的句子,使监督式 WSD 达到最先进或具有竞争力的性能,尤其在低资源语言中表现突出。

ABSTRACT

We release to the community six large-scale sense-annotated datasets in multiple language to pave the way for supervised multilingual Word Sense Disambiguation. Our datasets cover all the nouns in the English WordNet and their translations in other languages for a total of millions of sense-tagged sentences. Experiments prove that these corpora can be effectively used as training sets for supervised WSD systems, surpassing the state of the art for low-resourced languages and providing competitive results for English, where manually annotated training sets are accessible. The data is available at trainomatic.org.

研究动机与目标

  • 解决监督式词义消歧(WSD)任务中大规模、多语言、词义标注训练数据稀缺的问题。
  • 在手动标注数据有限或不可用的低资源语言中,实现高性能的监督式 WSD。
  • 开发一种可扩展的自动方法,用于创建高覆盖率、多语言的 WSD 语料库,无需依赖人工标注。
  • 评估自动生成数据集在多种语言中是否能超越或匹配现有最先进系统的效果。
  • 提供一个公开可用的资源,支持低资源和高资源语言的 WSD 任务,提升多语言自然语言处理研究的可复现性与进展。

提出的方法

  • 利用 BabelNet,一种整合词典学与百科知识的多语言语义网络,为词语定义词义词表。
  • 使用 Wikipedia 作为大规模、多语言的原始句子语料库,用于收集训练数据。
  • 应用 Train-o-Matic 系统,通过跨语言对齐与语义相似性,自动为上下文中的词语标注词义分布。
  • 基于 Wikipedia 的社区标注词义链接与多语言对齐,应用词义传播技术以丰富训练数据。
  • 采用基于置信度的过滤机制,保留高质量的词义标注,剔除低置信度预测。
  • 通过提取英语 WordNet 中的所有名词及其在其他五种语言(法语、德语、西班牙语、意大利语、中文)中的翻译,构建数据集,生成数百万条带有词义标注的句子。

实验结果

研究问题

  • RQ1通过自动提取的大规模、多语言 WSD 语料库能否实现与现有最先进系统相当或更优的性能?
  • RQ2自动生成的训练数据在多大程度上能提升低资源语言中的 WSD 性能?
  • RQ3BabelNet 与 Wikipedia 的结合在生成高质量、多语言词义标注语料库方面有多高效?
  • RQ4所提出的方法能否在无需人工标注的前提下,扩展覆盖多种语言中的广泛词汇项?
  • RQ5在高资源语言(如英语)中,基于自动生成数据训练的 WSD 系统性能与基于人工精选数据(如 SemCor)训练的系统相比如何?

主要发现

  • 自动生成的数据集包含六种语言的数百万条词义标注句子,显著扩展了现有资源的训练覆盖范围。
  • 在法语、德语、西班牙语、意大利语和中文等低资源语言中,基于本数据集训练的监督式 WSD 系统超越了当前最先进水平。
  • 在英语中,基于新数据训练的系统表现具有竞争力,甚至优于某些基于人工精选数据(如 SemCor)训练的系统。
  • 在低资源设置中,性能提升尤为显著,这表明训练数据的缺乏通常会限制系统效能。
  • 利用 BabelNet 和 Wikipedia 实现了无需人工参与的大规模、多语言词义标注,证明了大规模自动数据生成的可行性。
  • 这些数据集已公开发布于 trainomatic.org,支持可复现性,并推动多语言 NLP 研究的广泛应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。