Skip to main content
QUICK REVIEW

[论文解读] An Open-Source Dataset and A Multi-Task Model for Malay Named Entity Recognition

Yingwen Fu, Nankai Lin|arXiv (Cornell University)|Sep 3, 2021
Topic Modeling参考文献 24被引用 5
一句话总结

本文提出了 MYNER,一个大规模开源的马来语命名实体识别(NER)数据集,包含 28,991 个句子和超过 384,000 个词符,通过利用同源语言数据并结合迭代优化框架构建而成。此外,本文还提出了一种具有双向修正机制和门控忽略机制的多任务学习模型,用于边界检测,该模型在 MYNER 上实现了最先进性能,并为低资源马来语自然语言处理建立了基准。

ABSTRACT

Named entity recognition (NER) is a fundamental task of natural language processing (NLP). However, most state-of-the-art research is mainly oriented to high-resource languages such as English and has not been widely applied to low-resource languages. In Malay language, relevant NER resources are limited. In this work, we propose a dataset construction framework, which is based on labeled datasets of homologous languages and iterative optimization, to build a Malay NER dataset (MYNER) comprising 28,991 sentences (over 384 thousand tokens). Additionally, to better integrate boundary information for NER, we propose a multi-task (MT) model with a bidirectional revision (Bi-revision) mechanism for Malay NER task. Specifically, an auxiliary task, boundary detection, is introduced to improve NER training in both explicit and implicit ways. Furthermore, a gated ignoring mechanism is proposed to conduct conditional label transfer and alleviate error propagation by the auxiliary task. Experimental results demonstrate that our model achieves comparable results over baselines on MYNER. The dataset and the model in this paper would be publicly released as a benchmark dataset.

研究动机与目标

  • 为马来语等低资源语言解决高质量、大规模 NER 资源稀缺的问题。
  • 在低资源环境下,开发一种可扩展、数据高效的 NER 数据集构建框架。
  • 通过在多任务学习设置中将边界检测作为辅助任务,提升马来语 NER 的性能。
  • 通过条件标签迁移机制,减轻辅助任务带来的误差传播。
  • 为未来马来语自然语言处理研究建立公开可用的基准数据集和模型。

提出的方法

  • 一种利用相关高资源语言的标注数据并应用迭代优化以精炼和扩展马来语 NER 数据集的构建框架。
  • 创建了最终的 MYNER 数据集,包含 28,991 个句子和超过 384,000 个词符,并标注了六种实体类型。
  • 设计了一种具有双向修正(Bi-revision)机制的多任务模型,以联合优化 NER 和边界检测。
  • 引入门控忽略机制,选择性地将边界检测任务的标签传递至 NER 任务,以减少误差传播。
  • 采用共享编码器和任务特定头端到端训练模型,其中边界检测任务通过显式和隐式监督增强 NER 性能。
  • 使用双向 LSTM 和 CRF 层来建模序列依赖关系,提升标注准确性。

实验结果

研究问题

  • RQ1基于同源语言资源和迭代优化的数据构建框架,能否为低资源语言(如马来语)生成高质量、大规模的 NER 数据集?
  • RQ2将边界检测作为辅助任务是否能提升马来语 NER 模型的性能?
  • RQ3门控忽略机制是否能有效减少多任务训练过程中来自辅助边界检测任务的误差传播?
  • RQ4所提出的具有双向修正机制的多任务模型与强基线模型相比,在新构建的 MYNER 数据集上表现如何?
  • RQ5所提出的模型和数据集在多大程度上可作为未来马来语 NLP 研究的可行基准?

主要发现

  • 所提出的数据集构建框架成功生成了 MYNER,一个高质量、大规模的马来语 NER 数据集,包含 28,991 个句子和超过 384,000 个词符。
  • 具有双向修正和门控忽略机制的多任务模型在 MYNER 数据集上的 F1 分数优于强基线模型。
  • 辅助的边界检测任务通过显式和隐式监督机制,有效提升了 NER 性能。
  • 门控忽略机制有效减少了来自辅助任务的误差传播,提升了整体训练稳定性和性能。
  • 该模型在 MYNER 基准上实现了最先进结果,验证了其在低资源马来语 NLP 中的有效性。
  • 数据集和模型已公开发布,为未来马来语 NER 研究建立了新基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。