Skip to main content
QUICK REVIEW

[论文解读] End-to-end Recurrent Neural Network Models for Vietnamese Named Entity Recognition: Word-level vs. Character-level

Thai-Hoang Pham, Phuong Le-Hong|arXiv (Cornell University)|May 11, 2017
Topic Modeling参考文献 21被引用 12
一句话总结

本文提出一种基于预训练词嵌入的端到端Bi-LSTM-CNN-CRF模型,用于越南语命名实体识别,在VLSP 2016测试集上取得88.59%的F₁分数,与未使用手工特征的顶尖系统性能相当。该模型通过CNN和Bi-LSTM组件同时利用词级别与字符级别表征,在低资源自然语言处理场景下提升了序列标注性能。

ABSTRACT

This paper demonstrates end-to-end neural network architectures for Vietnamese named entity recognition. Our best model is a combination of bidirectional Long Short-Term Memory (Bi-LSTM), Convolutional Neural Network (CNN), Conditional Random Field (CRF), using pre-trained word embeddings as input, which achieves an F1 score of 88.59% on a standard test set. Our system is able to achieve a comparable performance to the first-rank system of the VLSP campaign without using any syntactic or hand-crafted features. We also give an extensive empirical study on using common deep learning models for Vietnamese NER, at both word and character level.

研究动机与目标

  • 开发一种真正端到端的深度学习模型用于越南语命名实体识别,无需依赖句法分析或手工特征。
  • 比较在越南语NER中使用常见深度学习架构的词级别与字符级别建模方法的性能。
  • 评估预训练词嵌入以及混合表征(词级别 + 字符级别特征)在提升NER性能方面的有效性。
  • 提供一个开源NER系统,以支持未来越南语自然语言处理研究。
  • 在VLSP 2016基准上实现最先进性能,与使用大量特征工程的系统相当或更优。

提出的方法

  • 表现最佳的模型结合了双向长短期记忆网络(Bi-LSTM)、卷积神经网络(CNN)和用于序列解码的条件随机场(CRF)层。
  • 词嵌入使用在大规模越南新闻文章语料上训练的预训练skip-gram向量初始化。
  • 通过1D-CNN对字符嵌入进行处理,提取字符级别特征,随后与词级别表征进行融合。
  • Bi-LSTM处理拼接后的词与字符表征,以捕捉序列中的长距离依赖关系。
  • CRF层执行联合解码,以确保序列中标签的一致性,从而改善边界预测。
  • 模型使用随机梯度下降进行端到端训练,损失函数为交叉熵损失与CRF对数似然之和。

实验结果

研究问题

  • RQ1与依赖手工特征的系统相比,纯端到端深度学习模型在越南语NER上的表现如何?
  • RQ2在使用RNN与CNN的背景下,词级别与字符级别建模在越南语NER中的相对贡献是什么?
  • RQ3在越南语NER等低资源自然语言处理任务中,预训练词嵌入在多大程度上提升了性能?
  • RQ4Bi-LSTM、CNN与CRF组件的不同组合对VLSP 2016基准最终F₁分数有何影响?
  • RQ5仅使用词序列与预训练嵌入的模型能否达到与使用大量特征工程的顶尖系统相当的性能?

主要发现

  • 所提出的Bi-LSTM-CNN-CRF模型结合预训练词嵌入在VLSP 2016测试集上取得88.59%的F₁分数,与共享任务中排名第一的系统性能相当。
  • 通过CNN整合字符级别特征后,整体F₁分数提升至88.38%,证明了多级表征学习的优势。
  • 与未使用预训练词嵌入的模型相比,使用预训练词嵌入使F₁分数提高了约4个百分点,凸显其在低资源设置中的重要性。
  • 使用Bi-LSTM进行字符级别特征提取的模型仅取得82.98%的F₁分数,显著低于基于CNN的方法,表明CNN在此情境下更适用于局部特征提取。
  • 该系统优于使用随机词嵌入与字符级别LSTM的类似Bi-LSTM-CRF模型,归因于更优的预训练嵌入以及通过CNN实现的更有效的字符特征学习。
  • 该系统的开源发布有望加速未来越南语NLP研究,特别是在命名实体识别与序列标注领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。