Skip to main content
QUICK REVIEW

[论文解读] VTCC-NLP at NL4Opt competition subtask 1: An Ensemble Pre-trained language models for Named Entity Recognition

Xuan-Dung Doan|arXiv (Cornell University)|Dec 14, 2022
Topic Modeling被引用 4
一句话总结

本论文提出了一种由三个预训练语言模型——XLM-R、BART 和 DeBERTa-V3 组成的集成模型,通过平均上下文嵌入来提升 NL4Opt 竞赛子任务 1 的命名实体识别(NER)性能。该方法在测试集上取得了 92.9% 的 F1 分数,排名第五,通过利用多样化的上下文表示以及 CRF 层进行序列标注,实现了性能提升。

ABSTRACT

We propose a combined three pre-trained language models (XLM-R, BART, and DeBERTa-V3) as an empower of contextualized embedding for named entity recognition. Our model achieves a 92.9% F1 score on the test set and ranks 5th on the leaderboard at NL4Opt competition subtask 1.

研究动机与目标

  • 通过使用预训练语言模型,提升在低资源和跨领域文本上的命名实体识别(NER)性能。
  • 探究结合多个预训练模型以增强 NER 中上下文表示有效性的方法。
  • 探索集成方法是否在跨不同领域的平面 NER 任务中优于单个模型。
  • 评估辅助组件(如 ELMo 和 GCN)对集成模型性能的影响。
  • 通过稳健的多模型集成方法,在 NL4Opt 竞赛子任务 1 测试集上实现最先进水平的结果。

提出的方法

  • 该模型使用三个预训练语言模型——XLM-R、BART 和 DeBERTa-V3——分别处理相同的输入句子,以生成上下文嵌入。
  • 每个模型采用其对应的子词分词方式,且选择序列长度最小的表示以确保模型间的一致性。
  • 三个模型的上下文嵌入通过平均形成联合表示:$ V = \frac{1}{3}(V_1 + V_2 + V_3) $,其中 $ V_1, V_2, V_3 $ 分别为 BART、XLM-R 和 DeBERTa-V3 的输出。
  • 平均后的嵌入通过一个线性链条件随机场(CRF)层,用于预测具有结构化预测的 BIO 标签序列。
  • CRF 层通过转移分数和发射分数计算条件概率 $ p_{\theta}(y|\hat{x}) $,并使用负对数似然损失进行优化。
  • 模型选择基于验证集上的最佳 F1 分数,每轮保存一次检查点,并使用表现最佳的模型进行推理。

实验结果

研究问题

  • RQ1通过嵌入平均方法组合多个预训练语言模型,是否能提升在跨领域和低资源文本上的 NER 性能?
  • RQ2XLM-R、BART 和 DeBERTa-V3 的集成模型在 F1 分数和跨领域鲁棒性方面,与单个模型相比表现如何?
  • RQ3在 NL4Opt 数据集中,集成 ELMo 或基于 GCN 的特征是否能提升集成模型的性能?
  • RQ4当在未见领域(如交通、生产、科学)上测试时,该集成方法在性能上是否保持或提升?
  • RQ5当与来自多个预训练模型的平均上下文嵌入结合时,CRF 层是否能有效优化序列级预测?

主要发现

  • 通过嵌入平均方法集成 XLM-R、BART 和 DeBERTa-V3 的模型,在 NL4Opt 竞赛测试集上取得了 92.9% 的 F1 分数。
  • 该集成模型在验证集上优于所有单个模型,证明了结合多样化预训练表示的有效性。
  • ELMo 的使用提升了基线模型的性能,但在应用于集成模型时导致准确率下降,表明存在潜在干扰。
  • 受依存句法分析启发的 GCN 集成同样提升了基线模型性能,但对集成模型造成了性能下降,表明其与集成策略可能存在不兼容性。
  • 最终模型在 NL4Opt 竞赛排行榜上排名第五,证实了该集成方法在跨领域 NER 任务中的有效性。
  • 该模型在 50 个训练周期后达到最佳性能,学习率为 1e-4,梯度累积为 4,仅使用一张 40GB A100 GPU。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。