QUICK REVIEW
[论文解读] VTCC-NLP at NL4Opt competition subtask 1: An Ensemble Pre-trained language models for Named Entity Recognition
Xuan-Dung Doan|arXiv (Cornell University)|Dec 14, 2022
Topic Modeling被引用 4
一句话总结
本论文提出了一种由三个预训练语言模型——XLM-R、BART 和 DeBERTa-V3 组成的集成模型,通过平均上下文嵌入来提升 NL4Opt 竞赛子任务 1 的命名实体识别(NER)性能。该方法在测试集上取得了 92.9% 的 F1 分数,排名第五,通过利用多样化的上下文表示以及 CRF 层进行序列标注,实现了性能提升。
ABSTRACT
We propose a combined three pre-trained language models (XLM-R, BART, and DeBERTa-V3) as an empower of contextualized embedding for named entity recognition. Our model achieves a 92.9% F1 score on the test set and ranks 5th on the leaderboard at NL4Opt competition subtask 1.
研究动机与目标
- 通过使用预训练语言模型,提升在低资源和跨领域文本上的命名实体识别(NER)性能。
- 探究结合多个预训练模型以增强 NER 中上下文表示有效性的方法。
- 探索集成方法是否在跨不同领域的平面 NER 任务中优于单个模型。
- 评估辅助组件(如 ELMo 和 GCN)对集成模型性能的影响。
- 通过稳健的多模型集成方法,在 NL4Opt 竞赛子任务 1 测试集上实现最先进水平的结果。
提出的方法
- 该模型使用三个预训练语言模型——XLM-R、BART 和 DeBERTa-V3——分别处理相同的输入句子,以生成上下文嵌入。
- 每个模型采用其对应的子词分词方式,且选择序列长度最小的表示以确保模型间的一致性。
- 三个模型的上下文嵌入通过平均形成联合表示:$ V = \frac{1}{3}(V_1 + V_2 + V_3) $,其中 $ V_1, V_2, V_3 $ 分别为 BART、XLM-R 和 DeBERTa-V3 的输出。
- 平均后的嵌入通过一个线性链条件随机场(CRF)层,用于预测具有结构化预测的 BIO 标签序列。
- CRF 层通过转移分数和发射分数计算条件概率 $ p_{\theta}(y|\hat{x}) $,并使用负对数似然损失进行优化。
- 模型选择基于验证集上的最佳 F1 分数,每轮保存一次检查点,并使用表现最佳的模型进行推理。
实验结果
研究问题
- RQ1通过嵌入平均方法组合多个预训练语言模型,是否能提升在跨领域和低资源文本上的 NER 性能?
- RQ2XLM-R、BART 和 DeBERTa-V3 的集成模型在 F1 分数和跨领域鲁棒性方面,与单个模型相比表现如何?
- RQ3在 NL4Opt 数据集中,集成 ELMo 或基于 GCN 的特征是否能提升集成模型的性能?
- RQ4当在未见领域(如交通、生产、科学)上测试时,该集成方法在性能上是否保持或提升?
- RQ5当与来自多个预训练模型的平均上下文嵌入结合时,CRF 层是否能有效优化序列级预测?
主要发现
- 通过嵌入平均方法集成 XLM-R、BART 和 DeBERTa-V3 的模型,在 NL4Opt 竞赛测试集上取得了 92.9% 的 F1 分数。
- 该集成模型在验证集上优于所有单个模型,证明了结合多样化预训练表示的有效性。
- ELMo 的使用提升了基线模型的性能,但在应用于集成模型时导致准确率下降,表明存在潜在干扰。
- 受依存句法分析启发的 GCN 集成同样提升了基线模型性能,但对集成模型造成了性能下降,表明其与集成策略可能存在不兼容性。
- 最终模型在 NL4Opt 竞赛排行榜上排名第五,证实了该集成方法在跨领域 NER 任务中的有效性。
- 该模型在 50 个训练周期后达到最佳性能,学习率为 1e-4,梯度累积为 4,仅使用一张 40GB A100 GPU。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。