[论文解读] BERT-based Acronym Disambiguation with Multiple Training Strategies
该论文提出了一种基于 BERT 的二分类模型,用于科学文本中的缩写词消歧,整合了动态负样本选择、任务自适应预训练、对抗性训练和伪标签技术。该模型在 SciAD 数据集上取得了最先进性能,在 SDU@AAAI-21 共享任务中以 0.9405 的 F1 分数排名第一,接近人类表现。
Acronym disambiguation (AD) task aims to find the correct expansions of an ambiguous ancronym in a given sentence. Although it is convenient to use acronyms, sometimes they could be difficult to understand. Identifying the appropriate expansions of an acronym is a practical task in natural language processing. Since few works have been done for AD in scientific field, we propose a binary classification model incorporating BERT and several training strategies including dynamic negative sample selection, task adaptive pretraining, adversarial training and pseudo labeling in this paper. Experiments on SciAD show the effectiveness of our proposed model and our score ranks 1st in SDU@AAAI-21 shared task 2: Acronym Disambiguation.
研究动机与目标
- 为解决科学文献中缩写词具有多种依赖上下文的扩展形式这一挑战。
- 通过利用 BERT 和多种训练策略,提升在 SciAD 基准上的性能。
- 通过上下文感知表示学习和数据增强技术,减少缩写词扩展预测的歧义。
- 在科学文本中实现与人类水平消歧性能相当的高性能。
提出的方法
- 在缩写词消歧数据集上使用任务自适应预训练对 SciBERT 进行微调,以更好地对齐下游任务表示。
- 应用动态负样本选择,将训练重点集中在难以分类的负向扩展上,从而提升模型泛化能力。
- 通过基于梯度的噪声扰动词嵌入引入对抗性训练,以增强模型鲁棒性。
- 采用伪标签技术在未标注数据上生成高置信度预测,从而增加有效训练数据规模。
- 使用二分类头从候选集合中预测正确扩展,BERT 负责提供上下文相关的句子编码。
- 在单一训练流程中端到端结合所有策略,联合优化消歧准确率。
实验结果
研究问题
- RQ1基于 BERT 的模型结合任务特定微调,是否能在缩写词消歧任务中超越传统基于规则和非预训练深度学习方法?
- RQ2对抗性训练和伪标签在低资源缩写词消歧任务中提升泛化能力方面有多有效?
- RQ3动态负样本选择是否能改善模型在歧义缩写实例上的收敛速度和性能表现?
- RQ4任务自适应预训练在多大程度上能缩小通用预训练与科学缩写词消歧之间的领域差距?
- RQ5神经网络模型在科学缩写词消歧任务上能多接近人类水平的性能?
主要发现
- 所提模型在测试集上取得了 0.9405 的 F1 分数,显著优于基线模型(F1: 0.8190)及其他所有竞争模型。
- 该模型在 SDU@AAAI-2021 共享任务中排名第一,F1 分数比第二名高出 0.32%。
- 人类在测试集上的表现达到 F1: 0.9610,表明该模型距离人类水平性能仅差 2.05 个百分点。
- 对抗性训练使训练时间增加了约 100%,但推理时间保持在每轮约 150 秒。
- 错误分析显示,模型失败主要发生在语义相似的扩展形式上(如单复数形式)以及上下文不足的句子中。
- 模型展现出强大的泛化能力,仅经过五轮训练后即实现收敛。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。