Skip to main content
QUICK REVIEW

[论文解读] Boosting Transformers for Job Expression Extraction and Classification in a Low-Resource Setting

Lukas Lange, Heike Adel|arXiv (Cornell University)|Sep 17, 2021
Natural Language Processing Techniques参考文献 10被引用 4
一句话总结

本论文通过应用领域自适应预训练、语言自适应预训练、策略性数据划分和迁移学习,提出提升多语言 XLM-R 变压器模型在低资源西班牙语临床文本中的工作表达式抽取与分类性能。最佳模型在抽取任务上达到 83.2 F1,在分类任务上达到 79.3 F1,通过集成方法和语言特定适应,相较于微调后的 XLM-R 最多提升 5.3 F1 分点。

ABSTRACT

In this paper, we explore possible improvements of transformer models in a low-resource setting. In particular, we present our approaches to tackle the first two of three subtasks of the MEDDOPROF competition, i.e., the extraction and classification of job expressions in Spanish clinical texts. As neither language nor domain experts, we experiment with the multilingual XLM-R transformer model and tackle these low-resource information extraction tasks as sequence-labeling problems. We explore domain- and language-adaptive pretraining, transfer learning and strategic datasplits to boost the transformer model. Our results show strong improvements using these methods by up to 5.3 F1 points compared to a fine-tuned XLM-R model. Our best models achieve 83.2 and 79.3 F1 for the first two tasks, respectively.

研究动机与目标

  • 解决英语中心的 NLP 模型在非标准语言和非标准领域下对西班牙语临床文本进行低资源信息抽取的挑战。
  • 通过将多语言变压器模型适配至西班牙语临床语言和领域,提升其在低资源设置下的性能。
  • 探究领域自适应预训练和语言自适应预训练、迁移学习以及策略性数据划分在临床 NLP 序列标注任务中的有效性。
  • 在不依赖语言或领域专业知识的前提下,实现在 MEDDOPROF 共享任务中工作表达式抽取与分类的最先进结果。
  • 证明通过策略性划分数据集训练的模型与迁移学习相结合的集成方法,能显著提升低资源临床 NER 任务的性能。

提出的方法

  • 使用掩码语言建模(MLM)在西班牙语临床文本上微调多语言 XLM-R 模型,以实现领域和语言自适应的预训练。
  • 训练 XLM-R 的三种变体:标准 XLM-R、临床专用 XLM-R 和通用领域西班牙语 XLM-R,以探究语言和领域适应的影响。
  • 通过基于相似性的文档聚类实现策略性数据划分,以创建多样化且信息丰富的交叉验证训练集。
  • 通过先在一项任务(如工作抽取)上训练,再在第二项任务(如工作分类)上微调模型,应用迁移学习。
  • 构建集成模型,结合多种 XLM-R 变体、策略性数据划分模型以及迁移学习模型,以提升鲁棒性和性能。
  • 使用 spaCy 进行子词分词和句子分割,并在子词级别执行序列标注,以提升 NER 性能。

实验结果

研究问题

  • RQ1XLM-R 的领域和语言自适应预训练在西班牙语临床工作表达式抽取与分类任务中如何提升性能?
  • RQ2通过文档聚类创建的策略性数据划分在多大程度上能增强低资源设置下的模型泛化能力和 F1 得分?
  • RQ3从工作抽取(NER)到工作分类的迁移学习能否提升分类性能?在何种条件下该方法有效?
  • RQ4结合多种模型变体和训练策略的集成方法与单模型微调相比,在低资源临床 NLP 任务中表现如何?
  • RQ5在本低资源任务中,通用领域西班牙语数据与临床专用数据对模型性能提升的相对贡献是什么?

主要发现

  • 表现最佳的模型是基于策略性数据划分的西班牙语通用领域 XLM-R 微调模型的集成,其在工作表达式抽取任务上达到 83.2 F1,比基线微调 XLM-R 提升 5.3 F1 分点。
  • 在西班牙语通用领域数据上训练的模型优于标准 XLM-R 和临床专用 XLM-R,表明通用领域知识对抽取任务有益。
  • 策略性数据划分使集成模型在分类任务上提升 2.3 F1 分点,甚至优于包含所有模型的完整集成(S5),凸显多样化训练数据划分的价值。
  • 从任务1(抽取)到任务2(分类)的迁移学习最多带来 2.9 F1 分点的增益,表明当辅助任务相关且学习充分时,该方法非常有效。
  • 包含所有模型的集成(S5)在抽取任务上达到 81.4 F1,在分类任务上达到 79.2 F1,表明集成多种策略能显著提升鲁棒性。
  • 经校正后的策略性数据划分集成模型(S3)在抽取任务上达到 81.8 F1,在分类任务上达到 79.3 F1,证实该方法在考虑无意模型重叠的情况下依然有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。