Skip to main content
QUICK REVIEW

[论文解读] Label-aware Double Transfer Learning for Cross-Specialty Medical Named Entity Recognition

Zhenghui Wang, Yanru Qu|arXiv (Cornell University)|Apr 24, 2018
Topic Modeling被引用 5
一句话总结

该论文提出了一种名为标签感知双重迁移学习(La-DTL)的新框架,用于跨专科医学命名实体识别,通过标签感知的最大均值差异(La-MMD)实现特征表示迁移,并通过条件随机场(CRF)参数的KL散度上界实现标签感知的参数迁移。在12项跨专科医学命名实体识别任务上,La-DTL相较于最先进基线模型实现了2.62%至6.70%的F1分数持续提升,表明其在低资源设置下具备出色的泛化能力和鲁棒性。

ABSTRACT

We study the problem of named entity recognition (NER) from electronic medical records, which is one of the most fundamental and critical problems for medical text mining. Medical records which are written by clinicians from different specialties usually contain quite different terminologies and writing styles. The difference of specialties and the cost of human annotation makes it particularly difficult to train a universal medical NER system. In this paper, we propose a label-aware double transfer learning framework (La-DTL) for cross-specialty NER, so that a medical NER system designed for one specialty could be conveniently applied to another one with minimal annotation efforts. The transferability is guaranteed by two components: (i) we propose label-aware MMD for feature representation transfer, and (ii) we perform parameter transfer with a theoretical upper bound which is also label aware. We conduct extensive experiments on 12 cross-specialty NER tasks. The experimental results demonstrate that La-DTL provides consistent accuracy improvement over strong baselines. Besides, the promising experimental results on non-medical NER scenarios indicate that La-DTL is potential to be seamlessly adapted to a wide range of NER tasks.

研究动机与目标

  • 为解决在多样化临床专科中使用有限标注数据训练高性能医学命名实体识别系统所面临的挑战。
  • 通过实现从源专科到目标专科的知识迁移,降低标注成本并克服数据共享障碍。
  • 开发一种显式考虑标签对应关系的迁移学习框架,以实现特征与参数的迁移。
  • 证明该框架在医学命名实体识别之外的非医学命名实体识别任务中也具备泛化潜力。

提出的方法

  • 提出标签感知最大均值差异(La-MMD),在最小化标记级特征表示域差异的同时,保留源域与目标域之间的标签特定对齐。
  • 引入基于CRF模型在源域与目标域之间发射矩阵和转移矩阵KL散度上界的标签感知参数迁移机制。
  • 采用双流架构,使用共享的Bi-LSTM编码器实现跨专科的联合序列表征学习。
  • 通过联合优化特征迁移与参数迁移目标,实现从源专科到目标专科的有效知识蒸馏。
  • 通过$α$、$β$和$ε$对超参数进行调优,以控制源域与目标域学习目标之间的权衡。
  • 由于特征与参数迁移组件均具备标签感知设计,即使标签集不匹配,也能支持迁移学习。

实验结果

研究问题

  • RQ1标签感知迁移学习是否能在极少人工标注的情况下显著提升跨专科医学命名实体识别性能?
  • RQ2通过La-MMD实现的标签感知特征表示迁移,与标准MMD相比,在减少医学文本中的领域偏移方面表现如何?
  • RQ3通过KL散度上界实现的标签感知参数迁移,在提升模型在不同专科间的泛化能力方面能发挥多大作用?
  • RQ4所提出的La-DTL框架是否能有效应用于标签集不匹配或语言不同的非医学命名实体识别任务?

主要发现

  • 在12项跨专科医学命名实体识别任务中,La-DTL相较于强基线模型实现了2.62%至6.70%的F1分数持续提升。
  • 该框架在低资源条件下(如10%训练数据)显著优于联合训练和非迁移基线,展现出对数据稀缺的强鲁棒性。
  • 在WeiboNER迁移任务(中文社交媒体)中,La-DTL取得57.74%的F1分数,超越所有先前基线,包括领域掩码和CD-learning方法。
  • 在TwitterNER迁移任务(英文社交媒体)中,La-DTL取得45.71%的F1分数,优于联合训练(43.24%),表明其在跨语言、标签不匹配场景下的有效性。
  • 超参数分析表明,当$\alpha \in [0.01, 0.04]$、$\beta \in [0.03, 0.12]$和$\varepsilon \in [0.3, 0.4]$时性能最优,表明源域与目标域学习需保持平衡。
  • 该框架表现出强收敛性与稳定性,在低数据设置下,10次随机种子实验中La-DTL显著优于联合训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。