[论文解读] Data Augmentation for Low-Resource Named Entity Recognition Using Backtranslation
本文提出将回译作为低资源命名实体识别(NER)的数据增强技术,通过将文本翻译为目标语言后再译回原语言,生成语言形式多样、语义保持一致的合成句子。在生物医学(S800)和材料科学(MaSciP)数据集上的实验表明,回译显著提升了NER性能,尤其在训练数据有限时表现更优,其F1分数和单字多样性均优于启发式与生成式基线方法。
The state of art natural language processing systems relies on sizable training datasets to achieve high performance. Lack of such datasets in the specialized low resource domains lead to suboptimal performance. In this work, we adapt backtranslation to generate high quality and linguistically diverse synthetic data for low-resource named entity recognition. We perform experiments on two datasets from the materials science (MaSciP) and biomedical domains (S800). The empirical results demonstrate the effectiveness of our proposed augmentation strategy, particularly in the low-resource scenario.
研究动机与目标
- 解决生物医学和材料科学等低资源领域中命名实体识别性能不佳的问题,这些领域专家标注的数据稀缺且获取成本高昂。
- 克服现有序列标注数据增强方法的局限性,如依赖语言学资源、语法不连贯或语言多样性不足。
- 开发一种无需依赖依存解析器或WordNet即可生成高质量、语言形式多样的合成训练数据的数据增强策略。
- 证明回译在低资源设置下的NER有效性,尤其在训练数据有限时。
- 在领域特定的NER数据集上评估该方法,以展示其在不同专业科学领域中的泛化能力。
提出的方法
- 通过将源句翻译为目标语言(如英译德),再将译文回译为原语言,同时保留原始的实体标签。
- 使用以Beta分布确定的概率,选择性地对句子的片段进行翻译。
- 使用预训练的多语言Transformer模型(如Facebook的WMT19英德模型)实现高质量的双向翻译。
- 通过将原始句子替换为回译版本,同时保留原始NER标注,生成合成训练样本。
- 使用原始数据和增强数据联合微调BiLSTM-CRF模型,采用GloVe或SciBERT嵌入。
- 对超参数进行网格搜索:每条样本的增强样本数量(1–10)和片段选择概率阈值(0.1–0.7)。
实验结果
研究问题
- RQ1回译是否能在不依赖外部语言学资源的前提下,有效生成高质量、语言形式多样的合成数据,用于低资源NER?
- RQ2在低资源设置下,回译与基于规则和生成式数据增强方法相比,其NER性能提升效果如何?
- RQ3随着训练数据规模的增加,回译带来的性能增益是否会减弱?若会,其临界规模在何处?
- RQ4从单字级别独特性(distinct-1)衡量,回译在多大程度上提升了生成序列的多样性?
- RQ5与非上下文嵌入相比,使用领域特定上下文嵌入(如SciBERT)是否会影响回译的相对收益?
主要发现
- 在S800和MaSciP数据集上,回译在所有基线增强技术中实现了最高的平均F1分数提升,尤其在低数据环境下表现最优。
- 在S800数据集上,当仅使用10%的训练数据时,回译使F1分数最高提升了4.2个百分点,且在低资源设置下增益最为显著。
- 回译在所有方法中生成的单字多样性(distinct-1)最高,证实其能生成语言形式多样的改写句,同时保持语义和标签一致性。
- 随着训练集规模增大,数据增强带来的性能增益逐渐减弱,部分增强方法甚至在完整训练集上导致性能下降,表明可能存在过拟合或噪声注入。
- 当使用SciBERT嵌入时,增强带来的平均F1提升低于GloVe,表明预训练的领域特定模型可能降低了增强的相对收益。
- 通过在验证集上进行网格搜索,确定回译的最佳超参数配置为:每条原始样本生成2–3个增强样本,片段选择概率为0.3–0.5。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。