Skip to main content
QUICK REVIEW

[论文解读] A Survey of Active Learning for Natural Language Processing

Zhisong Zhang, Emma Strubell|arXiv (Cornell University)|Oct 18, 2022
Machine Learning and Algorithms被引用 8
一句话总结

本综述对自然语言处理(NLP)中的主动学习(AL)提供了全面且最新的回顾,重点涵盖查询策略、结构化预测、标注成本、深度学习集成以及启动和停止AL的实际考量。它对AL方法进行了细致的分类,并指出了将AL应用于现代NLP任务(尤其是神经网络模型)时的关键挑战与未来方向。

ABSTRACT

In this work, we provide a survey of active learning (AL) for its applications in natural language processing (NLP). In addition to a fine-grained categorization of query strategies, we also investigate several other important aspects of applying AL to NLP problems. These include AL for structured prediction tasks, annotation cost, model learning (especially with deep neural models), and starting and stopping AL. Finally, we conclude with a discussion of related topics and future directions.

研究动机与目标

  • 为解决近年来缺乏涵盖现代深度学习进展的、针对NLP的主动学习综述的问题。
  • 对AL中的查询策略进行细致分类,包括信息性、代表性以及混合方法。
  • 考察AL在NLP中的关键实际方面,如结构化预测任务、标注成本以及使用深度神经网络进行模型训练。
  • 探讨方法论上的挑战,如查询-后续模型不匹配问题,以及启动和终止AL周期的策略。
  • 识别在将主动学习应用于现代NLP应用时的开放性问题与未来研究方向。

提出的方法

  • 通过ACL Anthology和arXiv的关键词筛选与参考文献筛选,系统性地调研NLP中的AL文献。
  • 将查询策略分类为信息性(如不确定性采样、间隔采样)、代表性以及混合方法。
  • 分析AL在结构化预测任务中的应用,如命名实体识别、依存句法分析、语义角色标注和共指消解。
  • 考察NLP中标注成本的影响,包括标注复杂性与人机协同的考量。
  • 回顾AL中的模型学习技术,特别是与深度神经网络的结合,讨论如查询-后续模型不匹配等挑战。
  • 研究实际AL工作流中的决策问题,包括初始数据集选择与停止标准,并结合近期研究提供实证洞察。

实验结果

研究问题

  • RQ1在不同NLP任务中,基于不确定性的查询策略、基于代表性的策略以及混合策略的表现如何?
  • RQ2在NLP中将主动学习应用于结构化预测和序列生成任务时,面临哪些独特挑战?
  • RQ3深度神经网络的集成如何影响NLP中主动学习的性能与效率?
  • RQ4影响NLP主动学习中标注成本的关键因素有哪些?又该如何缓解?
  • RQ5在实践中,启动和停止主动学习过程的最有效策略是什么?

主要发现

  • 近年来,尽管在2010年代中期神经NLP兴起时主动学习曾一度式微,但其在深度神经网络背景下重新受到广泛关注。
  • 不确定性采样仍是使用最广泛的查询策略,其中熵、最小置信度和间隔采样是最常见的变体。
  • 针对结构化预测任务(如NER、SRL、句法分析)的查询策略需要特殊处理,因其输出结构复杂且需对齐。
  • NLP中的标注成本是主要瓶颈,尤其是共指消解和语义解析等任务,其标注成本尤为高昂。
  • 查询-后续模型不匹配问题(即用于选择数据的模型与用于训练的模型不同)仍是NLP中主动学习的关键挑战。
  • 近期研究显示,将信息性与代表性相结合的查询策略可显著提升多个NLP基准上的样本效率与模型性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。