[论文解读] Active Learning Over Multiple Domains in Natural Language Tasks
本文研究了多领域自然语言处理任务中的主动学习,其中未标注数据来自多个分布外的数据源。该文提出了 $χ$-散度族中的 DAL-E 获取函数,通过有效选择跨领域的多样化、高价值样本,相较于随机基线平均提升 2-3%。
Studies of active learning traditionally assume the target and source data stem from a single domain. However, in realistic applications, practitioners often require active learning with multiple sources of out-of-distribution data, where it is unclear a priori which data sources will help or hurt the target domain. We survey a wide variety of techniques in active learning (AL), domain shift detection (DS), and multi-domain sampling to examine this challenging setting for question answering and sentiment analysis. We ask (1) what family of methods are effective for this task? And, (2) what properties of selected examples and domains achieve strong results? Among 18 acquisition functions from 4 families of methods, we find H-Divergence methods, and particularly our proposed variant DAL-E, yield effective results, averaging 2-3% improvements over the random baseline. We also show the importance of a diverse allocation of domains, as well as room-for-improvement of existing methods on both domain and example selection. Our findings yield the first comprehensive analysis of both existing and novel methods for practitioners faced with multi-domain active learning for natural language tasks.
研究动机与目标
- 解决在真实自然语言处理场景中主动学习的挑战,其中多个分布外领域作为未标注数据源。
- 探究传统主动学习假设(如单一领域数据)在多领域、分布偏移环境下的适用性。
- 评估不同获取函数在多领域主动学习中的有效性,涵盖不确定性、领域分布偏移检测和基于相似性的方法。
- 确定在多领域主动学习中,领域预算分配策略还是单池选择策略表现更优。
- 为实践者提供可操作的见解,以选择有效的获取函数并平衡领域与样本选择。
提出的方法
- 在四类方法家族中基准测试 18 种获取函数:基于不确定性的方法、$χ$-散度方法、反向分类准确率(RCA)方法以及基于语义相似性的检测方法。
- 在 $χ$-散度族中实现一种新型变体 DAL-E,用于衡量模型在不同领域间的分歧程度,并优先选择能降低不确定性同时促进多样性的样本。
- 比较两种选择策略:单池策略(将所有样本视为一个未标注池)与领域预算分配策略(为每个领域分配固定数量的样本)。
- 使用固定的标注预算,在每次主动学习迭代后评估问答和情感分析任务上的模型性能。
- 进行最优领域搜索实验,以确定每项目标任务下各领域最佳的样本分布。
- 通过比较基于 DAL-E* 排名的最高分样本与同一领域中随机选择样本训练的模型,评估样本选择的影响。
实验结果
研究问题
- RQ1在多领域自然语言处理任务的主动学习中,哪类获取函数表现最佳?
- RQ2被选中的样本和领域具备哪些特性,能提升多领域主动学习中的模型性能?
- RQ3在多领域主动学习中,领域预算分配策略是否优于单池选择策略?
- RQ4在领域选择之外,领域内样本选择对性能的贡献有多大?
- RQ5能否预先识别出最优的领域分布以改善主动学习结果?
主要发现
- $χ$-散度族的获取函数,尤其是所提出的 DAL-E 变体,在多个自然语言处理任务中平均优于随机基线 2-3%。
- 领域多样性是关键因素:选择多样化的源领域可带来比依赖单一或少数领域更强的性能表现。
- 样本选择具有显著影响:基于 DAL-E* 排名选择最高分样本训练的模型,在问答任务中平均表现优于随机选择 0.46%,在情感分析任务中优于 0.12%。
- 低质量样本选择会损害性能:基于 DAL-E* 排名最低的样本训练的模型,在问答任务中平均表现落后 1.64%,在情感分析任务中落后 1.46%。
- 领域预算分配策略可优于单池选择:在 14 次实验中的 8 次,根据最优领域分布进行随机采样,表现超越了所有主动学习基线。
- 最优领域分布无法预先获知,表明未来的获取函数可通过更准确地预测此类分布而进一步改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。