[论文解读] Dynamic Memory Induction Networks for Few-Shot Text Classification
该论文提出动态记忆归纳网络(DMIN),一种少样本文本分类模型,通过动态路由在推理过程中自适应调整记忆权重,从而提升对未见类别的泛化能力。通过整合查询感知记忆归纳机制,DMIN在miniRCV1和ODIC数据集上相比先前方法实现2–4%的准确率提升,达到当前最优性能。
This paper proposes Dynamic Memory Induction Networks (DMIN) for few-shot text classification. The model utilizes dynamic routing to provide more flexibility to memory-based few-shot learning in order to better adapt the support sets, which is a critical capacity of few-shot classification models. Based on that, we further develop induction models with query information, aiming to enhance the generalization ability of meta-learning. The proposed model achieves new state-of-the-art results on the miniRCV1 and ODIC dataset, improving the best performance (accuracy) by 2~4%. Detailed analysis is further performed to show the effectiveness of each component.
研究动机与目标
- 为解决由于支持集稀疏和实例级多样性导致的少样本文本分类泛化能力有限的问题。
- 通过在推理过程中实现记忆权重的动态自适应调整,而非依赖静态记忆组件,从而改进基于记忆的少样本学习。
- 通过联合学习查询感知记忆路由与从支持集中归纳类别级表征,提升模型泛化能力。
- 克服现有模型在低样本场景下固定原型和静态记忆机制的局限性。
提出的方法
- DMIN采用两阶段训练框架:先在基础类别上进行监督预训练,随后在任务式支持集和查询集上进行元学习。
- 模型使用BERT-base作为句子编码器,为输入文本生成上下文相关的句子表征。
- 动态记忆模块(DMM)应用动态路由,计算支持样本与记忆单元之间的注意力类似耦合系数,实现自适应特征聚合。
- 归纳模块(IM)利用查询感知路由,识别并优先选择与查询最相关的支持样本,从而提升原型质量。
- DMM与IM通过端到端反向传播联合训练,损失基于查询集预测结果计算。
- 模型利用基于注意力的路由机制,动态调整支持特征对类别级记忆表征的贡献,提升对实例级差异的鲁棒性。
实验结果
研究问题
- RQ1动态路由是否能通过在推理过程中实现自适应权重调整而非依赖静态记忆组件,从而提升基于记忆的少样本文本分类性能?
- RQ2当支持集中实例级多样性导致类别原型模糊时,查询感知记忆归纳如何增强模型泛化能力?
- RQ3所提出的动态记忆机制在低样本文本分类基准中相较于静态记忆机制的性能优势有多大?
- RQ4在少样本学习中,为平衡性能与计算成本,动态路由迭代次数的最优值是多少?
主要发现
- DMIN在miniRCV1数据集上达到新的SOTA准确率,在1-shot和5-shot设置下相比最佳先前结果提升2–4%。
- 在ODIC数据集上,DMIN在5类1-shot设置下达到83.46%准确率,在5类5-shot设置下达到91.75%,显著优于所有基线模型,包括LwoF和Ind. Net。
- 消融实验表明,移除动态记忆模块(DMM)或归纳模块(IM)均导致性能下降,证实了两个组件的有效性。
- 最优动态路由迭代次数为3次,1或2次迭代时性能下降,表明充分的路由优化至关重要。
- t-SNE可视化结果表明,DMM改善了支持集表征的特征分离,经记忆路由后语义聚类更优。
- 在95%置信水平下,经单尾配对t检验验证,性能提升具有统计显著性,证实DMIN性能增益的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。