Skip to main content
QUICK REVIEW

[论文解读] AdaptKeyBERT: An Attention-Based approach towards Few-Shot & Zero-Shot Domain Adaptation of KeyBERT

Aman Priyanshu, Supriti Vijay|arXiv (Cornell University)|Nov 14, 2022
Advanced Text Analysis Techniques被引用 4
一句话总结

AdaptKeyBERT 提出了一种基于注意力的微调框架,通过在候选词嵌入和种子词嵌入上使用正则化注意力,实现了 KeyBERT 在少样本和零样本场景下的领域自适应。该方法在 FAO-780 和 CERN-290 等低资源领域中,将关键词抽取的 F1 分数最高提升了 12.58%,优于基线模型 KeyBERT,并实现了无需完整微调的高效自适应。

ABSTRACT

Keyword extraction has been an important topic for modern natural language processing. With its applications ranging from ontology generation, fact verification in summarized text, and recommendation systems. While it has had significant data-intensive applications, it is often hampered when the data set is small. Downstream training for keyword extractors is a lengthy process and requires a significant amount of data. Recently, Few-shot Learning (FSL) and Zero-Shot Learning (ZSL) have been proposed to tackle this problem. Therefore, we propose AdaptKeyBERT, a pipeline for training keyword extractors with LLM bases by incorporating the concept of regularized attention into a pre-training phase for downstream domain adaptation. As we believe our work has implications to be utilized in the pipeline of FSL/ZSL and keyword extraction, we open-source our code as well as provide the fine-tuning library of the same name AdaptKeyBERT at https://github.com/AmanPriyanshu/AdaptKeyBERT.

研究动机与目标

  • 解决生物医学、法律和高能物理等专业领域中低资源关键词抽取的挑战。
  • 在无需大规模标注数据的情况下,实现关键词抽取器的有效少样本与零样本领域自适应。
  • 通过基于注意力的嵌入优化,提升基于预训练 BERT 的模型(如 KeyBERT)在特定领域中的性能。
  • 提供一个开源、支持 API 集成的库,便于部署和微调领域自适应的关键词抽取器。

提出的方法

  • 将正则化注意力集成到 KeyBERT 的训练模块中,用于计算候选关键词与种子词之间的相似性权重。
  • 通过注意力机制控制的可学习正则化参数 α ∈ [0,1],对文档嵌入与种子词嵌入进行加权组合。
  • 采用混合损失函数,利用注意力计算的权重重建候选词嵌入,从而提升领域相关性。
  • 将出现频率超过数据集 10% 的关键词定义为流行关键词,并用作零样本自适应的种子词。
  • 通过选择包含最频繁关键词的样本实现少样本自适应,为保证效率,限定样本数量不超过数据集的 10%。
  • 通过联合相似性计算结合零样本与少样本模块,实现联合领域自适应。

实验结果

研究问题

  • RQ1基于注意力的嵌入重建是否能提升低资源领域中的关键词抽取性能?
  • RQ2将少样本与零样本学习相结合,如何增强关键词抽取中的领域自适应能力?
  • RQ3与标准 KeyBERT 相比,正则化注意力在多大程度上提升了所提取关键词的相关性?
  • RQ4在多样化领域中,混合少样本与零样本方法是否优于单一自适应策略?

主要发现

  • 在 FAO-780 数据集上,AdaptKeyBERT 在少样本设置下将 F1 分数提升了 12.58%(从基线模型的 35.138 提升至 39.559)。
  • 在 FAO-780 的零样本设置下,F1 分数相比基线模型提升了 7.88%(从 35.138 提升至 37.908)。
  • 在 FAO-780 上,联合少样本与零样本方法的 F1 分数达到 39.938,相比基线模型提升了 13.66%。
  • 在 CERN-290 数据集上,少样本变体将 F1 分数提升了 9.95%(从 25.627 提升至 28.177),联合方法的 F1 分数达到 28.883。
  • 零样本模块在 CERN-290 上实现了 3.81% 的 F1 分数增益,尽管因假阴性增加导致召回率略有下降。
  • 该模型在语言结构复杂的领域中表现出一致的泛化能力,验证了其在低资源场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。