[论文解读] Zero-Shot and Few-Shot Classification of Biomedical Articles in Context of the COVID-19 Pandemic
本论文提出了一种多任务学习框架,通过在序列到序列任务中预测树编号(Tree Numbers),将MeSH层级结构整合到BioBERT表示中,以提升生物医学文章在零样本和少样本分类任务中的性能。该方法改善了结构探针任务的表现,并增强了MeSH术语之间的语义对齐,尤其在捕捉层级关系方面表现突出,但各类数据集上的分类F1得分提升并不一致。
MeSH (Medical Subject Headings) is a large thesaurus created by the National Library of Medicine and used for fine-grained indexing of publications in the biomedical domain. In the context of the COVID-19 pandemic, MeSH descriptors have emerged in relation to articles published on the corresponding topic. Zero-shot classification is an adequate response for timely labeling of the stream of papers with MeSH categories. In this work, we hypothesise that rich semantic information available in MeSH has potential to improve BioBERT representations and make them more suitable for zero-shot/few-shot tasks. We frame the problem as determining if MeSH term definitions, concatenated with paper abstracts are valid instances or not, and leverage multi-task learning to induce the MeSH hierarchy in the representations thanks to a seq2seq task. Results establish a baseline on the MedLine and LitCovid datasets, and probing shows that the resulting representations convey the hierarchical relations present in MeSH.
研究动机与目标
- 解决在新冠疫情背景下,针对大量MeSH类别缺乏标注数据的生物医学文章零样本和少样本分类挑战。
- 通过利用MeSH描述符的丰富层级语义(包括其树编号和父子关系),改进BioBERT的语义表征。
- 开发一种多任务学习框架,联合训练文档分类与MeSH层级预测任务,以增强零样本泛化能力。
- 探究将MeSH层级编码到模型表征中是否能提升零样本和少样本分类任务的性能。
- 为生物医学文本分类提供更具可解释性和语义结构化的表征空间,这对医疗NLP应用至关重要。
提出的方法
- 在MedLine和LitCovid数据集的平衡子集上微调BioBERT,采用开放词汇设置,其中每个输入为论文摘要与MeSH术语的拼接。
- 将零样本分类建模为二分类匹配任务:预测给定的MeSH术语是否与论文摘要相关。
- 引入多任务学习目标,通过独立的解码头预测MeSH术语的树编号,将层级结构编码到表征中。
- 使用BioBERT的[CLS] token表示作为分类与层级预测任务的联合上下文。
- 采用两部分损失进行训练:分类任务的交叉熵损失与树编号序列生成任务的交叉熵损失,损失权重进行平衡。
- 通过两项结构探针任务进行结构分析:共祖先探针(衡量k个共同祖先的F1分数)与最短路径探针(衡量MeSH层级图中路径距离的平均误差)。
实验结果
研究问题
- RQ1通过多任务学习将MeSH层级结构融入BioBERT表征,能否提升生物医学文章在零样本和少样本分类任务中的性能?
- RQ2模型在结构探针任务中对MeSH描述符之间层级关系的学习与保持程度如何?
- RQ3引入树编号预测的序列到序列任务是否能提升表征空间中MeSH术语的语义对齐?
- RQ4在分类与探针任务中,与原始BioBERT相比,多任务学习模型在性能与表征质量方面表现如何?
- RQ5在扩展至大规模词汇量的零样本设置时,当前开放输入方法存在哪些局限性?
主要发现
- 多任务学习(MTL)模型在探针任务中的平均最短路径距离误差为1.323,显著低于原始BioBERT(1.494)与随机基线(2.597),表明其更好地保留了层级结构。
- MTL模型在共祖先探针中的F1分数为:k=1时0.933,k=2时0.659,k=3时0.576,优于原始BioBERT(0.855, 0.521, 0.538),显示出更强的共同祖先识别能力。
- 尽管探针性能有所提升,但MTL模型在主要的零样本与少样本分类任务中并未一致提升F1分数,表明其对下游分类任务的迁移效果有限。
- 原始BioBERT模型已具备一定的层级知识编码能力,其在探针任务中的基线表现表明,生物医学文本预训练已隐式捕捉到语义结构。
- MTL框架的训练动态不够理想,分类损失收敛速度远快于树编号预测损失,限制了层级头的充分优化。
- 本研究强调了多任务学习中更优优化策略的必要性,并建议将基于检索的过滤方法(如ColBERT或BM25)与开放输入分类结合,以实现大规模词汇量零样本设置下的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。