Skip to main content
QUICK REVIEW

[论文解读] Empowering Interdisciplinary Research with BERT-Based Models: An Approach Through SciBERT-CNN with Topic Modeling

Darya Likhareva, Hamsini Sankaran|arXiv (Cornell University)|Apr 16, 2024
Computational and Text Analysis Methods被引用 4
一句话总结

本文提出一种结合 BERT 主题建模与类别加权的 SciBERT-CNN 混合模型,以提升从 Elsevier OA CC-BY 语料库中对科学文献进行多标签分类的性能。通过采用多段输入策略整合摘要、正文、标题及顶级主题关键词,该模型在 F1 分数和鲁棒性方面均取得显著提升,尤其在处理类别不平衡与跨学科内容方面表现优异。

ABSTRACT

Researchers must stay current in their fields by regularly reviewing academic literature, a task complicated by the daily publication of thousands of papers. Traditional multi-label text classification methods often ignore semantic relationships and fail to address the inherent class imbalances. This paper introduces a novel approach using the SciBERT model and CNNs to systematically categorize academic abstracts from the Elsevier OA CC-BY corpus. We use a multi-segment input strategy that processes abstracts, body text, titles, and keywords obtained via BERT topic modeling through SciBERT. Here, the [CLS] token embeddings capture the contextual representation of each segment, concatenated and processed through a CNN. The CNN uses convolution and pooling to enhance feature extraction and reduce dimensionality, optimizing the data for classification. Additionally, we incorporate class weights based on label frequency to address the class imbalance, significantly improving the classification F1 score and enhancing text classification systems and literature review efficiency.

研究动机与目标

  • 解决由于语义复杂性和出版物数量庞大所带来的跨学科科学文献分类挑战。
  • 克服标准 BERT 模型在捕捉科学语言细微差别以及处理多标签文本分类中类别不平衡问题方面的局限性。
  • 通过利用上下文嵌入与结构化特征融合,提升学术文献综述的分类准确率与效率。
  • 通过数据级与模型级优化,降低低频和宽泛学科类别(如 'MULT'、'MEDI')的误分类率。
  • 建立基于混合架构(结合 BERT、CNN 与主题建模)的科学文本多标签分类基准。

提出的方法

  • 采用多段输入策略,将摘要、正文、标题以及 BERT 提取的前 10 个关键词作为独立输入送入 SciBERT 模型进行处理。
  • 从每个段落中提取 [CLS] token 嵌入,并将它们拼接起来,形成用于下游分类的统一上下文表征。
  • 将拼接后的嵌入输入到一个带有 ReLU 激活函数、最大池化和 Dropout 的一维卷积神经网络(CNN)中,以实现特征提取与维度压缩。
  • 在最后添加一个全连接层,并使用 Sigmoid 激活函数进行多标签分类,从而实现对多个学科领域的独立预测。
  • 引入与标签频率成反比的类别权重,以减轻数据集中长尾类别分布的影响。
  • 通过融合主题建模与基于 CNN 的特征学习的混合架构,在 Elsevier OA CC-BY 语料库上对 SciBERT 模型进行微调。

实验结果

研究问题

  • RQ1与标准 BERT 模型相比,采用多段输入与主题建模的混合 SciBERT-CNN 模型是否能提升科学文献多标签分类的准确性?
  • RQ2基于标签频率的类别加权在多大程度上能减少长尾学科类别中的误分类?
  • RQ3BERT 提取的主题关键词的整合在多大程度上增强了模型对跨学科研究论文的分类能力?
  • RQ4科学文本分类中的主要误分类来源是什么?它们与标签的宽泛性或领域特异性有何关联?
  • RQ5基于期刊的学科分类方案是否存在结构性局限,从而对模型性能产生负面影响?若存在,应如何缓解?

主要发现

  • SciBERT-CNN 模型在全部 18 个学科领域中的 AUC 分数介于 0.93 至 0.99 之间,表明其具有出色的判别性能。
  • 表现最佳的类别为 'EART'(地球科学)与 'MATE'(材料科学),其 AUC 与 F1 分数均较高,反映出模型在这些领域具有良好的泛化能力。
  • 类别不平衡显著影响初始性能,'DENT'(牙科)与 'NURS'(护理)的 F1 分数分别为 0.0 和 0.05,通过将低频类别合并为更广泛的类别后得到改善。
  • 'MULT'(多学科)标签的误分类数量最多,原因在于其在不同学科间定义宽泛且异质。
  • 'MEDI'(医学)类别的误分类率较高,原因在于其与 'BIOC'(生物学)存在术语重叠,凸显了语义相近领域之间的分类挑战。
  • 大多数误分类结果为无标签预测,表明模型在模糊或文本稀疏的情况下缺乏足够的上下文线索以做出置信判断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。