[论文解读] Text Classification of Manifestos and COVID-19 Press Briefings using BERT and Convolutional Neural Networks
本文提出一种利用 BERT 增强的 CNN 的迁移学习方法,用于对文本中的政治话语进行分类,通过利用预先标注的政纲文件,自动对新冠疫情新闻发布会文本中的句子进行分类。结果表明,BERT+CNN 在两个领域中的表现均优于其他嵌入方法(Word2Vec、GloVe、ELMo),在未进行微调的情况下,政纲文件上的准确率为 87.52%,新闻发布会文本上的准确率为 68.65%,证明了在政治文本分类中实现有效的零样本领域迁移。
We build a sentence-level political discourse classifier using existing human expert annotated corpora of political manifestos from the Manifestos Project (Volkens et al., 2020a) and applying them to a corpus ofCOVID-19Press Briefings (Chatsiou, 2020). We use manually annotated political manifestos as training data to train a local topic ConvolutionalNeural Network (CNN) classifier; then apply it to the COVID-19PressBriefings Corpus to automatically classify sentences in the test corpus.We report on a series of experiments with CNN trained on top of pre-trained embeddings for sentence-level classification tasks. We show thatCNN combined with transformers like BERT outperforms CNN combined with other embeddings (Word2Vec, Glove, ELMo) and that it is possible to use a pre-trained classifier to conduct automatic classification on different political texts without additional training.
研究动机与目标
- 使用现有的人工标注政治政纲文件开发一种基于句子的的政治话语分类器。
- 评估 CNN 与各种预训练词嵌入(Word2Vec、GloVe、ELMo、BERT)在政治文本分类中的性能。
- 探究在政纲文件上预训练的分类器是否能在不进行额外训练的情况下,有效应用于分类另一政治文本领域——新冠疫情新闻发布会文本。
- 评估迁移学习在不同政治文本类型之间进行政治话语分析时的泛化能力。
提出的方法
- 在来自 Manifestos Project 的手动标注英文政治政纲文件上训练本地主题卷积神经网络(CNN)。
- 将四种预训练词嵌入模型——Word2Vec、GloVe、ELMo 和 BERT——作为输入表示输入到 CNN 中,实现基于句子的分类。
- 在不进行微调的情况下,直接将相同的预训练 CNN 模型应用于新冠疫情新闻发布会语料库,仅使用政纲文件的原始训练数据。
- 执行 4 项实验,比较在政纲文件和新闻发布会语料库上,不同嵌入类型下 CNN 的性能表现。
- 使用保留的开发集和测试集以确保评估的稳健性并防止过拟合。
- 在两个领域中使用准确率和 F1 分数评估模型,以比较不同嵌入类型下的性能表现。
实验结果
研究问题
- RQ1在未进行额外训练的情况下,基于政纲文件训练的 CNN 分类器是否能有效对另一政治文本领域(如新冠疫情新闻发布会)中的句子进行分类?
- RQ2当与不同预训练词嵌入(Word2Vec、GloVe、ELMo、BERT)结合时,CNN 在政治话语分类中的性能如何变化?
- RQ3在政治文本分类任务中,使用上下文相关的嵌入(如 BERT)是否能显著提升分类性能,相较于非上下文相关的嵌入?
- RQ4政纲文件与新闻发布会之间的领域差异在多大程度上影响零样本迁移学习方法的性能?
主要发现
- BERT+CNN 模型在政治政纲文件语料上取得了最高的准确率(87.52%)和 F1 分数(74.68%),显著优于使用 Word2Vec、GloVe 和 ELMo 的模型。
- 在新冠疫情新闻发布会语料上,BERT+CNN 模型取得了 68.65% 的准确率和 64.58% 的 F1 分数,表现出强大的零样本迁移性能。
- ELMo+CNN 表现良好,在政纲文件上达到 72.84% 的准确率,在新闻发布会文本上达到 60.74%,表明其在非 Transformer 嵌入中表现优异。
- BERT+CNN 与其他模型之间的性能差距在新闻发布会语料上最为显著,凸显了 BERT 对领域偏移的鲁棒性。
- 结果证实,预训练的 BERT 嵌入能够实现从政纲文件到新闻发布会的高效零样本领域迁移,减少了在新领域中进行昂贵人工标注的需求。
- 本研究表明,利用专家标注的政纲文件作为训练数据进行迁移学习,是分类多样化政治话语文本的一种可行且可扩展的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。