Skip to main content
QUICK REVIEW

[論文レビュー] Text Classification of Manifestos and COVID-19 Press Briefings using BERT and Convolutional Neural Networks

Kakia Chatsiou|arXiv (Cornell University)|Oct 20, 2020
Computational and Text Analysis Methods参考文献 34被引用数 7
ひとこと要約

本稿では、事前にアノテートされた政令文書を活用して、COVID-19報道ブリーフィング文における文を自動的に分類するため、BERT強化CNNを用いた転移学習アプローチを提案する。BERT+CNNは、微調整なしで、両ドメインにおいて他の埋め込み表現(Word2Vec、GloVe、ELMo)を上回り、政令文書では87.52%の正確性、報道ブリーフィングでは68.65%の正確性を達成し、政治的テキスト分類におけるゼロショットドメイン転送の有効性を示している。

ABSTRACT

We build a sentence-level political discourse classifier using existing human expert annotated corpora of political manifestos from the Manifestos Project (Volkens et al., 2020a) and applying them to a corpus ofCOVID-19Press Briefings (Chatsiou, 2020). We use manually annotated political manifestos as training data to train a local topic ConvolutionalNeural Network (CNN) classifier; then apply it to the COVID-19PressBriefings Corpus to automatically classify sentences in the test corpus.We report on a series of experiments with CNN trained on top of pre-trained embeddings for sentence-level classification tasks. We show thatCNN combined with transformers like BERT outperforms CNN combined with other embeddings (Word2Vec, Glove, ELMo) and that it is possible to use a pre-trained classifier to conduct automatic classification on different political texts without additional training.

研究の動機と目的

  • 既存の人間によるアノテート済み政治的政令文書を用いて、文単位の政治的ディス course 分類器を開発すること。
  • CNNにさまざまな事前学習済み単語埋め込み表現(Word2Vec、GloVe、ELMo、BERT)を用いた政治的テキスト分類における性能を評価すること。
  • 政令文書で事前学習した分類器が、追加のトレーニングなしに、異なる政治的テキストドメイン(COVID-19報道ブリーフィング)を分類するために効果的に転送可能かどうかを調査すること。
  • 異なる政治的テキストタイプ間で、転移学習の一般化能力が政治的ディス course 分析に与える影響を評価すること。

提案手法

  • マニュアルでアノテートされた英語の政治的政令文書(Manifestos Project)を用いて、ローカルトピック畳み込みニューラルネットワーク(CNN)を訓練した。
  • CNNの入力表現として、4種類の事前学習済み単語埋め込みモデル(Word2Vec、GloVe、ELMo、BERT)を用いた。
  • 同じ事前学習済みCNNモデルを、政令文書のトレーニングデータのみを用いて、微調整なしでCOVID-19報道ブリーフィングコーパスに直接適用した。
  • CNNの性能を、各埋め込みタイプについて、政令文書および報道ブリーフィングコーパスの両方で比較するための4つの実験を実施した。
  • 過学習を防ぐために、ホールドアウトされた開発セットとテストセットを用いて、堅牢な評価を実施した。
  • 両ドメインにおける性能を比較するために、正確性とF1スコアを用いてモデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1政令文書でトレーニングされたCNN分類器が、追加のトレーニングなしに、COVID-19報道ブリーフィングのような異なる政治的テキストドメインの文を効果的に分類できるか?
  • RQ2CNNが異なる事前学習済み単語埋め込み表現(Word2Vec、GloVe、ELMo、BERT)と組み合わされた場合、政治的ディス course 分類において性能がどのように変化するか?
  • RQ3文脈を考慮した埋め込み表現(例:BERT)を用いることで、非文脈的埋め込み表現に比べて、政治的テキスト分類タスクにおける分類性能が顕著に向上するか?
  • RQ4政令文書と報道ブリーフィングの間のドメインシフトが、ゼロショット転移学習アプローチの性能にどの程度影響を与えるか?

主な発見

  • BERT+CNNモデルは、政治的政令文書コーパスで最も高い正確性(87.52%)とF1スコア(74.68%)を達成し、Word2Vec、GloVe、ELMoを用いたモデルを顕著に上回った。
  • COVID-19報道ブリーフィングコーパスでは、BERT+CNNモデルが68.65%の正確性と64.58%のF1スコアを達成し、強力なゼロショット転送性能を示した。
  • ELMo+CNNは良好な性能を示し、政令文書で72.84%の正確性、報道ブリーフィングで60.74%の正確性を達成し、非トランスフォーマー埋め込みの中では優れた性能を示した。
  • BERT+CNNと他のモデルとの性能差は、報道ブリーフィングコーパスにおいて最も顕著であり、BERTのドメインシフトに対する頑健性を強調している。
  • 結果から、事前学習済みBERT埋め込み表現が、政令文書から報道ブリーフィングへの効果的なゼロショットドメイン転送を可能にし、新たなドメインにおける高コストな手動アノテーションの必要性を低減できることを確認した。
  • 本研究は、専門家がアノテートした政令文書をトレーニングデータとして用いた転移学習が、多様な政治的ディス course テキストを分類するための実用的でスケーラブルなアプローチであることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。