[論文レビュー] ClimateNLP: Analyzing Public Sentiment Towards Climate Change Using Natural Language Processing
本稿では、気候変動関連のツイートで微調整されたドメイン特化型BERTモデルであるClimateBERTを用いて、気候変動に関する世論の感情分析フレームワークを提案する。バランスの取れたデータセットを用い、ランダムフォレストを適用することで、85.22%の正解率と85.73%の適合率を達成しており、専用言語モデルが気候変動議論分析において一般モデルを上回ることを示している。
Climate change's impact on human health poses unprecedented and diverse challenges. Unless proactive measures based on solid evidence are implemented, these threats will likely escalate and continue to endanger human well-being. The escalating advancements in information and communication technologies have facilitated the widespread availability and utilization of social media platforms. Individuals utilize platforms such as Twitter and Facebook to express their opinions, thoughts, and critiques on diverse subjects, encompassing the pressing issue of climate change. The proliferation of climate change-related content on social media necessitates comprehensive analysis to glean meaningful insights. This paper employs natural language processing (NLP) techniques to analyze climate change discourse and quantify the sentiment of climate change-related tweets. We use ClimateBERT, a pretrained model fine-tuned specifically for the climate change domain. The objective is to discern the sentiment individuals express and uncover patterns in public opinion concerning climate change. Analyzing tweet sentiments allows a deeper comprehension of public perceptions, concerns, and emotions about this critical global challenge. The findings from this experiment unearth valuable insights into public sentiment and the entities associated with climate change discourse. Policymakers, researchers, and organizations can leverage such analyses to understand public perceptions, identify influential actors, and devise informed strategies to address climate change challenges.
研究の動機と目的
- ソーシャルメディアのデータを用いた自然言語処理により、気候変動に対する世論の感情を分析すること。
- 特にClimateBERTを含むドメイン特化型事前学習言語モデルが、気候変動議論における感情分類にどの程度有効であるかを評価すること。
- さまざまなNLPモデルと特徴量抽出技術(例:TF-IDF、CountVectorizer、word2vec)を組み合わせた、従来の機械学習分類器との性能比較を行うこと。
- 気候変動に関する世論の議論から、主要なエンティティと感情パターンを特定し、政策立案やコミュニケーション戦略の支援を行うこと。
- 気候関連テキストにおける感情分析の再現可能なフレームワークを提供することで、環境および公衆衛生分野におけるNLP応用の発展に貢献すること。
提案手法
- 気候変動関連のドキュメントで事前学習されたドメイン適応型BERTモデル、ClimateBERTを、ツイッターのデータに対して感情分類用に微調整する。
- 気候変動関連ツイートのデータセットを前処理およびバランス化し、ノイズを除去し、モデル入力用にテキストを標準化する。
- 従来のNLP特徴量(TF-IDF、CountVectorizer、word2vec)と機械学習分類器(ランダムフォレスト、SVM、決定木、ロジスティック回帰)を組み合わせる。
- 標準的なNLP指標(正解率、適合率、再現率、F1スコア)を用い、保留テストセット上で複数のモデルを訓練および評価する。
- 2段階のパイプラインを採用:まずTwitter APIを用いたデータ収集を行い、その後5分割交差検証を用いてモデルの訓練と評価を実施する。
- F1スコアとバランス正解率に基づき、感情クラス全体にわたる耐性を確保するため、最も優れた性能を示したモデル構成を選定する。

実験結果
リサーチクエスチョン
- RQ1一般向けモデルと比較して、ClimateBERTはソーシャルメディアのテキストにおける気候変動に関する世論の感情分類にどの程度効果的か。
- RQ2TF-IDF、CountVectorizer、word2vecなどの特徴抽出技術と、機械学習分類器の組み合わせの中で、気候変動議論における感情分類で最も高い性能を発揮するのはどれか。
- RQ3Twitterにおける気候変動議論で顕著な感情パターンと関連する主要なエンティティは何か。
- RQ4従来のNLP手法と、ClimateBERTのような微調整済みトランスフォーマー型モデルの間で、気候関連コンテンツの感情分析において性能にどのような差があるか。
- RQ5気候変動に関する世論の感情分析は、政策立案者や公衆衛生担当者にとって実用的なインサイトを提供できるか。
主な発見
- ランダムフォレスト分類器を用いて微調整したClimateBERTは、テストされたすべてのモデルの中で最高の正解率(85.22%)と適合率(85.73%)を達成した。
- TF-IDFとCountVectorizerの組み合わせは、ランダムフォレストを用いることでF1スコア86.87%を達成し、他の特徴量の組み合わせを上回った。
- 一般向けBERTモデルは性能が低く、SVMではF1スコアがたった63.70%にとどまり、ドメイン適応なしでは気候変動特化型の感情分類タスクへの汎用性が限られると示された。
- 従来モデルの中で、ランダムフォレストは、すべての指標においてSVM、決定木、ロジスティック回帰を上回り、特にClimateBERT埋め込み表現を用いた場合に顕著だった。
- ClimateBERT埋め込み表現を用いて訓練したモデルは、ポジティブな感情に対して再現率85.22%を達成しており、気候変動に賛同する世論を強く特定できる能力を示している。
- 本研究は、ドメイン特化型事前学習が気候関連テキストにおける感情分類性能を顕著に向上させることを確認しており、ClimateBERTが環境分野のNLPタスクにおいて実用的であることを裏付けた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。