Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment Analysis with R: Natural Language Processing for Semi-Automated Assessments of Qualitative Data

Dennis Klinkhammer|arXiv (Cornell University)|Jun 25, 2022
Computational and Text Analysis Methods被引用数 4
ひとこと要約

本チュートリアルでは、自然言語処理(NLP)技術を用いてRで半自動的センチメント分析を実行する実用的で再現可能なワークフローを提示する。研究者がソーシャルメディアのコメント、政治的演説、書籍などの質的テキストデータにおけるセンチメントおよび感情状態を、センチメント・レキシコンとtidytext、dplyr、ggplot2などのRパッケージを活用して、効率的に分類できるようにする。実証結果では、時間経過に伴う議論内でのセンチメントの変化が検出可能であり、評価者間信頼性が一貫していることが示された。

ABSTRACT

Sentiment analysis is a sub-discipline in the field of natural language processing and computational linguistics and can be used for automated or semi-automated analyses of text documents. One of the aims of these analyses is to recognize an expressed attitude as positive or negative as it can be contained in comments on social media platforms or political documents and speeches as well as fictional and nonfictional texts. Regarding analyses of comments on social media platforms, this is an extension of the previous tutorial on semi-automated screenings of social media network data. A longitudinal perspective regarding social media comments as well as cross-sectional perspectives regarding fictional and nonfictional texts, e.g. entire books and libraries, can lead to extensive text documents. Their analyses can be simplified and accelerated by using sentiment analysis with acceptable inter-rater reliability. Therefore, this tutorial introduces the basic functions for performing a sentiment analysis with R and explains how text documents can be analysed step by step - regardless of their underlying formatting. All prerequisites and steps are described in detail and associated codes are available on GitHub. A comparison of two political speeches illustrates a possible use case.

研究の動機と目的

  • Rを用いた質的テキストデータに対するセンチメント分析を、再現可能で段階的なチュートリアルとして提供すること。
  • 研究者がソーシャルメディア、政治的演説、書籍など多様なテキスト形式に、基本的および高度なセンチメント分析技術を適用できるようにすること。
  • センチメント分析が、許容可能な評価者間信頼性を伴いながら、質的データコーディングの効率性と信頼性を向上させることを示すこと。
  • GitHubを介して完全なRコードとパッケージ依存関係を提供することで、研究手法の透明性を高めること。
  • 政治的議論における時間的変化に伴うセンチメントおよび感情状態の変化を検出するなど、実用的な応用事例を提示すること。

提案手法

  • センチメント分析の主な環境として、R MarkdownとRプログラミング言語を採用する。
  • テキストデータを分析可能な単位に分解するため、tidytextパッケージを用いてトークン化および処理を行う。
  • 特にNRC語-感情連関レキシコンを用いて、語をセンチメント極性(肯定的、否定的)および8つの感情状態(例:恐怖、怒り、信頼、喜び)に分類する。
  • dplyrを用いて、テキストセグメントごとのセンチメントスコアをフィルタリング、グループ化、要約するデータ操作を実施する。
  • ggplot2を用いて、センチメントのトレンドを可視化し、センチメント分布、条件付き平均、時間的またはテキストセクションごとのスコア変化を追跡する。
  • テキストをTXT形式に統一して前処理するため、PDFやHTMLなどの非-TXT形式のテキストを事前にTXT形式に変換する。

実験結果

リサーチクエスチョン

  • RQ1Rを用いたセンチメント分析は、政治的演説やソーシャルメディアのコメントといった多様な質的テキストデータにおけるセンチメントおよび感情状態を、どのように半自動的に評価できるか?
  • RQ2手動コーディングと比較して、半自動的センチメント分析はどの程度許容可能な評価者間信頼性を達成できるか?
  • RQ3政治的演説の異なるセクションにおいて、センチメントおよび感情状態の分布はどのように変化し、それらの変化が何を示唆するか?
  • RQ4センチメント分析は、書籍や図書館全体のような長文テキストにおいても意味のあるパターンを検出できるか?また、ソーシャルメディア投稿のような短文コンテンツと比較して、その特徴は何か?
  • RQ5センチメント分析は、デジタルディス course における過激化、政治的センチメント、公衆衛生上の懸念といった社会的問題を特定する上で、実用的にどの程度有効か?

主な発見

  • 半自動的センチメント分析は、評価者間信頼性が最大で70%に達し、これは手動コーディングでも研究者間で約20%の不一致が生じるのと比較しても許容可能な水準である。
  • 2つの政治的演説の比較から、肯定的および否定的センチメントが比較的同程度に使用されていたが、恐怖と怒りが顕著に強く、全体として否定的なセンチメントトーンであることが示された。
  • 信頼の感情状態が、恐怖や怒りといった否定的 emotions と相殺する傾向にあり、政治的議論における複雑な感情的状況が浮き彫りになった。
  • センチメントスコアは、政治的演説の中核部でわずかに上昇しており、トーンや訴えの戦略的転換が行われた可能性を示唆している。
  • この手法は、センチメントトレンドにおける転換点や鞍点を効果的に特定でき、研究者が重要な文や段落を深く質的検証するための対象として容易に特定できるようになった。
  • このワークフローは、大規模なテキストコーパスの分析を著しく高速化しつつ、分析の厳密性を維持でき、縦断的および横断的テキスト分析の両方において適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。