[論文レビュー] Public Opinion Polling with Twitter
本論文では、公共のTwitterデータのセンチメント分析を、従来の回答依頼型の世論調査とは異なり、リアルタイムで高分解能な代替手段として提案している。10,000語以上の頻出語についての日々のセンチメントトレンドを分析することで、Twitterベースのアンビエント・ハッピネス(周囲の幸福度)が、確立された世論調査と強く相関しており、大統領の評価や消費者感情の予測を最大3か月前倒しで行えることが示された。
Solicited public opinion surveys reach a limited subpopulation of willing participants and are expensive to conduct, leading to poor time resolution and a restricted pool of expert-chosen survey topics. In this study, we demonstrate that unsolicited public opinion polling through sentiment analysis applied to Twitter correlates well with a range of traditional measures, and has predictive power for issues of global importance. We also examine Twitter's potential to canvas topics seldom surveyed, including ideas, personal feelings, and perceptions of commercial enterprises. Two of our major observations are that appropriately filtered Twitter sentiment (1) predicts President Obama's job approval three months in advance, and (2) correlates well with surveyed consumer sentiment. To make possible a full examination of our work and to enable others' research, we make public over 10,000 data sets, each a seven-year series of daily word counts for tweets containing a frequently used search term.
研究の動機と目的
- Twitterのセンチメントを用いた、回答依頼型の世論調査とは異なり、信頼性が高く、コストが高く、分解能が低い従来の調査とは対照的に、非自発的で公開された世論調査が、代替手段として有効かどうかを評価すること。
- Twitterのセンチメントが、ギャラップ調査や消費者感情指数といった確立された世論調査指標と相関しているかどうかを調査すること。
- Twitterが、政治的でもグローバルでもないテーマ、例えば個人の感情、商業的ブランド、中立的な概念についての世論を追跡する可能性を調査すること。
- Twitterのセンチメントが、将来的な調査結果、特に職務評価や市場感情の予測にどれほど予測力を持つのかを評価すること。
- 10,000語以上の頻出語についての1日ごとのセンチメント時系列データを公開することで、オープンサイエンスを推進し、再現可能性とさらなる研究を支援すること。
提案手法
- 研究では、ラボMT語集に基づくセンチメント分析を用い、Wikipedia や Amazon Mechanical Turk からの人間によるセンチメントデータを用いて、10,222語の頻出英単語にセンチメントスコアを割り当てた。
- 10,222語のそれぞれについて、7年間(2008–2015年)にわたる全ツイートにその語が含まれる場合のセンチメントスコアを集計し、1日ごとのセンチメント時系列を算出している。
- センチメントトレンドは、日次、週次、月次、年次の複数の時間分解能で分析され、低頻度の調査データとの比較が可能になっている。
- 語のシフト分析を適用し、時間経過に伴う全体のセンチメント変化を引き起こす語やフレーズを同定している。
- 相関分析を用いて、外部の調査データ(例:ギャラップ、消費者感情指数)とTwitterのセンチメントトレンドを比較し、予測力の検証のためにラグ付き相関を用いている。
- 本研究では、Twitterのセンチメントが世論の代理指標として有効であるかを検証するため、Google Correlate や RACCOON を比較ツールとして用いている。
実験結果
リサーチクエスチョン
- RQ1リアルタイムで抽出された、公共のTwitter投稿からのセンチメントが、従来の回答依頼型の世論調査とどの程度相関しているか。
- RQ2Twitterのセンチメントは、大統領の評価や消費者感情といった将来的な調査結果を予測できるか。
- RQ3Twitterのセンチメントは、個人の感情、商業的ブランド、中立的な概念といった政治的でもグローバルでもないテーマの世論をどの程度反映しているか。
- RQ4一時的な出来事、ウイルス的コンテンツ、ボット活動が、Twitter上のセンチメント信号を歪める役割を果たすか。
- RQ5Twitterのセンチメントの時間分解能は、従来の世論調査の低分解能なサンプリングと比較して、予測にどのような影響を及えるか。
主な発見
- Twitterのセンチメントは、オバマ大統領の評価についてギャラップの調査結果と強く相関しており、Twitterデータを最大3か月遅延させた場合に相関が高まることが示され、予測力が裏付けられた。
- 本研究では、Twitterのセンチメントから得られるアンビエント・ハッピネスが、公式の消費者感情指数とよく一致しており、市場分析における実用性が示された。
- Twitterのセンチメントは、特定の語(例:'love'、'feel')のセンチメントトレンドが、より広範なセンチメント変化の感情的要因を明らかにすることができ、従来の調査では固定された回答選択肢があるため、これを実現できない。
- 分析の結果、Twitterにおける企業関連のセンチメントが、世論の認識を反映しており、売上業績の予測や改善に利用できる可能性があることが明らかになった。
- 頻出語の10,000以上の1日ごとのセンチメント時系列データが公開され、再現性とさらなる研究を可能にした。
- ボット活動、皮肉、サンプルバイアスといった制限があるものの、Twitterのセンチメントは、従来の調査とは対照的に、特に従来の方法ではあまり調査されないテーマに対して、価値ある高分解能な補完的手段を提供している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。