Skip to main content
QUICK REVIEW

[論文レビュー] Visual and Predictive Analytics on Singapore News: Experiments on GDELT, Wikipedia, and ^STI

Clifton Phua, Yuzhang Feng|arXiv (Cornell University)|Apr 8, 2014
Computational and Text Analysis Methods参考文献 6被引用数 4
ひとこと要約

本論文は、GDELTのイベントレベルニュースデータを予測分析用の時系列データセットに変換するための新規特徴工学的手法を提案する。この手法を用いて、シンガポールのストレーツ・タイムズ・インデックス(^STI)の予測に応用した。視覚的分析と意思決定木を用いて、2013年の東南アジアスモッグやリトル・インディア暴動といった主要な出来事の市場への影響を、高い時間分解能と現実の出来事との強い整合性をもって検出・予測できることを示した。

ABSTRACT

The open-source Global Database of Events, Language, and Tone (GDELT) is the most comprehensive and updated Big Data source of important terms extracted from international news articles . We focus only on GDELT's Singapore events to better understand the data quality of its news articles, accuracy of its term extraction, and potential for prediction. To test news completeness and validity, we visually compared GDELT (Singapore news articles' terms from 1979 to 2013) to Wikipedia's timeline of Singaporean history. To test term extraction accuracy, we visually compared GDELT (CAMEO codes and TABARI system of extraction from Singapore news articles' text from April to December 2013) to SAS Text Miner's term and topic extraction. To perform predictive analytics, we propose a novel feature engineering method to transform row-level GDELT from articles to a user-specified temporal resolution. For example, we apply a decision tree using daily counts of feature values from GDELT to predict Singapore stock market's Straits Times Index (^STI). Of practical interest from the above results is SAS Visual Analytics' ability to highlight the various impacts of June 2013 Southeast Asian haze and December 2013 Little India riot on Singapore. Although Singapore is unique as a sovereign city-state, a leading financial centre, has strong international influence, and consists of a highly multi-cultural population, the visual and predictive analytics reported here are highly applicable to another country's GDELT data.

研究の動機と目的

  • 視覚的および比較的分析手法を用いて、GDELTのシンガポールニュース報道のデータ品質と完全性を評価すること。
  • 人為的にアノテートされたデータソースおよびSAS Text Minerと比較することで、GDELTの用語および出来事抽出(CAMEOおよびTABARI)の正確性を評価すること。
  • ユーザーが指定した時間分解能に応じてGDELTの出来事データを集約する、新規の特徴工学的手法を開発すること。
  • 時間的集約と特徴工学を用いて、GDELTの出来事特徴に基づき1日遅れでストレーツ・タイムズ・インデックス(^STI)を予測する予測分析を適用すること。
  • 視覚的分析ツールを用いて、GDELTが実際に発生した経済的および社会的影響を検出・予測する実用的価値を示すこと。

提案手法

  • ユーザーが指定した時間分解能(例:1日単位)に応じて、行単位のGDELTの出来事データを時間的に集約した特徴に変換する特徴工学アルゴリズム(アルゴリズム1)を提案する。
  • 名目変数については、各固有値ごとにバイナリインジケータ変数を生成し、欠損値に対しても別個の変数を設け、各時間単位における出現回数を数える。
  • 数値変数については、区間等分(等間隔または等頻度)を適用し、各ビンごとに変数を生成し、欠損値に対しても別個の変数を設ける。
  • エンジニアリングされた特徴を、^STIインデックスの1日遅れの調整済み終値と結合して、教師あり学習用のデータセットを構築する。
  • 時間的集約と特徴工学を用いて、GDELTの出来事特徴に基づき、翌日の^STI価格を予測する意思決定木アルゴリズムを適用する。
  • SAS Visual Analyticsを用いてインタラクティブな視覚的探索を実施し、SAS Text Minerを用いてGDELTのCAMEOおよびTABARI出力との比較により、用語およびトピック抽出の正確性を検証する。

実験結果

リサーチクエスチョン

  • RQ1GDELTのシンガポールニュースデータは、過去の主要な出来事の理解と可視化にどの程度活用可能か?
  • RQ2Wikipedia や手動テキスト分析といった基準データソースと比較して、GDELTの用語および出来事抽出(CAMEOおよびTABARI)の正確性はどの程度か?
  • RQ3GDELTデータは、政治的要因以外の結果(例:株価の変動)を予測する機械学習データセットに効果的に変換可能か?
  • RQ4リーマン・タイムズ・インデックス(^STI)の変化を予測する上で、特定のGDELT特徴はどのようなものか?特に社会的・政治的出来事の際の特徴。
  • RQ5視覚的分析ツールは、2013年の東南アジアスモッグやリトル・インディア暴動といった出来事の経済的・社会的影響を効果的に浮き彫りにできるか?

主な発見

  • GDELTのシンガポールニュース報道は包括的ではあるが、すべての分析的目的に対して完全に有効とは限らず、一部の記事は主要な出来事とは関連がない。
  • Wikipediaのタイムラインとの視覚的比較により、GDELTが2013年のスモッグやリトル・インディア暴動といった主要な出来事を、強い時間的整合性をもって捉えていることが確認された。
  • GDELTのCAMEOおよびTABARIによる用語抽出は妥当な正確性を示したが、事前にコード化された出来事以外のインサイト抽出を高めるために、追加の自然言語処理技術の活用が有効である。
  • 提案された特徴工学アルゴリズムにより、GDELTの出来事レベルデータが予測モデリングに適した日次時系列形式に成功して変換された。
  • スモッグ期間(2013年6月13日〜27日)では、予測力の高い上位3つの特徴は、ActionGeo_Fullname = Toa Payoh, Singapore および Geylang であり、地域的ニュースの影響を示した。
  • リトル・インディア暴動期間(2013年12月8日〜22日)では、予測力の高い上位3つの特徴は、Actor1CountryCode = Pakistan、mainURL = zeenews.india.com、ActionGeo_CountryCode = Singapore であり、メディア主導の報道パターンを反映していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。