[論文レビュー] The Pushshift Reddit Dataset
この論文では、2005年から2019年までの間、56億件を超えるRedditのコメントと6億5100万件の投稿を含む、継続的に更新され、公開されているデータセット「Pushshift Reddit Dataset」を紹介する。研究者らはリアルタイムのAPIアクセス、全文検索、集計ツール、およびインタラクティブな分析を可能にするSlackbotを利用でき、データ収集の時間的・技術的負担が著しく軽減され、Post-API時代における再現可能で大規模なソーシャルメディア研究を可能にする。
Social media data has become crucial to the advancement of scientific understanding. However, even though it has become ubiquitous, just collecting large-scale social media data involves a high degree of engineering skill set and computational resources. In fact, research is often times gated by data engineering problems that must be overcome before analysis can proceed. This has resulted recognition of datasets as meaningful research contributions in and of themselves. Reddit, the so called "front page of the Internet," in particular has been the subject of numerous scientific studies. Although Reddit is relatively open to data acquisition compared to social media platforms like Facebook and Twitter, the technical barriers to acquisition still remain. Thus, Reddit's millions of subreddits, hundreds of millions of users, and hundreds of billions of comments are at the same time relatively accessible, but time consuming to collect and analyze systematically. In this paper, we present the Pushshift Reddit dataset. Pushshift is a social media data collection, analysis, and archiving platform that since 2015 has collected Reddit data and made it available to researchers. Pushshift's Reddit dataset is updated in real-time, and includes historical data back to Reddit's inception. In addition to monthly dumps, Pushshift provides computational tools to aid in searching, aggregating, and performing exploratory analysis on the entirety of the dataset. The Pushshift Reddit dataset makes it possible for social media researchers to reduce time spent in the data collection, cleaning, and storage phases of their projects.
研究の動機と目的
- プラットフォームのAPI制限やプライバシー問題の深刻化により、研究者が大規模なソーシャルメディアデータにアクセスすることが難しくなっているという課題に対処すること。
- ソーシャルメディア研究におけるデータ収集、クリーニング、保存に伴う時間的・技術的負担を軽減すること。
- 公式プラットフォームAPIの代替として持続可能でオープンかつスケーラブルな第三者データリポジトリを提供し、機能を強化すること。
- 歴史的なRedditデータを広く提供し、高度なクエリおよび分析ツールを備えることで、計算的社会科学における再現可能性とアクセシビリティを支援すること。
- 制限付きまたは廃止されたプラットフォームAPIに依存せずに、嫌がらせ、過激化、メンタルヘルス、誤情報といった現象を、多様な分野の研究者が研究できるようにすること。
提案手法
- Pushshiftは2015年以降、Redditの創設時から継続的にデータを収集し、投稿およびコメントの包括的なアーカイブを維持している。
- データは毎月更新されるデータダムとしてhttps://files.pushshift.io/reddit/にホスティングされ、長期的なアクセス性が保証されている。
- リアルタイムで検索可能なAPIにより、研究者が大規模なファイルをダウンロードせずに、全データセットをクエリできるようになっている。これにより、ストレージや計算リソースの要件が低減される。
- APIはコメントおよび投稿の全文検索をサポートし、要約統計のための集計エンドポイントを備えており、RedditのネイティブAPIよりも5倍大きいクエリ制限(1回のリクエストあたり最大500オブジェクト)を提供している。
- Slackbot統合により、研究者がSlack内で直接データクエリを実行し、即座に可視化を生成できるようになり、共同作業や探索的分析が促進される。
- データエンジニアリングの低レベルタスクを抽象化するツールを提供することで、研究者が分析や仮説検証に集中できるよう、再現可能な研究を支援している。
実験結果
リサーチクエスチョン
- RQ1研究者がレート制限や廃止された公式APIに依存せずに、大規模かつ歴史的なRedditデータを効率的にアクセス・分析するにはどうすればよいか?
- RQ2持続可能でオープンかつスケーラブルなソーシャルメディアデータ共有を学術的リサーチに実現するための技術的・インfra構成要件は何か?
- RQ3第三者データプラットフォームが、計算リソースや技術的熟練度に制限のある研究者にとっての参入障壁をどれほど低減できるか?
- RQ4リアルタイムAPIアクセス、全文検索、インタラクティブツールを提供することで、計算的社会科学研究の再現性と効率性はどのように向上するか?
- RQ5Pushshiftのようなコミュニティ主導のデータプラットフォームは、嫌がらせ、メンタルヘルス、誤情報といった感受性の高いトピックに関する学際的リサーチを、どのような形で支援できるか?
主な発見
- Pushshift Reddit Datasetには、2005年のReddit創設時から2019年までに収集された6億5100万件の投稿と56億件のコメントが含まれており、包括的な歴史的アーカイブを形成している。
- データはリアルタイムで検索可能なAPIを通じて提供されており、ローカルストレージを必要とせずに、効率的なクエリが可能である。
- PushshiftのAPIは、RedditのネイティブAPIよりも5倍大きいクエリ制限を備えており、1回のリクエストでより多くのデータを一度に取得できる。
- 研究者がクエリを実行し、即座に可視化を生成できるSlackbotが提供されており、共同分析の質が向上している。
- 100篇を超える査読済み学術論文が、さまざまな分野でPushshift Reddit Datasetを活用しており、その有用性と信頼性が裏付けられている。
- データセットおよび関連ツールのおかげで、データ収集、クリーニング、保存に要する時間的・技術的負担が著しく軽減され、研究者が分析や仮説検証に集中できるようになっている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。