[논문 리뷰] The Pushshift Reddit Dataset
이 논문은 2005년에서 2019년까지 56억 개가 넘는 Reddit 댓글과 6억 5100만 개의 제출물을 포함한, 지속적으로 업데이트되는 공개 접근이 가능한 Pushshift Reddit 데이터셋을 소개한다. 연구자들은 실시간 API 접근, 전체 텍스트 검색, 집계 도구, 그리고 상호작용 분석을 위한 Slack봇을 활용할 수 있으며, 이는 데이터 수집의 시간과 기술적 부담을 크게 줄여주고, API 이후 시대의 재현 가능하고 대규모 사회적 미디어 연구를 가능하게 한다.
Social media data has become crucial to the advancement of scientific understanding. However, even though it has become ubiquitous, just collecting large-scale social media data involves a high degree of engineering skill set and computational resources. In fact, research is often times gated by data engineering problems that must be overcome before analysis can proceed. This has resulted recognition of datasets as meaningful research contributions in and of themselves. Reddit, the so called "front page of the Internet," in particular has been the subject of numerous scientific studies. Although Reddit is relatively open to data acquisition compared to social media platforms like Facebook and Twitter, the technical barriers to acquisition still remain. Thus, Reddit's millions of subreddits, hundreds of millions of users, and hundreds of billions of comments are at the same time relatively accessible, but time consuming to collect and analyze systematically. In this paper, we present the Pushshift Reddit dataset. Pushshift is a social media data collection, analysis, and archiving platform that since 2015 has collected Reddit data and made it available to researchers. Pushshift's Reddit dataset is updated in real-time, and includes historical data back to Reddit's inception. In addition to monthly dumps, Pushshift provides computational tools to aid in searching, aggregating, and performing exploratory analysis on the entirety of the dataset. The Pushshift Reddit dataset makes it possible for social media researchers to reduce time spent in the data collection, cleaning, and storage phases of their projects.
연구 동기 및 목표
- 플랫폼의 API 제한 및 개인정보 유출 사고로 인해 연구자들이 대규모 사회적 미디어 데이터에 접근하는 데 점점 더 어려움을 겪고 있는 문제를 해결하기 위해.
- 사회적 미디어 연구에서 데이터 수집, 정제, 저장과 관련된 시간과 기술적 부담을 줄이기 위해.
- 공식 플랫폼 API의 대안으로 신뢰할 수 있는 제3자 데이터 레포지터리로서 지속 가능하고 개방적이며 확장 가능한 대안을 제공하기 위해.
- 역사적 Reddit 데이터를 고급 쿼리 및 분석 도구와 함께 널리 공개함으로써, 계산 기반 사회과학 분야의 재현 가능성과 접근 가능성을 높이기 위해.
- 제한되거나 기능이 중단된 플랫폼 API에 의존하지 않고도, 다양한 분야의 연구자들이 혐오 발언, 극단화, 정신 건강, 오락행성 등의 현상을 연구할 수 있도록 지원하기 위해.
제안 방법
- Pushshift는 2015년 이래 실시간으로 Reddit 데이터를 수집하여, Reddit 창립 이래의 제출물과 댓글을 포괄하는 완전한 아카이브를 유지한다.
- 데이터셋은 https://files.pushshift.io/reddit/에 매월 데이터 덤프로 배포되어 장기적인 접근성을 확보한다.
- 실시간으로 검색 가능한 API를 통해 연구자들이 큰 파일을 다운로드하지 않고도 전체 데이터셋에 접근할 수 있으며, 이는 스토리지 및 계산 자원 요구를 줄여준다.
- API는 댓글과 제출물 전반에 걸친 전체 텍스트 검색, 요약 통계를 위한 집계 엔드포인트를 지원하며, Reddit의 공식 API보다 훨씬 높은 쿼리 제한(최대 500개의 객체를 한 번에 요청 가능)을 제공한다.
- Slack봇 통합 기능을 통해 연구자들은 Slack 내에서 실시간으로 데이터 쿼리와 시각화 생성을 수행할 수 있어 협업 및 탐색적 분석을 강화한다.
- 플랫폼은 저수준의 데이터 엔지니어링 작업을 추상화하는 도구를 제공함으로써 재현 가능한 연구를 지원하며, 연구자들이 분석과 가설 검증에 집중할 수 있도록 돕는다.
실험 결과
연구 질문
- RQ1연구자들이 제한된 요청 속도나 기능이 중단된 공식 API에 의존하지 않고, 대규모 역사적 Reddit 데이터를 효율적으로 접근하고 분석할 수 있는 방법은 무엇인가?
- RQ2지속 가능하고 개방적이며 확장 가능한 사회적 미디어 데이터 공유를 위한 학술 연구를 뒷받침하기 위해 필요한 기술적 및 인프라 구성 요소는 무엇인가?
- RQ3제한된 컴퓨팅 자원이나 기술 전문 지식을 가진 연구자들이 접근 장벽을 줄이기 위해 제3자 데이터 플랫폼이 얼마나 기여할 수 있는가?
- RQ4실시간 API 접근, 전체 텍스트 검색, 상호작용 도구를 제공함으로써 계산 기반 사회과학 연구의 재현 가능성과 효율성은 어떻게 향상되는가?
- RQ5Pushshift와 같은 커뮤니티 기반 데이터 플랫폼은 혐오 발언, 정신 건강, 오락행성과 같은 민감한 주제에 대한 다학제적 연구를 어떻게 지원할 수 있는가?
주요 결과
- Pushshift Reddit 데이터셋은 2005년 Reddit 창립 이래 2019년까지 수집된 6억 5100만 개의 제출물과 56억 개의 댓글을 포함하며, 포괄적인 역사적 아카이브를 제공한다.
- 연구자들이 로컬 데이터 스토리지가 필요 없이 전체 텍스트 검색과 집계를 지원하는 실시간 검색 가능한 API를 통해 데이터셋에 접근할 수 있다.
- Pushshift의 API는 Reddit 공식 API보다 5배 높은 쿼리 제한을 제공하여 연구자들이 더 큰 데이터 블록을 더 적은 요청 수로 검색할 수 있다.
- 연구자들이 실시간으로 쿼리 실행과 시각화 생성이 가능한 Slack봇을 제공함으로써 협업 분석을 강화한다.
- 100편이 넘는 심사 통과된 학술 논문이 다양한 분야에서 Pushshift Reddit 데이터셋을 이미 활용하여 그 유용성과 신뢰성을 입증했다.
- 데이터셋과 관련된 도구들은 데이터 수집, 정제, 스토리지에 소요되는 시간과 기술적 노력이 크게 줄어들게 하여 연구자들이 분석과 가설 검증에 집중할 수 있도록 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.