[논문 리뷰] TGDataset: Collecting and Exploring the Largest Telegram Channels Dataset
이 논문은 지금까지 공개된 바 있는 바이어블리 가장 큰 텔레그램 채널 컬렉션인 TGDataset를 소개한다. 이 데이터셋은 120,979개의 채널과 4억 건 이상의 메시지를 포함하고 있다. 180개의 시드 채널에서 시작하여 스노우볼 샘플링 방법을 사용해 다국어 콘텐츠를 수집하고 분석한 결과, 음모론, 극단주의 이데올로기, 경계선 콘텐츠가 널리 퍼져 있음을 확인했으며, 이는 텔레그램에서의 오락성 및 플랫폼 역학 연구에 중요한 자원이 된다.
Telegram is one of the most popular instant messaging apps in today's digital age. In addition to providing a private messaging service, Telegram, with its channels, represents a valid medium for rapidly broadcasting content to a large audience (COVID-19 announcements), but, unfortunately, also for disseminating radical ideologies and coordinating attacks (Capitol Hill riot). This paper presents the TGDataset, a new dataset that includes 120,979 Telegram channels and over 400 million messages, making it the largest collection of Telegram channels to the best of our knowledge. After a brief introduction to the data collection process, we analyze the languages spoken within our dataset and the topic covered by English channels. Finally, we discuss some use cases in which our dataset can be extremely useful to understand better the Telegram ecosystem, as well as to study the diffusion of questionable news. In addition to the raw dataset, we released the scripts we used to analyze the dataset and the list of channels belonging to the network of a new conspiracy theory called Sabmyk.
연구 동기 및 목표
- 학술 연구를 위한 텔레그램 채널에 관한 대규모 공개 데이터셋의 부족을 보완하기 위해.
- 다양한 언어와 주제에 걸쳐 공개 텔레그램 채널의 포괄적인 데이터셋을 수집하고 특성화하기 위해.
- 텔레그램에서 음모론, 극단주의 이데올로기, 불법 활동과 같은 논란의 콘텐츠가 얼마나 널리 퍼져 있는지 조사하기 위해.
- 연구자들이 오락성 및 플랫폼 진화를 연구할 수 있도록 재현 가능하고 오픈소스 데이터셋과 분석 도구를 제공하기 위해.
- 텔레그램이 콘텐츠 유포 및 커뮤니티 형성에 미치는 영향을 종단적 및 다국어적 관점에서 연구할 수 있도록 하기 위해.
제안 방법
- 메시지 포워딩을 통해 연결된 채널을 반복적으로 탐색하는 스노우볼 샘플링 기법을 사용해 180개의 시드 텔레그램 채널에서 출발하여 데이터를 수집했다.
- 제목, 사용자명, 설명, 구독자 수, 생성 일자, 메시지 내용 등 공개 채널 메타데이터를 수집했다.
- 자동화된 언어 탐지 기법을 적용하여 데이터셋 내 채널에서 주로 사용된 언어를 파악했다.
- 주로 영어 채널을 대상으로 주제 모델링과 수동 레이블링을 수행하여 주요 주제와 커뮤니티를 식별했다.
- 원본 데이터셋, 분석 스크립트, 레이블링된 데이터(언어 및 주제)를 오픈소스 자원으로 공개했다.
- 윤리 기준을 준수하고 저작권 또는 성인 콘텐츠를 피하기 위해 이미지, 링크, 사용자 기반 데이터는 제외했다.
실험 결과
연구 질문
- RQ1공개 텔레그램 채널의 언어 다양성은 어떠한가? 특히 플랫폼에서 지배적인 언어는 무엇인가?
- RQ2영어 채널에서 주로 나타나는 주요 주제와 커뮤니티는 무엇인가?
- RQ3주요 플랫폼 정책 변화 이후 텔레그램 채널의 성장과 정치적 성향은 어떻게 변화해 왔는가?
- RQ4텔레그램 채널이 음모론, 극단주의 이데올로기 또는 불법 활동 관련 콘텐츠를 얼마나 널리 유포하고 있는가?
- RQ5TGDataset는 오락성, 조작된 정보 유포 캠페인, 플랫폼 기반 극단화 현상 연구에 어떻게 기여할 수 있는가?
주요 결과
- TGDataset는 120,979개의 공개 텔레그램 채널과 4억 건 이상의 메시지를 포함하고 있어, 지금까지 알려진 바 있는 유사한 종류의 가장 큰 공개 컬렉션이다.
- 초기 연도에는 러시아어 채널이 가장 활발했지만, 2021년에 영어 채널가 그들을 앞서게 되었으며, 이는 개인정보 정책 변경 이후 왓스앱에서의 사용자 이탈과 관련이 있을 가능성이 있다.
- 언어 탐지 결과, 다국어적 다양성이 뚜렷하게 드러났으며, 영어, 러시아어, 아랍어가 가장 퍼진 언어로 나타났다.
- 영어 채널의 주제 분석을 통해 백인 우월주의, 복수 포르노, 카드링, 해킹, 그리고 Sabmyk와 같은 음모론을 홍보하는 채널이 다수 존재하는 것으로 확인되었다.
- 불법 또는 해로운 활동을 하는 채널도 포함되어 있으며, 특히 시장 조작(예: 펌프 앤 루프 스킴)을 조율하거나 극단주의 콘텐츠를 확산시키는 채널들이 있다.
- 이 데이터셋의 공개는 향후 플랫폼 진화, 콘텐츠 모니터링, 프라이버시 중심 플랫폼인 텔레그램에서의 의심스러운 정보 유포 연구에 기여할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.