[論文レビュー] TGDataset: Collecting and Exploring the Largest Telegram Channels Dataset
本稿では、Telegramチャンネルの公開データセットとして、これまでで最大のTGDatasetを紹介している。本データセットは120,979のチャンネルと4億条を超えるメッセージを含む。180のシードチャンネルから始まるスノーボールサンプリング法を用いて、著者たちは多言語コンテンツを収集・分析し、陰謀説、過激主義的イデオロギー、境界線に近いコンテンツの広範な拡散を明らかにした。本研究は、Telegramにおける誤情報とプラットフォームダイナミクスを研究する上で、極めて重要なリソースを提供する。
Telegram is one of the most popular instant messaging apps in today's digital age. In addition to providing a private messaging service, Telegram, with its channels, represents a valid medium for rapidly broadcasting content to a large audience (COVID-19 announcements), but, unfortunately, also for disseminating radical ideologies and coordinating attacks (Capitol Hill riot). This paper presents the TGDataset, a new dataset that includes 120,979 Telegram channels and over 400 million messages, making it the largest collection of Telegram channels to the best of our knowledge. After a brief introduction to the data collection process, we analyze the languages spoken within our dataset and the topic covered by English channels. Finally, we discuss some use cases in which our dataset can be extremely useful to understand better the Telegram ecosystem, as well as to study the diffusion of questionable news. In addition to the raw dataset, we released the scripts we used to analyze the dataset and the list of channels belonging to the network of a new conspiracy theory called Sabmyk.
研究の動機と目的
- 学術的調査を目的とした、Telegramチャンネルに関する大規模かつ公開可能なデータセットの不足を解消すること。
- 複数の言語とトピックにわたる、公開Telegramチャンネルの包括的なデータセットの収集と特徴化。
- Telegram上で、陰謀説、過激主義的イデオロギー、違法活動を含む、懸念されるコンテンツの広がりを調査すること。
- 誤情報とプラットフォームの進化を研究するための、再現可能でオープンソースのデータセットと分析ツールを研究者に提供すること。
- Telegramがコンテンツ拡散およびコミュニティ形成に果たす役割に関する縦断的および言語横断的研究を可能にすること。
提案手法
- メッセージの転送を介して関連するチャンネルを段階的に発見する、180のシードTelegramチャンネルから始まるスノーボールサンプリング手法を採用した。
- タイトル、ユーザーネーム、説明、登録者数、作成日、メッセージ内容を含む、公開チャンネルのメタデータを収集した。
- 自動言語検出を適用して、データセット内のチャンネルで使用される主な言語を特定した。
- 英語圏のチャンネルに対してトピックモデリングと手動ラベリングを実施し、顕著なテーマとコミュニティを同定した。
- 生データ、分析スクリプト、ラベル付きデータ(言語およびトピック)をオープンソースリソースとして公開した。
- 画像、リンク、ユーザー固有のデータを除外することで、倫理基準を遵守し、著作権侵害やアダルトコンテンツを回避した。
実験結果
リサーチクエスチョン
- RQ1公開Telegramチャンネルの言語的多様性はどの程度で、どの言語がプラットフォームで支配的であるか?
- RQ2英語圏のTelegramチャンネルに、主なトピックとコミュニティは何か?
- RQ3特に主要なプラットフォームポリシー変更の後、Telegramチャンネルの成長と政治的傾向はどのように変化したか?
- RQ4Telegramチャンネルが、陰謀説、過激主義的イデオロギー、または違法活動関連のコンテンツをどれくらいの割合でホスティングしているか?
- RQ5TGDatasetは、誤情報、組織的でない虚偽情報キャンペーン、およびプラットフォームによる過激化の研究をどのように支援できるか?
主な発見
- TGDatasetには120,979の公開Telegramチャンネルと4億条を超えるメッセージが含まれており、これは同種のデータセットとしてこれまでで最大のものである。
- 初期の年数においてはロシア語チャンネルが最も活発的であったが、2021年に英語チャンネルがそれを上回った。これは、プライバシー方針変更に伴うWhatsAppからのユーザー移転が要因とされる。
- 言語検出により、顕著な多言語的多様性が明らかになった。英語、ロシア語、アラビア語が特に一般的な言語であった。
- 英語チャンネルのトピック分析から、白人至上主義、復讐ポルノ、カードィング、ハッキング、およびSabmykのような陰謀論を提唱するチャンネルが顕著に存在することが判明した。
- 市場操作(例:ポンプアンドダンプ工作)を計画するか、過激主義的コンテンツを拡散する活動に参加するチャンネルも含まれている。
- 本データセットの公開により、将来的なプラットフォームの進化、コンテンツモデレーション、プライバシー重視プラットフォーム(Telegramを含む)における信ぴょう性に疑問を呈する情報の拡散に関する研究が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。