[論文レビュー] Multimodal Social Media Analysis for Gang Violence Prevention
本稿では、シカゴのギャング関連青年のソーシャルメディア投稿から、攻撃性、喪失、薬物使用といった心理社会的コードを、テキストと画像の両データを用いて検出するマルチモーダル手法を提案する。テキストと画像のモダリティを統合することで、単一モダリティモデルに比べて平均平均適合率(mean average precision)が18%相対的に向上し、ギャング暴力防止における早期介入の観点からマルチモーダル分析の価値を示している。
Gang violence is a severe issue in major cities across the U.S. and recent studies [Patton et al. 2017] have found evidence of social media communications that can be linked to such violence in communities with high rates of exposure to gang activity. In this paper we partnered computer scientists with social work researchers, who have domain expertise in gang violence, to analyze how public tweets with images posted by youth who mention gang associations on Twitter can be leveraged to automatically detect psychosocial factors and conditions that could potentially assist social workers and violence outreach workers in prevention and early intervention programs. To this end, we developed a rigorous methodology for collecting and annotating tweets. We gathered 1,851 tweets and accompanying annotations related to visual concepts and the psychosocial codes: aggression, loss, and substance use. These codes are relevant to social work interventions, as they represent possible pathways to violence on social media. We compare various methods for classifying tweets into these three classes, using only the text of the tweet, only the image of the tweet, or both modalities as input to the classifier. In particular, we analyze the usefulness of mid-level visual concepts and the role of different modalities for this tweet classification task. Our experiments show that individually, text information dominates classification performance of the loss class, while image information dominates the aggression and substance use classes. Our multimodal approach provides a very promising improvement (18% relative in mean average precision) over the best single modality approach. Finally, we also illustrate the complexity of understanding social media data and elaborate on open challenges.
研究の動機と目的
- シカゴに在住するギャング関連青年の公開ツイート(テキストと画像を含む)を収集・アノテートするきめ細かいフレームワークの構築。
- ソーシャルワーク介入や暴力への道のりに関連する心理社会的コード(攻撃性、喪失、薬物使用)を特定・アノテートすること。
- テキストのみ、画像のみ、およびマルチモーダルなアプローチの3つの分類手法の有効性を評価すること。
- 中レベルの視覚的コンセプトと各モダリティ固有の寄与度が分類性能を向上させる役割を分析すること。
- 識別子の削除、データの暗号化、コミュニティの専門家による検証への参加を通じて、倫理的なデータ取り扱いを確保すること。
提案手法
- シカゴ在住のギャング関連青年から1,851件の公開ツイート(テキストと関連画像を含む)を収集した。
- ソーシャルワーク研究者と分野専門家からなるチームにより、各ツイートに対して心理社会的コード(攻撃性、喪失、薬物使用)と視覚的コンセプトをアノテートした。
- テキスト特徴量、画像特徴量、または両方を用いた分類器を、視覚的およびテキスト特徴量抽出にディープラーニングモデルを用いて訓練・比較した。
- 局所的視覚的コンセプト(例:手の合図、武器、薬物関連品)をグローバル画像特徴と統合し、攻撃性および薬物使用の検出を向上させた。
- テキストと画像の予測を統合するマルチモーダル統合戦略を採用し、全体の分類性能を向上させた。
- 文化的文脈や象徴的ジェスチャーに関する解釈のずれを解消するため、分野専門家による反復的検証を実施した。
実験結果
リサーチクエスチョン
- RQ1ギャング関連青年のマルチモーダルソーシャルメディアコンテンツにおいて、心理社会的コード(攻撃性、喪失、薬物使用)はどのように現れるか?
- RQ2各心理社会的コードの検出において、テキストと画像のモダリティがそれぞれどの程度寄与しているか?
- RQ3中レベルの視覚的コンセプトは、ツイートにおける攻撃性および薬物使用の検出をどの程度向上させるか?
- RQ4マルチモーダル統合手法は、単一モダリティ手法に比べて心理社会的コード分類においてどのように優れているか?
- RQ5高暴力地域における文化的に繊細なソーシャルメディアコンテンツのアノテートと解釈において、主な課題は何か?
主な発見
- 喪失コードの分類において、テキストのみの手法が画像のみの手法を上回った。これは、感情的苦痛の検出においてテキスト的兆候がより信頼性が高いことを示している。
- 攻撃性および薬物使用の分類において、画像のみの手法がテキストのみの手法を上回った。これは、暴力的または危険な行動の検出において視覚的兆候がより情報量が多いことを示している。
- マルチモーダル統合手法は、最良の単一モダリティ手法に比べて平均平均適合率(mean average precision)が18%相対的に向上した。これは、両モダリティ間の強い相乗効果を示している。
- アノテーターと分野専門家の間で生じた合意不一致の主な要因は、文化的知識の不足—特にギャング関連、地域のランドマーク、象徴的ジェスチャーに関する知識の欠如—に起因していた。
- 分野専門家による象徴的ジェスチャー(例:軽蔑を示す特定の手の合図)の理解が、攻撃性の評価を顕著に変化させた。これは、文脈的専門知識の重要性を強調している。
- 高い性能向上が達成されたにもかかわらず、文化的な繊細さの影響により、自動分類は依然として限界に達しており、アノテーションおよび検証における人間の専門家の不可欠な役割が浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。