Skip to main content
QUICK REVIEW

[論文レビュー] Transgender Community Sentiment Analysis from Social Media Data: A Natural Language Processing Approach

Mengzhe Li, Yudan Wang|arXiv (Cornell University)|Oct 25, 2020
Topic Modeling参考文献 13被引用数 4
ひとこと要約

本研究では、300件のRedditコメントを手動でアノテートしたデータセットを用いて、インターセックス個人のソーシャルメディア投稿におけるセンチメント分析のための自然言語処理(NLP)フレームワークを開発した。複数の機械学習およびディープラーニングモデルを評価した結果、LSTMモデルが最高のパフォーマンスを示し(正解率:0.852、AUC:0.876)、自動センチメント検出による早期精神保健介入の強力な可能性を示した。

ABSTRACT

Transgender community is experiencing a huge disparity in mental health conditions compared with the general population. Interpreting the social medial data posted by transgender people may help us understand the sentiments of these sexual minority groups better and apply early interventions. In this study, we manually categorize 300 social media comments posted by transgender people to the sentiment of negative, positive, and neutral. 5 machine learning algorithms and 2 deep neural networks are adopted to build sentiment analysis classifiers based on the annotated data. Results show that our annotations are reliable with a high Cohen's Kappa score over 0.8 across all three classes. LSTM model yields an optimal performance of accuracy over 0.85 and AUC of 0.876. Our next step will focus on using advanced natural language processing algorithms on a larger annotated dataset.

研究の動機と目的

  • トランスジェンダー・コミュニティのRedditコメント300件を、肯定的、否定的、ニュートラルのセンチメントカテゴリに手動でアノテートすること。
  • 機械学習およびディープラーニングモデルの性能を、ソーシャルメディアのテキストからトランスジェンダー・コミュニティのセンチメントを分類するタスクにおいて評価すること。
  • 精神保健関連の苦痛を自動で検出できる、自動センチメント分類器を開発し、早期介入を可能にすること。
  • 今後のNLP研究におけるトランスジェンダー精神保健分野の信頼性の高い、高一致率のデータセットを構築すること。

提案手法

  • 2人のラベラーが/ r /asktransgenderからの300件のRedditコメントを手動でアノテートし、不一致は第3者によって解決した。全クラスでCohenのKappa係数が0.8を超えた。
  • 5つの従来の機械学習モデル(ナイーブベイズ、ロジスティック回帰、ランダムフォレスト、SVM、K-近傍法)および2つのディープラーニングモデル(CNNとLSTM)を、アノテート済みデータで学習した。
  • ディープラーニングモデルのテキスト入力表現に、大規模なソーシャルメディアデータで事前学習されたWord2Vec埋め込みを用いた。
  • LSTMモデルは3層スタック構造(128、64、32ユニット)、ReLU活性化関数、ドロップアウト(0.2)、グローバルマックスプーリングを採用。最適化にAdam、損失関数にバイナリ・クロスエントロピーを適用。
  • モデル評価には、20%のホールドアウトテストセットを用いて正解率とマクロ平均AUCを測定。従来モデルには5分割交差検証を、ハイパーパramータチューニングには学習データの10%を開発セットとして使用。
  • すべてのモデルはPython 3.6で実装され、ディープラーニングにはKeras、従来モデルにはscikit-learnを用い、1枚のGPUで学習を高速化した。

実験結果

リサーチクエスチョン

  • RQ1トランスジェンダーのソーシャルメディア投稿コメントの手動アノテーションデータセットは、センチメント分類において高い相互評価者間一致度を達成できるか?
  • RQ2機械学習およびディープラーニングモデルの中で、トランスジェンダー・コミュニティのソーシャルメディアコンテンツのセンチメント分類において、どのモデルが最も優れた性能を示すか?
  • RQ3自動センチメント分類器は、トランスジェンダー個人のオンライン表現における否定的センチメントを、高い正解率とAUCで検出できるか?
  • RQ4『dysphoria』や『question』といったキーワードは、この文脈におけるセンチメント分類にどのように寄与するか?

主な発見

  • 手動アノテーションプロセスは、全3クラスでCohenのKappa係数が0.8を超えたことから、高い評価者間信頼性を示した。
  • LSTMモデルが0.852の最高正解率と0.876の最高AUCを達成し、テストされた全モデルの中で最も優れた性能を示した。
  • CNNモデルは2番目の正解率(0.861)を記録し、正解率ではLSTMをわずかに上回ったが、AUCでは上回らなかった。
  • すべてのディープラーニングモデル(CNNとLSTM)が、すべての従来の機械学習分類器よりも正解率およびAUCの両方で優れていた。
  • ワードクラウド可視化により、『trans』、『transgender』、『dysphoria』、『question』、『wondering』がセンチメント分類において最も影響力のある語として特定された。
  • 本研究は、トランスジェンダーのソーシャルメディアデータに対する自動センチメント分析が、精神保健の苦痛の早期検出を支援し、適切な介入を可能にする可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。