Skip to main content
QUICK REVIEW

[論文レビュー] Stance Detection in Turkish Tweets

Dilek Küçük|arXiv (Cornell University)|Jun 21, 2017
Sentiment Analysis and Opinion Mining参考文献 6被引用数 9
ひとこと要約

本稿は、2つの主要なスポーツクラブに対するスタンスを対象とした、公開可能な最初のトルコ語ツイート用ステイント検出データセットを提示する。ユニグラム、ビグラム、ハッシュタグ特徴を用いたSVM分類器を用い、2つのターゲットに対してそれぞれ80.1%および74.0%のF-measureスコアを達成し、将来的なトルコ語ステイント検出研究のベースラインを確立する。

ABSTRACT

Stance detection is a classification problem in natural language processing where for a text and target pair, a class result from the set {Favor, Against, Neither} is expected. It is similar to the sentiment analysis problem but instead of the sentiment of the text author, the stance expressed for a particular target is investigated in stance detection. In this paper, we present a stance detection tweet data set for Turkish comprising stance annotations of these tweets for two popular sports clubs as targets. Additionally, we provide the evaluation results of SVM classifiers for each target on this data set, where the classifiers use unigram, bigram, and hashtag features. This study is significant as it presents one of the initial stance detection data sets proposed so far and the first one for Turkish language, to the best of our knowledge. The data set and the evaluation results of the corresponding SVM-based approaches will form plausible baselines for the comparison of future studies on stance detection.

研究の動機と目的

  • 2つの人気スポーツクラブに対する公共の感情を対象とした、最初のステイントアノテート済みデータセットの作成。
  • このデータセット上でユニグラム、ビグラム、ハッシュタグ特徴を用いたSVM分類器の性能を評価すること。
  • 将来的なトルコ語ステイント検出研究のためのベースライン結果を確立すること。
  • トルコ語のような低リソース言語において、ハッシュタグを特徴として用いることの有効性を検討すること。

提案手法

  • 2つのスポーツクラブのターゲットに対して、ステイントラベル(賛成、反対、その他)を付与したトルコ語ツイートのコレクションをアノテートする。
  • 各ターゲットに対して、ユニグラム、ビグラム、ハッシュタグの有無を特徴量として用いたSVM分類器を別々に訓練する。
  • 10分割交差検証を適用し、精度、再現率、F-measureの観点から分類器の性能を評価する。
  • 異なる特徴量セット(ユニグラムのみ、ユニグラム+ハッシュタグ)が分類性能に与える影響を比較する。
  • 初期のデータ作成には1名のアノテーターを用い、将来的なクラウドソーシングによるデータ品質向上を計画する。
  • 英語および他の言語で既存のステイント検出システムと比較してベンチマーク結果を提示する。

実験結果

リサーチクエスチョン

  • RQ1ユニグラム、ビグラム、ハッシュタグ特徴は、トルコ語ツイートにおけるステイント検出にどの程度効果的か?
  • RQ2小規模でドメイン特化されたトルコ語ツイートデータセットで訓練されたSVM分類器は、信頼性のあるステイント検出性能を達成できるか?
  • RQ3ハッシュタグの有無を特徴量として組み込むことで、トルコ語ソーシャルメディア文書におけるステイント検出性能が向上するか?
  • RQ4この低リソースのトルコ語データセットにおいて、ユニグラムベースのモデルとビグラムベースのモデルの性能はどのように比較されるか?
  • RQ5このデータセットは、将来的なトルコ語ステイント検出研究のベースラインとしてどの程度活用できるか?

主な発見

  • ユニグラム特徴を用いたSVM分類器は、ターゲット-1でF-measure 80.1%、ターゲット-2で74.0%を達成し、トルコ語ステイント検出の強固なベースラインを確立した。
  • ハッシュタグの有無を特徴量として組み込むことで、ターゲット-2のF-measureがわずかに1.8%向上した。これは、ステイント検出における潜在的な有用性を示唆している。
  • ビグラム特徴のみを用いた場合、性能が著しく劣った。これは、データセットのサイズが小さいことが主な要因と考えられる。
  • 本データセットは、スポーツ関連のツイートに特化した、公開可能な最初のトルコ語ステイントアノテートリソースである。
  • 本研究は、トルコ語におけるSVMベースのステイント検出の最初の体系的評価を提供し、将来的なマルチリンガルおよびクロスリンガル研究の基盤を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。