Skip to main content
QUICK REVIEW

[論文レビュー] A Tweet Dataset Annotated for Named Entity Recognition and Stance Detection

Dilek Küçük, Fazlı Can|arXiv (Cornell University)|Jan 15, 2019
Topic Modeling参考文献 18被引用数 9
ひとこと要約

本論文は、名前付きエンティティ認識(NER)およびステークポジション検出の両方に対してアノテートされた、公開可能なトルコ語ツイートデータセットを紹介する。このデータセットは、1,000件のツイートを含み、名前付きエンティティ(PERSON、LOCATION、ORGANIZATION)のゼロベースの文字単位のNERアノテーションと、ステークポジションラベル(Favor、Against、Neither)を備え、両方のアノテーションを含む最初のものであり、名前付きエンティティを特徴量として用いることでステークポジション検出の性能向上を支援する。

ABSTRACT

Annotated datasets in different domains are critical for many supervised learning-based solutions to related problems and for the evaluation of the proposed solutions. Topics in natural language processing (NLP) similarly require annotated datasets to be used for such purposes. In this paper, we target at two NLP problems, named entity recognition and stance detection, and present the details of a tweet dataset in Turkish annotated for named entity and stance information. Within the course of the current study, both the named entity and stance annotations of the included tweets are made publicly available, although previously the dataset has been publicly shared with stance annotations only. We believe that this dataset will be useful for uncovering the possible relationships between named entity recognition and stance detection in tweets.

研究の動機と目的

  • トルコ語のような低リソース言語におけるソーシャルメディアNLPタスクの多言語的・マルチアノテーションデータセットの不足に対処すること。
  • 名前付きエンティティアノテーションがステークポジション検出のパフォーマンスに寄与する可能性を調査すること。
  • トルコ語ツイートのNERとステークポジション両方のアノテーションを統合した、公開可能で高品質なデータセットを提供すること。
  • トルコ語ソーシャルメディアテキスト分析のための教師ありNLPモデルの開発と評価を支援すること。
  • 名前付きエンティティを特徴量として使用したが、完全なアノテート済みデータセットを公開しなかった先行研究を補完すること。

提案手法

  • データセットは、1,000件のトルコ語ツイートから構築され、名前付きエンティティおよびステークポジションの両方について手動でアノテートされた。
  • 名前付きエンティティは、タイプ(PERSON、LOCATION、ORGANIZATION)を伴うゼロベースの文字スパン方式でラベル付けされた。
  • ステークポジションは、特定のターゲット(例:Galatasaray、Fenerbahçe)に関して、Favor、Against、Neitherのいずれかにラベル付けされた。
  • アノテーションは、ツイートID、ターゲット、ステークポジションクラス、およびNEトリプレット(開始位置、終了位置、タイプ)のリストを含む、構造化されたセミコロン区切りのフォーマットで保存された。
  • データセットは、先行するステークポジション検出研究から抽出され、NERアノテーションを追加することで、過去の研究と整合性を保った。
  • 最終的なデータセットは公開され、両方のアノテーションが初めて同時に利用可能になった。

実験結果

リサーチクエスチョン

  • RQ1名前付きエンティティアノテーションは、トルコ語ツイートにおけるステークポジション検出モデルのパフォーマンスを向上させることができるか?
  • RQ2ソーシャルメディアテキストにおける名前付きエンティティ認識とステークポジション検出の関係は何か?
  • RQ3異なる名前付きエンティティタイプ(例:ORGANIZATION、PERSON)は、ステークポジション分類にどのように寄与するか?
  • RQ4二重アノテーションを備えた共有データセットは、トルコ語のような低リソース言語におけるNLP研究をどの程度進展させるか?
  • RQ5先行実験が示唆するように、名前付きエンティティを特徴量として使用することで、ステークポジション検出に測定可能な利点が得られるか?

主な発見

  • このデータセットは、トルコ語ツイートにおける名前付きエンティティ認識とステークポジション検出の両方に対してアノテートされた、最初の公開可能なリソースである。
  • 先行実験では、SVMベースのステークポジション検出モデルにおいて、名前付きエンティティ特徴量がわずかにパフォーマンスを向上させたことが示され、両タスク間に潜在的な関係がある可能性が示唆された。
  • データセットには、手動でアノテートされたステークポジションターゲットとステークポジションクラス、および正確な文字単位の名前付きエンティティスパンが含まれる。
  • 両方のアノテーションを1つの公開済みデータセットに統合することで、クロスタスク特徴利用やモデルの転送に関する新しい研究が可能になった。
  • このデータセットは、このようなリソースが乏しい低リソース環境におけるトルコ語NLPの今後の研究を支援すると期待される。
  • セミコロン区切りのフィールドとゼロベースインデックスを用いた構造化されたフォーマットにより、再現性が保たれ、NLPパイプラインへの統合が容易になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。