Skip to main content
QUICK REVIEW

[論文レビュー] A Cross-Genre Ensemble Approach to Robust Reddit Part of Speech Tagging

Shabnam Behzad, Amir Zeldes|arXiv (Cornell University)|Apr 29, 2020
Natural Language Processing Techniques被引用数 9
ひとこと要約

本稿では、Redditの非形式的でユーザー生成のコンテンツにおける品詞タギングの頑健性を向上させるため、ジャンルを跨ぐアンサンブル手法を提案する。多様なジャンルで微調整された最先端のFlairモデルを訓練し、複数の単一ジャンルタガーラーをメタ分類器で統合することで、Redditにおいて最先端の性能を達成した。これは、わずかなドメイン内データでさえ、より大きなドメイン外コーパスを上回ることを示している。

ABSTRACT

Part of speech tagging is a fundamental NLP task often regarded as solved for high-resource languages such as English. Current state-of-the-art models have achieved high accuracy, especially on the news domain. However, when these models are applied to other corpora with different genres, and especially user-generated data from the Web, we see substantial drops in performance. In this work, we study how a state-of-the-art tagging model trained on different genres performs on Web content from unfiltered Reddit forum discussions. More specifically, we use data from multiple sources: OntoNotes, a large benchmark corpus with 'well-edited' text, the English Web Treebank with 5 Web genres, and GUM, with 7 further genres other than Reddit. We report the results when training on different splits of the data, tested on Reddit. Our results show that even small amounts of in-domain data can outperform the contribution of data an order of magnitude larger coming from other Web domains. To make progress on out-of-domain tagging, we also evaluate an ensemble approach using multiple single-genre taggers as input features to a meta-classifier. We present state of the art performance on tagging Reddit data, as well as error analysis of the results of these models, and offer a typology of the most common error types among them, broken down by training corpus.

研究の動機と目的

  • Redditのような非形式的でユーザー生成のWebコンテンツに適用された最先端の品詞タガーラーの性能低下を解決すること。
  • ドメイン内データ(Reddit)が、他のWebジャンルからの大規模なドメイン外コーパスを上回る可能性があるかどうかを調査すること。
  • ジャンル固有のタガーラーを入力特徴として用いたアンサンブルアプローチを構築・評価し、ドメイン一般化を向上させること。
  • 異なるコーパスで訓練されたモデルの誤りパターンを分析し、Redditにおける品詞タギングの一般的な失敗要因を同定すること。
  • 今後のドメイン適応型品詞タギングの改善を支援するため、訓練コーパス別に誤りのタイプ論理を提示すること。

提案手法

  • OntoNotes(洗練されたテキスト)、English Web Treebank(5つのWebジャンル)、GUM(Redditを含む7つの追加ジャンル)といった多様なコーパスで、Flairのシーケンスタギングフレームワークを微調整する。
  • 各コーパスで個別に単一ジャンルタガーラーを訓練し、同じRedditテストセットに対して個別に予測を生成する。
  • これらのジャンル固有タガーラーの予測結果を入力特徴として用い、それらを統合して最終的なコンSENSUSタグ予測を生成するメタ分類器を構築する。
  • 各ジャンル固有タガーラーがアンサンブル性能に寄与する程度を評価するため、アブレーションスタディを実施する。
  • 多様な文語的構造にわたる一貫性を確保するため、Universal Dependenciesと互換性のある階層的タギングスキームを採用する。
  • モデル出力とゴールドスタンダードのアノテーションを比較することで誤差分析を実施し、誤りの種別と訓練コーパス別に分類する。

実験結果

リサーチクエスチョン

  • RQ1わずかなドメイン内Redditデータが、他のジャンルからのはるかに大きなドメイン外コーパスよりも、品詞タギング性能を顕著に向上させることができるか?
  • RQ2最先端の品詞タガーラーが、ニューズレターまたは洗練されたテキストと比較して、Redditの非形式的でノイズの多いテキストに適用された場合、性能がどの程度低下するか?
  • RQ3ジャンル固有タガーラーのアンサンブルが、単一モデルベースラインと比較して、Redditにおける頑健性と正確性をどの程度向上させるか?
  • RQ4Redditにおける品詞タギングで最も頻出する誤りタイプは何か?また、それらは訓練コーパスによってどのように変化するか?
  • RQ5どのジャンル固有タガーラーが、アンサンブルモデルの性能向上に最も効果的に寄与しているか?

主な発見

  • わずかなドメイン内Redditデータでさえ、他のジャンルからの10倍以上大きなコーパスで訓練されたモデルを上回る性能を示した。
  • 複数のジャンル固有タガーラーの予測結果を統合するアンサンブルモデルは、Reddit品詞タギングにおいて最先端の性能を達成した。
  • 誤差分析から、未知語(OOV語)、非形式的な省略語、標準でない大文字の使用が、主に誤りの原因であることが明らかになった。
  • OntoNotesとは異なり、GUMおよびEnglish Web Treebankで訓練されたタガーラーは、Redditでより高い誤差率を示しており、ジャンルの不一致効果が顕著に現れた。
  • メタ分類器は、特にレアまたは曖昧な品詞タグに対して、個別タガーラーと比較して誤差率を顕著に低減した。
  • 一般的な誤りタイプには、固有名詞や動詞、機能語の誤分類が含まれており、使用された訓練コーパスによって明確なパターンが見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。