Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Enrichment of Nigerian Pidgin English for Contextual Sentiment Classification

Wuraola Fisayo Oyewusi, Olubayo Adekanmbi|arXiv (Cornell University)|Mar 27, 2020
Sentiment Analysis and Opinion Mining参考文献 8被引用数 15
ひとこと要約

この論文は、300のピジン固有のセンチメントトークンを追加し、14,000件のピジンツイートをセンチメントラベル付けすることで、ナイジェリア・ピジン英語の意味的拡張を提案する。限られた人間によるアノテーションデータを合成されたコードスイッチドテキストで補完し、専門家による検証済みラベルを通じてセンチメントスコアリングを最適化することで、元のVADERモデルに比べて文脈に応じたセンチメント分類の正確性が著しく向上し、特にコードミックスドのソーシャルメディアコンテンツにおける局所的意味的シフトを捉える能力が向上した。

ABSTRACT

Nigerian English adaptation, Pidgin, has evolved over the years through multi-language code switching, code mixing and linguistic adaptation. While Pidgin preserves many of the words in the normal English language corpus, both in spelling and pronunciation, the fundamental meaning of these words have changed significantly. For example,'ginger' is not a plant but an expression of motivation and 'tank' is not a container but an expression of gratitude. The implication is that the current approach of using direct English sentiment analysis of social media text from Nigeria is sub-optimal, as it will not be able to capture the semantic variation and contextual evolution in the contemporary meaning of these words. In practice, while many words in Nigerian Pidgin adaptation are the same as the standard English, the full English language based sentiment analysis models are not designed to capture the full intent of the Nigerian pidgin when used alone or code-mixed. By augmenting scarce human labelled code-changed text with ample synthetic code-reformatted text and meaning, we achieve significant improvements in sentiment scoring. Our research explores how to understand sentiment in an intrasentential code mixing and switching context where there has been significant word localization.This work presents a 300 VADER lexicon compatible Nigerian Pidgin sentiment tokens and their scores and a 14,000 gold standard Nigerian Pidgin tweets and their sentiments labels.

研究の動機と目的

  • 標準英語のセンチメントモデルがナイジェリア・ピジンにおいて性能が不十分になる理由(意味のずれとコードスイッチング)を解決すること。
  • ナイジェリア・ピジンの文脈的進化した語の意味を捉える、VADER互換の語彙を構築すること。
  • 14,000件の人的ラベル付け済みナイジェリア・ピジンツイートを含むゴールドスタンダードデータセットを構築すること。
  • 合成データの拡張と意味的拡張を用いて、文内コードスイッチングの文脈でのセンチメント分類を改善すること。
  • 専門家によるラベル付けが、局所的ピジン表現における微細なセンチメントを捉える際に、ルールベースのモデルを上回ることを検証すること。

提案手法

  • 標準英語の300のセンチメントトークンをナイジェリア・ピジンに翻訳し、意味のずれを考慮してVADER語彙を拡張した。
  • 限られた実世界のピジンツイートデータを補完するために、合成されたコードスイッチドテキストを生成し、モデルの汎化性能を向上させた。
  • 更新されたVADER語彙を用いて、14,000件のナイジェリア・ピジンツイートに対して複合センチメントスコアを計算した。
  • 元のVADERモデルと更新済みVADERモデルのセンチメント予測を、専門家ピジン話者によるゴールドスタンダードラベルと比較した。
  • 人間によるアノテート済みセンチメントラベルを基準として、更新済み語彙の性能を評価および最適化した。
  • 単語言語から合成コードスイッチドテキストへのラベル転送技術を用いて、センチメントラベリングの正確性を向上させた。

実験結果

リサーチクエスチョン

  • RQ1標準英語と比較して、ナイジェリア・ピジン語の語の意味的進化を捉えるために、VADER互換のセンチメント語彙をどのように拡張できるか。
  • RQ2300のピジン固有センチメントトークンを含めることで、コードミックスドのソーシャルメディアテキストにおけるセンチメント分類の正確性がどの程度向上するか。
  • RQ3ルールベースのモデルのスコアと比較して、人間によるアノテート済みラベルはナイジェリア・ピジンにおける文脈的に微細なセンチメントをどの程度正確に捉えられるか。
  • RQ4合成データの拡張は、ナイジェリア・ピジンのような低リソース・コードミックスド言語環境において、センチメントラベリングのパフォーマンスを効果的に向上させられるか。
  • RQ5標準英語のセンチメント語彙がナイジェリアのソーシャルメディアでセンチメント分析に不適切になる主な意味的シフトは何か。

主な発見

  • 300のピジン固有センチメントトークンを含む更新済みVADER語彙は、元のVADERモデルよりも著しく優れたセンチメント分類パフォーマンスを達成した。
  • 文「som teams get black, som get purple but no one fine reach our jersey wey blue」のセンチメントスコアは、-0.1154(否定的)から0.7964(肯定的)に向上し、専門家のラベルと一致した。
  • 文「Na to delete am」は、語彙更新後に中立(0.0000)から否定的(-0.6908)に再分類され、専門家のラベルと一致した。
  • 文「Why greenwood dey play nw?ole you don start」は、肯定的(0.3400)から否定的(-0.2500)に再分類され、専門家の判断を正しく反映した。
  • 更新済み語彙は、感謝を表す「tank」や動機付けを表す「ginger」のような文脈的に微細な表現を捉える点で、人間によるアノテート済みラベルとより良好に一致した。
  • 専門家によるアノテート済みラベルは、意味のずれを捉える点でルールベースのセンチメントスコアリングを上回り、コードミックスド文脈における言語固有のセンチメント語彙の必要性を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。