[論文レビュー] Humor Detection in English-Hindi Code-Mixed Social Media Content : Corpus and Baseline System
この論文は、英語・ヒンディー語の混在するツイートを対象に、ユーモラスまたはノンユーモラスとしてラベル付けされた、手動でアノテートされた3,543件のコーパスを無料で提供する。また、語彙レベルの言語タグも含む。n-gram、bag-of-words、共通語、ハッシュタグを特徴量として用いたベースラインユーモラス検出システムを提案し、SVM-RBFが69.3%の最高精度を達成した。これは、多言語のソーシャルメディアコンテンツにおけるユーモラス検出の可能性を示している。
The tremendous amount of user generated data through social networking sites led to the gaining popularity of automatic text classification in the field of computational linguistics over the past decade. Within this domain, one problem that has drawn the attention of many researchers is automatic humor detection in texts. In depth semantic understanding of the text is required to detect humor which makes the problem difficult to automate. With increase in the number of social media users, many multilingual speakers often interchange between languages while posting on social media which is called code-mixing. It introduces some challenges in the field of linguistic analysis of social media content (Barman et al., 2014), like spelling variations and non-grammatical structures in a sentence. Past researches include detecting puns in texts (Kao et al., 2016) and humor in one-lines (Mihalcea et al., 2010) in a single language, but with the tremendous amount of code-mixed data available online, there is a need to develop techniques which detects humor in code-mixed tweets. In this paper, we analyze the task of humor detection in texts and describe a freely available corpus containing English-Hindi code-mixed tweets annotated with humorous(H) or non-humorous(N) tags. We also tagged the words in the tweets with Language tags (English/Hindi/Others). Moreover, we describe the experiments carried out on the corpus and provide a baseline classification system which distinguishes between humorous and non-humorous texts.
研究の動機と目的
- 多言語的でコードミックスされたソーシャルメディアコンテンツ、特に英語・ヒンディー語の文脈における自動ユーモラス検出の課題に対処すること。
- ユーモラス(H)およびノンユーモラス(N)のラベルを付与した、バランスの取れた手動アノテーション済みのコードミックスツイートコーパスを作成すること。
- 多様な言語的特徴量を用いて、コードミックステキストにおけるユーモラス分類のためのベースライン機械学習システムを開発・評価すること。
- 低リソースのコードミックスNLP環境において、文字レベルと語彙レベルの特徴量の有効性を検討すること。
- 今後のクロスリンガルユーモラス検出および多言語テキスト分類分野の研究基盤を提供すること。
提案手法
- twitterscraper Pythonパッケージを用いて、10,478件のツイートをTwitterから収集し、英語・ヒンディー語の混在コンテンツにフィルタリングした。
- 3,543件のツイートを、手動でユーモラス(1,755件)およびノンユーモラス(1,698件)にラベル付けし、語彙レベルの言語タグ(英語、ヒンディー語、その他)を付与した。
- 合成語(例:'AadabArzHai' を 'Aadab'、'Arz'、'Hai' に分割)の処理と、キャメルケース規則に基づくハッシュタグの分解を含む、前処理を実施した。
- 4種類の特徴量を抽出した:文字レベルの3-gram(頻度>10)、bag-of-words(3語ウィンドウ)、共通語、ハッシュタグ特徴量。
- カイ二乗適合度選択を適用し、10-fold交差検証を用いて4種類の分類器(SVM-RBF、ランダムフォレスト、エクストラツリー、ナイーブベイズ)を訓練した。
- グリッドサーチを用いてハイパーパramータを最適化し、全foldの平均精度を報告した。
実験結果
リサーチクエスチョン
- RQ1n-gramおよびbag-of-words特徴量は、英語・ヒンディー語の混在するソーシャルメディアテキストにおけるユーモラス検出にどの程度有効か?
- RQ2低リソースの多言語テキストにおいて、どの機械学習分類器がユーモラス検出で最も優れた性能を示すか?
- RQ3文字レベルのn-gramのような言語に依存しない特徴量は、コードミックスユーモラス検出において、語彙的または意味的特徴量を上回る性能を示せるか?
- RQ4ハッシュタグと共通語の組み込みが、分類性能にどのような影響を与えるか?
- RQ5コードミックスされたインディアンソーシャルメディアコンテンツにおけるユーモラス検出のベースライン性能は何か?
主な発見
- 径路基底関数(RBF)カーネルを用いたSVMが、全特徴量セットで69.3%の最高精度を達成し、他の分類器を上回った。
- n-gramが、全分類器において最も効果的な特徴量タイプであった。その後に共通語とハッシュタグが続く。
- SVM、ランダムフォレスト、エクストラツリー分類器ではbag-of-words特徴量が最も成績が悪く、ナイーブベイズではやや良好な結果を示した。
- コーパスは1,755件のユーモラスおよび1,698件のノンユーモラスツイートでバランスが取れており、ユーモラス検出システムの信頼性ある評価を可能にした。
- 最高性能を示したモデル(SVM-RBF)は、n-gram特徴量のみを用いても68.5%の精度を達成した。これは、最小限の特徴量工学で優れた性能を示している。
- 本研究は、コードミックスされたインディアンソーシャルメディアにおけるユーモラス検出の基盤となるベンチマークを確立した。今後の多言語および多文字セット環境への応用が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。