Skip to main content
QUICK REVIEW

[论文解读] yosm: A new yoruba sentiment corpus for movie reviews

Iyanuoluwa Shode, David Ifeoluwa Adelani|arXiv (Cornell University)|Apr 20, 2022
Sentiment Analysis and Opinion Mining被引用 12
一句话总结

本文介紹了 YOSM,這是首個用於尼日利亞電影評論的約魯巴語情感語料庫,由母語者將英文內容手動翻譯成約魯巴語。研究評估了如 AfriBERTa 和 mBERT 等最先进模型在微調與遷移學習下的表現,於約魯巴語數據集中取得最高 87.2 的 F1 分數,並證明當人工標註數據稀缺時,機器翻譯的評論可有效支援低資源語言的自然語言處理。

ABSTRACT

A movie that is thoroughly enjoyed and recommended by an individual might be hated by another. One characteristic of humans is the ability to have feelings which could be positive or negative. To automatically classify and study human feelings, an aspect of natural language processing, sentiment analysis and opinion mining were designed to understand human feelings regarding several issues which could affect a product, a social media platforms, government, or societal discussions or even movies. Several works on sentiment analysis have been done on high resource languages while low resources languages like Yoruba have been sidelined. Due to the scarcity of datasets and linguistic architectures that will suit low resource languages, African languages "low resource languages" have been ignored and not fully explored. For this reason, our attention is placed on Yoruba to explore sentiment analysis on reviews of Nigerian movies. The data comprised 1500 movie reviews that were sourced from IMDB, Rotten Tomatoes, Letterboxd, Cinemapointer and Nollyrated. We develop sentiment classification models using the state-of-the-art pre-trained language models like mBERT and AfriBERTa to classify the movie reviews.

研究动机与目标

  • 為解決非洲語言,特別是約魯巴語,在電影評論領域缺乏情感分析資源的問題。
  • 建立首個經手動整理的約魯巴語情感語料庫(YOSM),專注於尼日利亞電影評論。
  • 評估如 mBERT 和 AfriBERTa 等預訓練語言模型在低資源約魯巴語文本上的表現。
  • 研究利用英文尼日利亞電影評論與機器翻譯的約魯巴語數據進行遷移學習的有效性。
  • 評估自動機器翻譯(例如 Google 翻譯)作為低資源環境下訓練數據替代方案的實用性。

提出的方法

  • 從五個來源收集 1,500 筆平衡的電影評論:IMDB、Rotten Tomatoes、Letterboxd、Cinemapointer 和 Nollyrated。
  • 由母語者將 1,500 範英文評論手動翻譯成約魯巴語,以建立高品質的平行數據集。
  • 將數據集劃分為 800 筆訓練集、200 筆開發集與 500 筆測試集,以供模型評估。
  • 在約魯巴語數據集上對 mBERT、AfriBERTa 及使用語言適應性微調(LAFT)的 mBERT 進行微調。
  • 評估零-shot 與少-shot 的跨語言遷移學習,來自英文數據集,包括 IMDB 和英文尼日利亞電影評論。
  • 使用 BLEU 分數評估 Google 翻譯輸出的品質,發現分數僅為 3.36。

实验结果

研究问题

  • RQ1在僅有少量標註數據的情況下,最先进預訓練語言模型是否能在低資源約魯巴語情感分類任務上達到高表現?
  • RQ2與好萊塢電影評論(例如 IMDB)相比,使用英文尼日利亞電影評論進行遷移學習對約魯巴語情感分析的成效如何?
  • RQ3在低資源自然語言處理任務中,機器翻譯的約魯巴語評論在多大程度上可作為人工標註數據的可行替代方案?
  • RQ4與標準微調相比,使用語言適應性微調(LAFT)對 mBERT 進行微調是否能提升其在約魯巴語情感分類上的表現?
  • RQ5人工標註的約魯巴語評論與自動翻譯的約魯巴語評論在情感分類上的表現差距為何?

主要发现

  • YOSM 語料庫在 AfriBERTa 上取得 87.2 的 F1 分數,展現出在低資源約魯巴語情感分類任務上的強大表現。
  • mBERT+LAFT 取得 86.2 的 F1 分數,優於標準 mBERT(83.2 F1),顯示語言適應性微調對約魯巴語的優勢。
  • 來自英文尼日利亞電影評論(en)的遷移學習表現優於來自 IMDB(imdb/en)的遷移學習,F1 分數提升 2.4 至 5.5,顯示領域特定遷移更為有效。
  • 在機器翻譯的約魯巴語評論(yo:MT)上進行訓練,取得 77.1 的 F1 分數;與英文評論結合(en+yo:MT)則達 77.9 F1,顯示自動翻譯的實用價值。
  • 人工翻譯與機器翻譯之間的 BLEU 分數為 3.36,顯示 Google 翻譯輸出品質較差,但其仍能有效支援遷移學習。
  • 最佳表現來自在 YOSM 上微調的 AfriBERTa,優於 mBERT 及 mBERT+LAFT,突顯預訓練於非洲語言模型的優勢。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。