[論文レビュー] Hopeful_Men@LT-EDI-EACL2021: Hope Speech Detection Using Indic Transliteration and Transformers
本稿では、文脈的埋め込みとファインチューニングされたトランスフォーマーモデルを用いて、英語、タミル語、マラヤーラム語の多言語ソーシャルメディアにおける希望スピーチ検出の二段階的アプローチを提案する。第二のアプローチ——11種類のファインチューニングされたトランスフォーマーモデル(RoBERTa、ALBERT、IndicBERT)のアンサンブル投票——は、英語で0.93の重み付きF1スコア、タミル語で0.75、マラヤーラム語で0.49を達成し、HopeEDIデータセットにおいて英語では1位、タミル語とマラヤーラム語では上位3位を獲得した。
This paper aims to describe the approach we used to detect hope speech in the HopeEDI dataset. We experimented with two approaches. In the first approach, we used contextual embeddings to train classifiers using logistic regression, random forest, SVM, and LSTM based models.The second approach involved using a majority voting ensemble of 11 models which were obtained by fine-tuning pre-trained transformer models (BERT, ALBERT, RoBERTa, IndicBERT) after adding an output layer. We found that the second approach was superior for English, Tamil and Malayalam. Our solution got a weighted F1 score of 0.93, 0.75 and 0.49 for English,Malayalam and Tamil respectively. Our solution ranked first in English, eighth in Malayalam and eleventh in Tamil.
研究の動機と目的
- 低リソース言語としてのタミル語とマラヤーラム語を含む、多言語YouTubeコメントにおける希望スピーチの検出を目的とする。
- インド語のデータセットにおけるコードミキシングの課題に対処するため、翻訳パイプラインを用いる。
- HopeEDIデータセットでファインチューニングされたトランスフォーマーベースのモデルを用いて、希望スピーチ検出のパフォーマンスを向上させることを目的とする。
- 伝統的な分類器モデルと、ファインチューニングされたトランスフォーマーモデルを用いたアンサンブル手法を比較し、多言語希望スピーチ検出における性能を評価することを目的とする。
提案手法
- 前処理では、特殊文字、絵文字、余分な空白を削除し、テキストを小文字に変換した。
- 言語検出には、コードミキシドのタミル語およびマラヤーラム語データに対してヒューリスティックなアプローチを用い、タミル語/マラヤーラム語以外のコンテンツを英語またはヒンディー語に分類した。
- コードミキシドのインド語テキストに対して、indic-transliterationライブラリを用いてラテン文字表記の要素を本来の script に変換する翻訳処理を実施した。
- 従来の分類器(ロジスティック回帰、ランダムフォレスト、SVM、LSTM)に使用するため、BERT、RoBERTa、ALBERT、IndicBERTから文脈的埋め込みを抽出した。
- 最終予測のために、多数決投票を用いたアンサンブルとして、ファインチューニングされたトランスフォーマーモデル(RoBERTa、ALBERT、IndicBERT)を統合した。
- 最終システムでは、重み付きF1を評価指標として用い、訓練/開発セットから抽出されたテストスプリットを用いてモデルのパフォーマンスを評価した。
実験結果
リサーチクエスチョン
- RQ1ファインチューニングされたトランスフォーマーモデルは、多言語SNSテキストにおける希望スピーチ検出において、従来の分類器モデルを上回ることができるか?
- RQ2翻訳処理は、コードミキシドのインド語データセットにおける希望スピーチ検出のパフォーマンス向上にどの程度有効であるか?
- RQ3複数のファインチューニングされたトランスフォーマーモデルをアンサンブル投票で統合することで、タミル語やマラヤーラム語のような低リソース言語における検出性能が向上するか?
- RQ4RoBERTa、ALBERT、IndicBERTといった異なる事前学習モデルは、英語、タミル語、マラヤーラム語の希望スピーチ検出において、どのように性能を発揮するか?
主な発見
- ファインチューニングされたトランスフォーマーモデルのアンサンブルは、英語で最高の重み付きF1スコア0.93を達成し、他のすべての手法を上回った。
- タミル語では、IndicBERTを用いたアンサンブルアプローチが重み付きF1スコア0.75を達成し、全14システム中8位となった。
- マラヤーラム語では、アンサンブルモデルが重み付きF1スコア0.49を達成し、全14システム中11位となった。
- 第二のアプローチ(ファインチューニングされたトランスフォーマーモデルとアンサンブル投票)は、すべての3言語において、第一のアプローチ(従来の分類器に文脈的埋め込みを用いたもの)を一貫して上回った。
- 英語ではRoBERTa-baseが最も優れたパフォーマンスを示したが、タミル語およびマラヤーラム語ではIndicBERTが最も高い性能を発揮した。
- マクロF1と重み付きF1の差異は、特にタミル語およびマラヤーラム語において、少数クラスの予測が不正確であるというクラス不均衡の問題を示していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。