Skip to main content
QUICK REVIEW

[論文レビュー] Extractive Question Answering on Queries in Hindi and Tamil

Adhitya Thirumala, Elisa Ferracane|arXiv (Cornell University)|Sep 27, 2022
Topic Modeling被引用数 4
ひとこと要約

本論文は、Kaggleコンペティションで提供された多言語データセットを用いて、ヒンディ語およびタミル語の抽出的質問応答(QA)に対して、微調整されたトランスフォーマーモデル(特にXLM-RoBERTaおよびRoBERTa)を提案および評価している。最高の性能を示したモデルは、ヒンディ語およびタミル語のデータを別々に微調整したRoBERTaで、ヒンディ語では0.958のJaccardスコア、タミル語では0.829のスコアを達成し、ベースラインモデルを著しく上回り、低リソースなインディック言語における言語固有の微調整の価値を示している。

ABSTRACT

Indic languages like Hindi and Tamil are underrepresented in the natural language processing (NLP) field compared to languages like English. Due to this underrepresentation, performance on NLP tasks (such as search algorithms) in Indic languages are inferior to their English counterparts. This difference disproportionately affects those who come from lower socioeconomic statuses because they consume the most Internet content in local languages. The goal of this project is to build an NLP model that performs better than pre-existing models for the task of extractive question-answering (QA) on a public dataset in Hindi and Tamil. Extractive QA is an NLP task where answers to questions are extracted from a corresponding body of text. To build the best solution, we used three different models. The first model is an unmodified cross-lingual version of the NLP model RoBERTa, known as XLM-RoBERTa, that is pretrained on 100 languages. The second model is based on the pretrained RoBERTa model with an extra classification head for the question answering, but we used a custom Indic tokenizer, then optimized hyperparameters and fine tuned on the Indic dataset. The third model is based on XLM-RoBERTa, but with extra finetuning and training on the Indic dataset. We hypothesize the third model will perform best because of the variety of languages the XLM-RoBERTa model has been pretrained on and the additional finetuning on the Indic dataset. This hypothesis was proven wrong because the paired RoBERTa models performed the best as the training data used was most specific to the task performed as opposed to the XLM-RoBERTa models which had much data that was not in either Hindi or Tamil.

研究の動機と目的

  • ヒンディ語やタミル語などのインディック言語が自然言語処理(NLP)で過小評価されている問題に対処し、効果的な抽出的質問応答システムを開発すること。
  • 特に英語以外の言語を母語とする人々、とりわけ地域言語に依存する低所得層の人々が情報へのアクセスを向上させること。
  • 低リソースなインディック言語QAタスクにおける多言語および単言語トランスフォーマーモデルのパフォーマンスを評価すること。
  • ヒンディ語およびタミル語において、多言語事前学習と比較して言語固有の微調整がモデル性能を向上させるかどうかを調査すること。
  • 検索エンジンがヒンディ語およびタミル語話者に効果的にサービスを提供できる、高パフォーマンスでアクセス可能なQAシステムを提供すること。

提案手法

  • 多言語ベースラインとして、ヒンディ語およびタミル語のデータを統合してXLM-RoBERTaを微調整した。
  • ヒンディ語およびタミル語のデータを別々に微調整することで、クロスリンガル一般化を向上させた。
  • ヒンディ語およびタミル語のQAデータにそれぞれ特化したRoBERTaモデルを用い、WECHSELパッケージによるサブワードトークン化を活用して多言語転送を実現した。
  • 予測された回答と正解の重複度を測定する主な評価指標として、単語レベルのJaccardスコアを採用した。
  • 4エポック、バッチサイズ12、ベース学習率2×10⁻⁵、重み減衰0.01でモデルを訓練した。
  • 2段階のデータ収集プロセスを実施:まずネイティブスピーカーがウィキペディアの抜粋から質問を生成し、その後同じテキストからラベル付きの回答を抽出した。

実験結果

リサーチクエスチョン

  • RQ1多言語事前学習(XLM-RoBERTa)と単言語微調整(RoBERTa)は、ヒンディ語およびタミル語の抽出的QAにおいて、どのように比較されるか?
  • RQ2共有の多言語微調整と比較して、言語固有の微調整は、低リソースなインディック言語のQAタスクでどの程度パフォーマンスを向上させるか?
  • RQ3ヒンディ語およびタミル語のQAモデルにおける主な誤りパターンは何か?また、語の区切り方や文法的差異とどのように関連しているか?
  • RQ4WECHSELを介したサブワード埋め込みの転送は、完全な再訓練なしに英語事前学習済みRoBERTaをヒンディ語およびタミル語に効果的に適応できるか?
  • RQ5訓練データの不均衡(ヒンディ語67%、タミル語33%)は、モデルのパフォーマンスおよび言語間の一般化にどのように影響するか?

主な発見

  • ヒンディ語およびタミル語のデータを別々に微調整したRoBERTaモデルが最高のパフォーマンスを示し、ヒンディ語ではJaccardスコア0.958、タミル語では0.829を達成した。
  • XLM-RoBERTaベースラインモデルは、統合されたヒンディ語およびタミル語の検証セットでJaccardスコア0.656を記録した。
  • XLM-RoBERTa+微調整モデルは、統合データセットでJaccardスコア0.749まで向上し、ベースライン比で14.18%の相対的改善を達成した。
  • RoBERTa+ヒンディ語/タミル語微調整モデルは、XLM-RoBERTaベースライン比で36.13%の相対的改善、XLM-RoBERTa+微調整モデル比で19.23%の改善を示した。
  • 誤り解析の結果、モデルはしばしば句読点(例:括弧)を回答に含めたり、文法的要素(例:タミル語で「言語」という語を追加したり)する傾向があり、構文的一般化の限界が示された。
  • モデル間のパフォーマンス格差は、語形変化や表記体系が著しく異なる言語(例:タミル語とヒンディ語)において、言語固有の微調整が顕著な利点をもたらすことを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。