Skip to main content
QUICK REVIEW

[論文レビュー] Towards Comprehensive Vietnamese Retrieval-Augmented Generation and Large Language Models

Nguyen Quang Đuc, Le Hai Son|arXiv (Cornell University)|Mar 3, 2024
Natural Language Processing Techniques被引用数 4
ひとこと要約

本論文は、ベトナム語自然言語処理のための包括的なオープンソースデータセットおよびファインチューニング済み大規模言語モデル(LLM)スイートを紹介している。これには、3200万件の記事を含むニュースコーパス(53GB)、構造化されたサポおよびカテゴリデータセット、Alpaca風の指示データ、合成対話データ、および40GBおよび120GBの洗練済み多言語テキストで事前学習された2種類のベトナム語最適化LLaMA2-7bモデルが含まれる。主な貢献は、ドメイン特化型で高品質な事前学習データと、LLaMA2と比較して70%もトークン数を削減する独自のトークナイザーを用いることで、ベトナム語LLMの性能を顕著に向上させた点である。

ABSTRACT

This paper presents our contributions towards advancing the state of Vietnamese language understanding and generation through the development and dissemination of open datasets and pre-trained models for Vietnamese Retrieval-Augmented Generation (RAG) and Large Language Models (LLMs).

研究の動機と目的

  • ベトナム語LLMおよびRAGシステムのための、大規模かつ高品質な学習データの不足に対処すること。
  • 異なるNLPタスク向けに特化したデータセットを構築することで、ベトナム語の理解および生成能力を向上させること。
  • ドメイン特化型のテキストと多様な分野のテキストを用いた継続的事前学習と、独自のベトナム語トークナイザーにより、モデルの効率性とパフォーマンスを向上させること。
  • コミュニティの協働を促進するため、オープンライセンスのもとでデータセットとモデルを公開し、オープンな研究エコシステムを育成すること。
  • 指令微調整、意味的検索、対話生成の分野で最先端の結果を実現することで、ベトナム語NLPの発展を推進すること。

提案手法

  • 2023年11月までに収集されたBinhvqおよび新規ソースのニュースを統合・重複除去して、3200万件の記事を含むベトナム語ニュースコーパス(53GB)を構築した。
  • 文およびパラグラフ埋め込みの学習に使用するため、『見出し-要約-本文』形式の3170万組の三つ組みデータセット(NewsSapo)を構築した。
  • VnExpressの記事を用いて、21のトピックにまたがる59万6524件のサンプルを含むニュースカテゴリデータセット(NewsCategory)を構築した。
  • GPT-4およびGPT-3.5を用いて、『指令/入力/出力』形式(5万件)および『入力/出力』形式(2万5000件)の2種類のAlpaca風指令データセットを生成した。
  • 指示生成とGPT-4を用いて合成自己対話データセット(3万件の対話)を構築し、マルチターン会話能力の向上を図った。
  • PhoBERT-base-v2をバックボーンとして用い、統合されたデータ(MSMarco、SQuAD v2、Zalo法的チャレンジの80%)上でバイエンコーダーを学習した。Zaloテストスプリットでは73.28%のAcc@1を達成した。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ高品質なベトナム語テキストデータを、LLMの継続的事前学習のために体系的に収集・整備する方法は何か?
  • RQ2ドメイン特化型の多言語事前学習混合データは、ベトナム語LLMの下流タスクにおけるパフォーマンスをどの程度向上させ得るか?
  • RQ3独自のベトナム語トークナイザーは、標準的なトークナイザーと比較して、トークン化のオーバーヘッドを顕著に低減させ、モデルの効率性を向上させ得るか?
  • RQ4合成された指令および対話データは、ベトナム語LLMの指令従従性および会話能力をどの程度向上させるか?
  • RQ540GBと比較して、120GBの多様なベトナム語テキストでベースLLMを事前学習することで、どの程度のパフォーマンス向上が達成できるか?

主な発見

  • ベトナム語-LLaMA2-7b-120GBモデルは、124GBの事前学習データセット(うち104GBがベトナム語、20GBが英語)を用い、4台のA100GPUで40日間、合計4000GPU時間の学習を実施した。
  • 独自のベトナム語トークナイザーは、LLaMA2と比較して70%、ChatGPTと比較して50%もトークン数を削減した。
  • ベトナム語バイエンコーダーは、Zalo法的テキスト検索チャレンジで73.28%のAcc@1を達成し、MSMarcoで事前学習されたPhoBERT-base-v2を25.44ポイント上回った。
  • 『指令/入力/出力』形式の5万件の指令微調整済みAlpacaデータセットは、GPT-4およびGPT-3.5を用いて生成され、多様で高品質な教師あり微調整を可能にした。
  • 『入力/出力』形式の2万5000件のAlpacaデータセットは、より長い出力と多様な出力を生み出し、対話および指令タスクにおけるモデルの応答品質を向上させた。
  • ニュースカテゴリデータセットは、世界、経済、健康、エンタメなど、21のトピックにまたがる59万6524件のサンプルを用いて、21クラス分類を実現し、強固なトピックモデリングを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。