[論文レビュー] Typhoon: Thai Large Language Models
Typhoon は、Mistral-7B をベースに、ターゲットを絞ったタイ語事前学習とインstructチューニングを用いて微調整された 70 億パラメータのタイ語大規模言語モデルであり、オープンソースのタイ語ベンチマークで最先端のパフォーマンスを達成し、トークン化において GPT-3.5 のパフォーマンスを再現しながらも、2.62 倍の効率性を示している。モデルは、国立試験に基づくカスタムベンチマークである ThaiExam を用いて評価され、インstructフォローアップ、翻訳、要約、質問応答の各タスクで、既存のオープンソースモデルを上回っている。
Typhoon is a series of Thai large language models (LLMs) developed specifically for the Thai language. This technical report presents challenges and insights in developing Thai LLMs, including data preparation, pretraining, instruction-tuning, and evaluation. As one of the challenges of low-resource languages is the amount of pretraining data, we apply continual training to transfer existing world knowledge from a strong LLM. To evaluate the Thai knowledge encapsulated in each model from the pretraining stage, we develop ThaiExam, a benchmark based on examinations for high-school students and investment professionals in Thailand. In addition, we fine-tune Typhoon to follow Thai instructions, and we evaluate instruction-tuned models on Thai instruction datasets as well as translation, summarization, and question-answering tasks. Experimental results on a suite of Thai benchmarks show that Typhoon outperforms all open-source Thai language models, and its performance is on par with GPT-3.5 in Thai while having only 7 billion parameters and being 2.62 times more efficient in tokenizing Thai text.
研究の動機と目的
- 既存の多言語および英語中心の LLM におけるタイ語の不足を補うために、タイ語に特化した高性能でオープンソースの大規模言語モデルを開発すること。
- タイ語 NLP におけるデータ不足を克服するため、強力なベースモデルから世界の知識を転移できるように、選別されたタイ語コーパスを用いた継続的事前学習を実施すること。
- 本物の国立試験に基づくドメイン特化ベンチマーク、たとえば ThaiExam を用いて、タイ語理解力およびインstructフォローアップ能力を評価すること。
- タイ語のネイティブデータおよび翻訳済みインstructデータセットを用いたインストラクションチューニングにより、アライメント性とゼロショット一般化性能を向上させること。
- タイ語 NLP 分野におけるさらなる研究開発を促進するため、Apache-2.0 ライセンスの下で Typhoon を公開すること。
提案手法
- ドメイン固有の知識および言語理解を向上させるために、選別された中程度のタイ語テキストコーパスを用いて Mistral-7B の継続的事前学習を実施すること。
- 高校および投資プロフェッショナル試験に基づく、Factual および文化的知識の評価を目的とした、ThaiExam と呼ばれるベンチマークの開発。
- ゼロショットおよびフェイズドショットのアライメントを向上させるために、ネイティブのタイ語および翻訳済みインストラクションフォローアップデータセットを用いて Typhoon のインストラクションチューニングを実施すること。
- GPT-4 をジャッジとして用い、LLM-judge フレームワーク(AlpacaEval、OASST、MT-Bench、Sea-bench)を用いてインストラクションフォローアップパフォーマンスを測定すること。
- 標準的な NLP タスクにおけるゼロショット評価:機械翻訳(FLORES-200)、要約(XLSum、CrossSum)、質問応答(XQuAD)を標準指標を用いて実施すること。
- 新しいmmトークナイザーの使用により、ベースモデルと比較して 2.62 倍の高速化を達成したタイ語トークン化効率の向上。

実験結果
リサーチクエスチョン
- RQ1中程度のタイ語コーパスを用いたターゲットを絞った事前学習により、強力な英語中心の LLM がタイ語に効果的に適応可能かどうか。
- RQ2特に ThaiExam のような試験ベースのベンチマークにおいて、Typhoon は既存のオープンソースタイ語 LLM よりもドメイン特化知識評価でどれほど優れているか。
- RQ3ネイティブタイ語および翻訳済みデータセットを用いたインストラクションチューニングが、翻訳、要約、質問応答タスクにおけるゼロショット一般化性能をどの程度向上させるか。
- RQ4GPT-3.5 と比較して、Typhoon はタイ語におけるインストラクションフォローアップおよび事実的推論の観点で、どの程度のパフォーマンスを示すか。
- RQ5トークン化効率の向上が、タイ語 NLP アプリケーションにおける推論速度およびモデルデプロイメントに与える影響は何か。
主な発見
- Typhoon-7B-Instruct は、タイ語 AlpacaEval で 49.05% の勝率を記録し、すべての他のオープンソースタイ語 LLM を上回り、GPT-3.5 と同等のパフォーマンスを達成した。
- 翻訳済み MT-Bench では、Typhoon-7B-Instruct が 55.52% の勝率を記録し、再びすべての他のオープンソースモデルを上回り、GPT-3.5 と同等のパフォーマンスを示した。
- ゼロショット NLP タスクにおいて、Typhoon-7B-Instruct は FLORES-200 の英語→タイ語翻訳で最高の BLEU スコア 46.62 を達成し、XLSum(タイ語→タイ語要約)では最高の ROUGE-L スコア 14.51 を記録した。
- XQuAD では、0 ショット設定で 34.46% の F1 スコアを記録し、OpenThaiGPT や SeaLLM-7B-Chat を上回った。
- Typhoon は、ベースの Llama2 モデルと比較して、タイ語テキストのトークン化効率が 2.62 倍向上し、推論速度および効率性が顕著に向上した。
- Typhoon-7B-Instruct は、要約および質問応答タスクにおいて、ROUGE-L スコアがそれぞれ 21.60 および 17.32 と、すべての他のオープンソースモデルを上回る強力なゼロショット能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。