[论文解读] Typhoon: Thai Large Language Models
Typhoon 是一个参数量为 70 亿的泰语大语言模型,基于 Mistral-7B 经过针对性的泰语预训练和指令微调,其在开源泰语基准测试中表现达到最先进水平,并在泰语任务中达到 GPT-3.5 的性能,同时在分词效率上高出 2.62 倍。该模型通过基于国家考试的自定义基准 ThaiExam 进行评估,在指令遵循、翻译、摘要生成和问答任务上均优于现有开源模型。
Typhoon is a series of Thai large language models (LLMs) developed specifically for the Thai language. This technical report presents challenges and insights in developing Thai LLMs, including data preparation, pretraining, instruction-tuning, and evaluation. As one of the challenges of low-resource languages is the amount of pretraining data, we apply continual training to transfer existing world knowledge from a strong LLM. To evaluate the Thai knowledge encapsulated in each model from the pretraining stage, we develop ThaiExam, a benchmark based on examinations for high-school students and investment professionals in Thailand. In addition, we fine-tune Typhoon to follow Thai instructions, and we evaluate instruction-tuned models on Thai instruction datasets as well as translation, summarization, and question-answering tasks. Experimental results on a suite of Thai benchmarks show that Typhoon outperforms all open-source Thai language models, and its performance is on par with GPT-3.5 in Thai while having only 7 billion parameters and being 2.62 times more efficient in tokenizing Thai text.
研究动机与目标
- 开发一个高性能、专为泰语设计的开源大语言模型,以解决现有多语言及以英语为中心的大语言模型中泰语代表性不足的问题。
- 通过在精心筛选的泰语语料上进行持续预训练,克服泰语 NLP 中的数据稀缺问题,从而将强基座模型中的世界知识迁移至泰语领域。
- 利用基于真实国家考试的领域特定基准(如 ThaiExam)评估泰语理解能力和指令遵循能力。
- 通过在原生泰语及翻译后的指令数据集上进行指令微调,提升模型对齐能力与零样本泛化能力。
- 以 Apache-2.0 许可证发布 Typhoon,以促进泰语 NLP 领域的进一步研究与发展。
提出的方法
- 在精心筛选的中等规模泰语文本语料上对 Mistral-7B 进行持续预训练,以增强特定领域知识和语言理解能力。
- 开发 ThaiExam 基准,该基准基于高中和投资专业人士的考试内容,用于评估泰语大语言模型的事实性与文化知识。
- 使用原生泰语及翻译后的指令遵循数据集对 Typhoon 进行指令微调,以提升零样本和少样本对齐能力。
- 使用 LLM-judge 框架(AlpacaEval、OASST、MT-Bench、Sea-bench)并以 GPT-4 作为裁判模型,评估指令遵循性能。
- 在标准 NLP 任务上进行零样本评估:机器翻译(FLORES-200)、抽象摘要生成(XLSum、CrossSum)和问答(XQuAD),采用标准指标。
- 采用 newmm 分词器提升泰语分词效率,实现相比基座模型快 2.62 倍的分词速度。

实验结果
研究问题
- RQ1通过在中等规模泰语文本语料上进行针对性预训练,能否有效将强英语中心的大语言模型适配至泰语?
- RQ2与现有开源泰语大语言模型相比,Typhoon 在特定领域知识评估(特别是基于考试的基准如 ThaiExam)中的表现如何?
- RQ3在原生泰语和翻译后的数据集上进行指令微调,能在多大程度上提升翻译、摘要生成和问答任务上的零样本泛化能力?
- RQ4在泰语任务中,Typhoon 的表现与 GPT-3.5 相比如何,特别是在指令遵循和事实推理方面?
- RQ5提升分词效率对推理速度和泰语 NLP 应用中模型部署有何影响?
主要发现
- Typhoon-7B-Instruct 在 Thai AlpacaEval 上取得 49.05% 的胜率,优于所有其他开源泰语大语言模型,并与 GPT-3.5 在该基准上的表现相当。
- 在翻译版 MT-Bench 上,Typhoon-7B-Instruct 取得 55.52% 的胜率,再次优于所有其他开源模型,并与 GPT-3.5 表现持平。
- 在零样本 NLP 任务中,Typhoon-7B-Instruct 在 FLORES-200 英文到泰语翻译任务中取得最高的 BLEU 得分 46.62,在 XLSum(泰语到泰语摘要)任务中取得最高的 ROUGE-L 得分 14.51。
- 在 XQuAD 的零样本设置下,Typhoon-7B-Instruct 取得 34.46% 的 F1 分数,优于 OpenThaiGPT 和 SeaLLM-7B-Chat。
- 与基座 Llama2 模型相比,Typhoon 在泰语文本处理上实现了 2.62 倍的分词效率提升,显著提高了推理速度与效率。
- Typhoon-7B-Instruct 在摘要生成和问答任务中展现出强大的零样本能力,ROUGE-L 得分分别为 21.60 和 17.32,均优于所有其他开源模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。