[论文解读] SeaLLMs -- Large Language Models for Southeast Asia
SeaLLMs 引入了一套专为东南亚(SEA)语言定制的大型语言模型,通过在扩展的 SEA 专用词汇表上对 Llama-2 进行持续预训练、混合多语言指令微调以及自洽对齐优化,显著提升了模型性能。这些模型在低资源 SEA 语言中实现了最先进水平的表现,优于众多开源 LLM 及 ChatGPT-3.5,在泰语、高棉语、老挝语和缅甸语等非拉丁字母语言中表现更优,同时在英语任务中也保持了强劲性能。
Despite the remarkable achievements of large language models (LLMs) in various tasks, there remains a linguistic bias that favors high-resource languages, such as English, often at the expense of low-resource and regional languages. To address this imbalance, we introduce SeaLLMs, an innovative series of language models that specifically focuses on Southeast Asian (SEA) languages. SeaLLMs are built upon the Llama-2 model and further advanced through continued pre-training with an extended vocabulary, specialized instruction and alignment tuning to better capture the intricacies of regional languages. This allows them to respect and reflect local cultural norms, customs, stylistic preferences, and legal considerations. Our comprehensive evaluation demonstrates that SeaLLM-13b models exhibit superior performance across a wide spectrum of linguistic tasks and assistant-style instruction-following capabilities relative to comparable open-source models. Moreover, they outperform ChatGPT-3.5 in non-Latin languages, such as Thai, Khmer, Lao, and Burmese, by large margins while remaining lightweight and cost-effective to operate.
研究动机与目标
- 解决大型语言模型中存在的语言偏见问题,即过度偏向英语等高资源语言,而忽视低资源和区域性语言。
- 开发一套专为东南亚(SEA)语言的语言和文化特征量身定制的大型语言模型家族,涵盖泰语、越南语、高棉语、老挝语、缅甸语及其他语言。
- 在保持英语等高资源语言强性能的同时,提升多语言任务——尤其是低资源 SEA 语言——的性能表现。
- 打造一个轻量化、低成本且具备文化敏感性的 AI 助手,尊重东南亚地区的本地规范、习俗和法律框架。
- 证明针对特定区域的微调与自监督对齐方法,可在区域特定的语言理解与生成任务中超越通用模型。
提出的方法
- 使用扩展词汇表和从公共来源(如 Common Crawl、CC-News、Wikipedia 和学术出版物)收集的筛选后多语言语料库,对 Llama-2 进行持续预训练,利用 FastText 筛选出东南亚语言内容。
- 采用混合微调策略,结合多语言预训练数据与以英语为主的指令微调数据,以平衡多语言能力与指令遵循性能。
- 在覆盖 10 种 SEA 语言的平衡、自建多语言监督微调(SFT)数据集上进行专门的指令微调,以提升零样本和少样本泛化能力。
- 利用 SeaLLM 模型自身进行自偏好对齐优化,避免依赖人工标注者或更强大的 LLM 进行奖励建模。
- 采用多阶段训练流程:持续预训练 → 混合微调 → SFT → 自偏好对齐优化。
- 使用 GPT-4 作为裁判,在涵盖 9 种语言和 5 类任务(包括世界知识、阅读理解与机器翻译)的综合性基准(Sea-bench)上进行评估。
![Figure 1 : Sea-bench ( Section 4.2 ) scores as evaluated by GPT-4 [ 38 ] for different models.Each radar chart compares scores as averaged across 5 categories (left) and 9 languages (right). Detailed breakdown by each category and language is given in Figure 7 in the Appendix.](https://ar5iv.labs.arxiv.org/html/2312.00738/assets/img/fig_sea_bench_side_by_side.png)
实验结果
研究问题
- RQ1与基础 Llama-2 模型相比,使用扩展的 SEA 语言语料库进行持续预训练,是否能显著提升低资源东南亚语言的性能?
- RQ2混合微调与专门指令微调在多语言指令遵循能力方面,能在多大程度上提升多样化的 SEA 语言表现?
- RQ3在无须人工标注偏好数据的情况下,自偏好对齐是否能在助手类任务中实现与依赖人类偏好微调的模型相媲美的性能?
- RQ4在非拉丁字母 SEA 语言中,特别是低资源环境下,SeaLLM-13B 相较于 SOTA 模型如 ChatGPT-3.5 表现如何?
- RQ5在模型微调中引入文化与法律敏感性内容,是否能改善其在东南亚文化背景下的真实助手应用中的行为表现?
主要发现
- SeaLLM-13b-5L 在 13B 参数模型中世界知识基准得分最高(63.20),在 5 种 SEA 语言中优于 Llama-2-13b(61.17)及其他开源模型。
- 在阅读理解任务中,SeaLLM-13b-10L 在 XQuAD 基准上对泰语的 F1 得分为 59.50,显著优于 Llama-2-13b(25.73),并接近 ChatGPT-3.5 在英语中的表现(69.18)。
- 在机器翻译任务中,SeaLLM-13B 在 10 个翻译方向中的 8 个(涉及低资源语言如老挝语和高棉语)优于 ChatGPT-3.5,尤其在 En→Lao 和 En→Khmer 方向的 chrF++ 得分更高。
- 在 SEA 语言之间的直接翻译中,SeaLLM-13B 在 10 对语言中的 7 对上获得高于 ChatGPT-3.5 的 chrF++ 得分,尤其在低资源语言组合中表现突出。
- SeaLLM-13b-5L 在 Sea-bench 助手评估中获得 55.23 分,优于 ChatGPT-3.5 在非拉丁字母语言中的表现,同时在英语任务中保持强劲性能。
- 自偏好对齐方法使模型在无需人工标注偏好数据的情况下实现高性能,证明了在多语言环境中自监督对齐的可行性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。