QUICK REVIEW
[论文解读] Towards Comprehensive Vietnamese Retrieval-Augmented Generation and Large Language Models
Nguyen Quang Đuc, Le Hai Son|arXiv (Cornell University)|Mar 3, 2024
Natural Language Processing Techniques被引用 4
一句话总结
本文引入了一套全面的开源数据集和微调过的大型语言模型(LLM),专为越南语自然语言处理而设计,包括一个包含3200万篇文章的NewsCorpus(53GB)、结构化的Sapo和类别数据集、Alpaca风格的指令数据、合成对话数据,以及两个基于越南语优化的LLaMA2-7b模型,分别在40GB和120GB的精选多语言文本上进行预训练。其主要贡献在于通过特定领域的高质量预训练数据和一种自定义分词器(相比LLaMA2减少70%的token数量),显著提升了越南语LLM的性能。
ABSTRACT
This paper presents our contributions towards advancing the state of Vietnamese language understanding and generation through the development and dissemination of open datasets and pre-trained models for Vietnamese Retrieval-Augmented Generation (RAG) and Large Language Models (LLMs).
研究动机与目标
- 解决越南语LLM和RAG系统缺乏大规模、高质量训练数据的问题。
- 通过为不同自然语言处理任务创建专用数据集,提升越南语语言理解与生成能力。
- 通过自定义越南语分词器和在多样化、领域特定文本上的持续预训练,提升模型效率与性能。
- 通过以开放许可证发布数据集和模型,促进社区协作,推动开放研究生态的发展。
- 通过支持指令微调、语义搜索和对话生成的最先进成果,推动越南语NLP的发展。
提出的方法
- 通过合并并去重来自Binhvq及其它新来源的新闻,构建了一个包含3200万篇文章的越南语NewsCorpus(53GB),时间范围至2023年11月。
- 创建了以“标题-摘要-内容”格式组织的NewsSapo数据集(3170万组三元组),用于训练句子和段落嵌入模型。
- 基于VnExpress文章构建了包含59.6万个样本、覆盖21个主题的NewsCategory数据集,用于文本分类任务。
- 使用GPT-4和GPT-3.5生成了两个Alpaca风格的指令数据集:一个为“指令/输入/输出”格式(5万条样本),另一个为“输入/输出”格式(2.5万条样本)。
- 通过指令生成和GPT-4构建了一个合成的自对话数据集(3万组对话),以提升多轮对话能力。
- 在合并数据集(MSMarco、SQuAD v2、80%的Zalo法律挑战赛数据)上训练了一个基于PhoBERT-base-v2作为主干网络的越南语双编码器模型,在Zalo测试集上达到73.28%的Acc@1。
实验结果
研究问题
- RQ1如何系统性地收集和整理大规模、高质量的越南语文本数据,以支持LLM的持续预训练?
- RQ2特定领域、多语言的预训练混合数据在多大程度上能提升越南语LLM在下游任务中的表现?
- RQ3与标准分词器相比,自定义越南语分词器是否能显著减少分词开销并提升模型效率?
- RQ4合成的指令和对话数据在多大程度上能有效提升越南语LLM的指令遵循能力和对话能力?
- RQ5与40GB相比,在120GB多样化越南语文本上预训练基础LLM能带来多大的性能提升?
主要发现
- Vietnamese-LLaMA2-7b-120GB模型在124GB的预训练数据集上进行训练(其中104GB为越南语,20GB为英语),在四张A100 GPU上训练了40天,共使用4000 GPU小时。
- 自定义越南语分词器在编码越南语文本时,相比LLaMA2减少70%的token数量,相比ChatGPT减少50%。
- 越南语双编码器模型在Zalo法律文本检索挑战赛中达到73.28%的Acc@1,比在MSMarco上预训练的PhoBERT-base-v2高出25.44个百分点。
- 使用GPT-4和GPT-3.5生成的5万条“指令/输入/输出”格式的指令微调Alpaca数据集,支持多样化且高质量的监督微调。
- 2.5万条“输入/输出”格式的Alpaca数据集生成了更长、更多样化的输出,显著提升了模型在对话和指令任务中的响应质量。
- NewsCategory数据集在包含世界、商业、健康、娱乐等主题的21个类别中,实现了596,524个样本的文本分类,支持稳健的主题建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。