Skip to main content
QUICK REVIEW

[论文解读] Camoscio: an Italian Instruction-tuned LLaMA

Andrea Santilli, Emanuele Rodolà|arXiv (Cornell University)|Jul 31, 2023
Topic ModelingComputer Science被引用 3
一句话总结

Camoscio 是一个参数量为 7B 的指令微调版 LLaMA 模型,通过在 GPT-3.5 翻译的 52,000 对英文指令对数据集上使用 LoRA 进行微调,专为意大利语优化。该模型在意大利语 NLP 任务中展现出强大的零样本性能,在 NewsSum-IT、SQuAD-IT 和 XFORMAL-IT 等基准测试中优于专用模型,所有相关资源均已公开发布,以支持意大利语 NLP 研究。

ABSTRACT

In recent years Large Language Models (LLMs) have increased the state of the art on several natural language processing tasks. However, their accessibility is often limited to paid API services, posing challenges for researchers in conducting extensive investigations. On the other hand, while some open-source models have been proposed by the community, they are typically English-centric or multilingual without a specific adaptation for the Italian language. In an effort to democratize the available and open resources for the Italian language, in this paper we introduce Camoscio: a language model specifically tuned to follow users' prompts in Italian. Specifically, we finetuned the smallest variant of LLaMA (7b) with LoRA on a corpus of instruction prompts translated to Italian via ChatGPT. Results indicate that the model's zero-shot performance on various downstream tasks in Italian competes favorably with existing models specifically finetuned for those tasks. All the artifacts (code, dataset, model) are released to the community at the following url: https://github.com/teelinsan/camoscio

研究动机与目标

  • 为解决缺乏开放、高质量、专为意大利语设计的指令微调大语言模型的问题,创建一个专为意大利语打造的模型。
  • 通过使用专为意大利语定制的指令数据对 LLaMA 进行微调,提升其在意大利语下游 NLP 任务中的零样本性能。
  • 通过在 CC BY 4.0 许可下发布模型、数据集和代码,实现对强大语言模型在意大利语 NLP 领域的民主化访问。
  • 证明在低资源语言(如意大利语)中,通过在翻译的英文指令数据上进行指令微调,可获得具有竞争力的性能表现。
  • 提供一个社区资源,支持在隐私敏感领域中的意大利语 NLP 研究,尤其是在无法使用 API 的场景下。

提出的方法

  • 使用 LoRA(一种参数高效的微调技术)对最小的 LLaMA 变体(7B 参数)进行微调,以使模型能够遵循指令。
  • 通过使用 GPT-3.5 将斯坦福 Alpaca 数据集中 52,000 对英文指令-输出对翻译成意大利语,构建了一个新的意大利语指令微调数据集。
  • 使用翻译后的数据集对 LLaMA 模型进行指令微调,使其能够理解并响应意大利语中的自然语言提示。
  • 在不进行进一步微调的情况下,评估模型在多个意大利语基准测试中的零样本性能。
  • 通过 GitHub 以 CC BY 4.0 许可公开发布所有模型权重、训练代码和完整的指令数据集。
  • 利用指令微调大语言模型强大的零样本泛化能力,在多样化的意大利语 NLP 任务中实现具有竞争力的性能表现。

实验结果

研究问题

  • RQ1当在翻译的指令数据上进行训练时,微调后的 LLaMA 模型是否能在意大利语 NLP 任务中实现强大的零样本性能?
  • RQ2与现有的专用模型或多语言模型相比,意大利语指令微调版 LLaMA 模型在下游任务中的性能表现如何?
  • RQ3参数高效的微调技术(LoRA)在标准桌面硬件上能否有效支持高性能意大利语大语言模型的训练?
  • RQ4通过 GPT-3.5 翻译英文指令数据,是否能生成高质量、可用的意大利语指令数据集?
  • RQ5开源一个高性能的意大利语指令微调大语言模型,是否能支持在无法使用 API 的隐私敏感领域中的研究工作?

主要发现

  • Camoscio 在 NewsSum-IT 基准测试中实现了具有竞争力的零样本性能,优于专门针对摘要任务微调的模型。
  • 在 SQuAD-IT 阅读理解基准测试中,Camoscio 生成的答案具有高度的事实准确性,性能与或超过专用模型。
  • 在 XFORMAL-IT 文本风格转换任务中,Camoscio 成功实现了正式与非正式意大利语之间的相互转换,展现出强大的语言控制能力。
  • 尽管微调所用数据集较小且为单一语言,Camoscio 在所有评估基准上的性能仍与或优于现有多语言模型(如 BLOOM 和 LLaMA)。
  • LoRA 的使用使得在消费级硬件上高效微调 7B 参数模型成为可能,证明了其可扩展性和高效性。
  • 所有模型权重、训练代码和完整的意大利语指令数据集均已公开发布,支持可复现性及社区的进一步开发。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。