Skip to main content
QUICK REVIEW

[论文解读] A Technical Report for Polyglot-Ko: Open-Source Large-Scale Korean Language Models

Hyunwoong Ko, Kichang Yang|arXiv (Cornell University)|Jun 4, 2023
Topic Modeling被引用 4
一句话总结

本文介绍了 Polyglot-Ko,一套基于 863GB 清洗后的 1.2TB 韩语文本数据训练而成的开源、大规模韩语语言模型(参数量从 1.3B 到 12.8B 不等)。这些模型在 KOBEST 基准测试中实现了具有竞争力的零样本和少样本性能,其中 12.8B 参数模型是目前公开可用的最大规模、适用于商业用途的韩语模型,展现出推动韩语自然语言处理发展的强大潜力。

ABSTRACT

Polyglot is a pioneering project aimed at enhancing the non-English language performance of multilingual language models. Despite the availability of various multilingual models such as mBERT (Devlin et al., 2019), XGLM (Lin et al., 2022), and BLOOM (Scao et al., 2022), researchers and developers often resort to building monolingual models in their respective languages due to the dissatisfaction with the current multilingual models non-English language capabilities. Addressing this gap, we seek to develop advanced multilingual language models that offer improved performance in non-English languages. In this paper, we introduce the Polyglot Korean models, which represent a specific focus rather than being multilingual in nature. In collaboration with TUNiB, our team collected 1.2TB of Korean data meticulously curated for our research journey. We made a deliberate decision to prioritize the development of Korean models before venturing into multilingual models. This choice was motivated by multiple factors: firstly, the Korean models facilitated performance comparisons with existing multilingual models; and finally, they catered to the specific needs of Korean companies and researchers. This paper presents our work in developing the Polyglot Korean models, which propose some steps towards addressing the non-English language performance gap in multilingual language models.

研究动机与目标

  • 通过开发高质量的专用单语模型,解决多语言模型在非英语语言(尤其是韩语)中的性能差距问题。
  • 为韩国的研究人员和从业者提供一个强大、易用且可商业化的韩语自然语言处理模型,以满足本地化任务需求。
  • 通过首先在单一语言中实现高质量的训练与评估,为未来多语言模型的发展奠定基础。
  • 证明在低资源、非英语语境(如韩语)下,专用单语模型可超越多语言模型的表现。

提出的方法

  • Polyglot-Ko 模型基于 Transformer 架构,针对大规模韩语语料库的下一个词预测任务进行了优化。
  • TUNiB 收集并清洗了 1.2TB 的韩语数据集,涵盖新闻、博客、专利和社交媒体等多种来源。
  • 数据经过预处理后缩减为 863GB 的干净文本,重点保留了文档结构,但后续发现换行符处理存在错误。
  • 使用多节点训练基础设施,训练了四个参数量逐级增加的模型:1.3B、3.8B、5.8B 和 12.8B。
  • 通过 KOBEST 基准测试对模型进行评估,涵盖多个自然语言处理任务的零样本和少样本性能。
  • 开发了一种改进的提示模板,以稳定零样本性能,特别是在情感分析任务中,解决了默认提示带来的不稳定性。
(a)
(a)

实验结果

研究问题

  • RQ1大规模单语韩语语言模型是否能在韩语自然语言处理任务中超越现有多语言模型?
  • RQ2模型规模(参数量)如何影响韩语环境下零样本和少样本基准测试的性能?
  • RQ3在低资源语言环境下,数据质量与预处理对模型性能和可靠性的影响程度如何?
  • RQ4专用单语模型能否作为未来东亚语系和罗曼语系多语言模型的可行基础?
  • RQ5提示工程在多大程度上可缓解情感分析与否定检测任务中零样本评估的不稳定性?

主要发现

  • Polyglot-Ko 模型在 KOBEST 基准测试中表现优异,且随着参数量从 1.3B 增加到 12.8B,性能持续提升。
  • 12.8B 参数模型是目前公开可用的最大规模、适用于商业应用的韩语语言模型,为韩语自然语言处理生态系统的建设作出了重要贡献。
  • 改进的提示模板显著提升了 SentiNeg 任务中的零样本性能,有效缓解了默认提示带来的不稳定性。
  • 5.8B 和 12.8B 参数模型在基准测试的全部四项任务中均展现出强大的少样本性能,表明其具备出色的少样本泛化能力。
  • 尽管数据质量较高,但数据预处理中的错误——特别是错误地删除换行符——可能导致信息丢失,应在后续版本中修正。
  • 随着计算资源的增加,模型性能持续提升,证实了韩语语境下也存在缩放定律趋势。
(b)
(b)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。