[论文解读] PanGu-Bot: Efficient Generative Dialogue Pre-training from Pre-trained Language Model
PANGU-BOT 是一个基于大型预训练语言模型 PANGU-α 微调而成的中文开放域对话模型,仅使用 1 亿条高质量对话语料进行微调,在响应质量、知识正确性和安全性方面达到最先进水平,同时显著降低了数据和计算成本。该模型无需进一步训练即可生成情绪化响应。
In this paper, we introduce PanGu-Bot, a Chinese pre-trained open-domain dialogue generation model based on a large pre-trained language model (PLM) PANGU-alpha (Zeng et al.,2021). Different from other pre-trained dialogue models trained over a massive amount of dialogue data from scratch, we aim to build a powerful dialogue model with relatively fewer data and computation costs by inheriting valuable language capabilities and knowledge from PLMs. To this end, we train PanGu-Bot from the large PLM PANGU-alpha, which has been proven well-performed on a variety of Chinese natural language tasks. We investigate different aspects of responses generated by PanGu-Bot, including response quality, knowledge, and safety. We show that PanGu-Bot outperforms state-of-the-art Chinese dialogue systems (CDIALGPT (Wang et al., 2020), EVA (Zhou et al., 2021), EVA2.0 (Gu et al., 2022)) w.r.t. the above three aspects. We also demonstrate that PanGu-Bot can be easily deployed to generate emotional responses without further training. Throughout our empirical analysis, we also point out that the PanGu-Bot response quality, knowledge correctness, and safety are still far from perfect, and further explorations are indispensable to building reliable and smart dialogue systems. Our model and code will be available at https://github.com/huawei-noah/Pretrained-Language-Model/tree/master/PanGu-Bot soon.
研究动机与目标
- 通过利用预训练语言模型而非从零开始训练,以降低开放域对话系统训练的数据和计算成本。
- 探究是否仅使用小规模、精心筛选的对话数据集,而非大规模、嘈杂的在线数据,也能实现高质量的对话性能。
- 评估并改进对话系统的关键方面:响应质量、知识正确性、安全性以及情绪化响应生成能力。
- 探索大型预训练模型是否能在不重新训练的情况下,继承并迁移知识与语言能力至对话生成任务。
提出的方法
- 在精心筛选的 1 亿轮对话数据集上微调参数量为 2000 亿的 PANGU-α 语言模型,构建两个版本:3.5 亿参数和 26 亿参数。
- 采用基于提示的微调策略,用户输入后接指令标记(如“生成高兴的回复”),以实现情绪化响应的条件控制。
- 利用 PANGU-α 已有的知识和语言能力,减少对大规模对话专用预训练的需求。
- 通过自动指标(如 BLEU、ROUGE、BERTScore)和人工评估,综合衡量模型在响应质量、事实正确性和安全性方面的表现。
- 采用对抗性提示测试模型在三类内容下的响应安全性:争议性、有害性和冒犯性内容。
- 使用零样本提示生成情绪化响应,无需在情绪标注数据上进行任何微调。
实验结果
研究问题
- RQ1通过利用大型预训练语言模型,仅使用小规模高质量对话数据集,是否能够实现对话模型的强性能?
- RQ2预训练语言模型在多大程度上能够继承并迁移知识至对话生成任务,从而减少幻觉并提升事实正确性?
- RQ3在对抗性提示和敏感提示下,PANGU-BOT 的安全性与现有中文对话模型相比如何?
- RQ4对话模型是否能在未对情绪标注数据进行微调的情况下,生成符合情绪的响应?
- RQ5在响应质量、知识准确性和安全性方面,仍存在哪些尚未解决的局限性,需要进一步研究?
主要发现
- 在响应质量方面,PANGU-BOT 显著优于当前最先进的中文对话系统(CDialGPT、EVA、EVA2.0),人工标注者评价其在合理性、具体性和趣味性方面均有提升。
- 与基线模型相比,PANGU-BOT 展现出显著更低的幻觉率,表明其因继承自 PANGU-α 而具备更强的知识正确性。
- 即使未在情绪数据上进行微调,PANGU-BOT 也能通过简单的情绪提示(如“生成高兴的回复”)生成情绪一致的响应,展现出零样本情绪生成能力。
- 尽管性能优异,PANGU-BOT 在对抗性提示下仍表现出明显的不安全响应生成,各类别中不安全响应比例均较高。
- PANGU-BOT 的 26 亿参数版本在“争议性”提示下表现略优于 EVA2.0,但在“有害性”和“冒犯性”提示下安全性更差,表明安全性方面仍有改进空间。
- 与从零开始训练的模型相比,PANGU-BOT 的训练所需计算量显著减少,体现了极高的训练效率和环境友好性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。