[论文解读] BatGPT: A Bidirectional Autoregessive Talker from Generative Pre-trained Transformer
BatGPT 是由武汉大学与上海交通大学联合开发的双向自回归大语言模型,通过建模从左到右和从右到左的依赖关系,旨在提升流畅性、连贯性以及上下文保留能力。该模型在中文自然语言处理基准测试中表现卓越,CMMLU 基准平均准确率达到 36.72%,C-Eval 基准达到 57.4%,在困难子集上展现出强大的零样本推理能力。
BatGPT is a large-scale language model designed and trained jointly by Wuhan University and Shanghai Jiao Tong University. It is capable of generating highly natural and fluent text in response to various types of input, including text prompts, images, and audio. In the modeling level, we employ a bidirectional autoregressive architecture that allows the model to efficiently capture the complex dependencies of natural language, making it highly effective in tasks such as language generation, dialog systems, and question answering. Moreover, the bidirectional autoregressive modeling not only operates from left to right but also from right to left, effectively reducing fixed memory effects and alleviating model hallucinations. In the training aspect, we propose a novel parameter expansion method for leveraging the pre-training of smaller models and employ reinforcement learning from both AI and human feedback, aimed at improving the model's alignment performance. Overall, these approaches significantly improve the effectiveness of BatGPT, and the model can be utilized for a wide range of natural language applications.
研究动机与目标
- 通过引入双向自回归架构,解决现有自回归模型在记忆能力有限和幻觉生成方面的局限性。
- 通过来自人工智能与人类反馈的强化学习,提升模型与人类偏好及任务特定目标的一致性。
- 通过参数扩展与微调策略,提升在低资源及复杂推理任务上的表现。
- 开发一种多功能、大规模的语言模型,能够高效处理文本、图像与音频输入,同时保持高度流畅性与上下文连贯性。
提出的方法
- 采用双向自回归架构,从左到右与从右到左双向处理序列,以捕捉长距离依赖关系。
- 使用参数扩展策略,利用预训练的小型模型,实现对更大规模 BatGPT-15B 模型的高效训练。
- 整合来自人工智能生成反馈与人类反馈的强化学习,以提升与人类期望的一致性,并减少幻觉现象。
- 应用指令微调与文本到文本的任务建模方法,统一并提升在多样化自然语言处理任务上的性能。
- 在包含中文特有内容的多样化多语言数据集上进行训练,以提升在中文核心基准上的表现。
- 采用五次提示(five-shot prompting)设置进行评估,以检验模型在零样本与少样本场景下的泛化能力。

实验结果
研究问题
- RQ1与标准自回归模型相比,双向自回归架构是否能有效缓解记忆衰减与幻觉问题?
- RQ2来自人工智能与人类反馈的强化学习在多大程度上提升了大语言模型的一致性与事实准确性?
- RQ3从较小的预训练模型进行参数扩展,能在多大程度上提升如 BatGPT 这类大规模语言模型的性能?
- RQ4双向自回归设计是否能提升在 CMMLU 与 C-Eval 等复杂多领域基准上的零样本推理与少样本泛化能力?
- RQ5与现有模型相比,BatGPT 在中文自然语言处理基准中困难、推理密集型子集上的表现如何?
主要发现
- BatGPT-15B 在 CMMLU 基准上实现了 36.72% 的平均准确率,优于所有其他评估的中文导向大语言模型。
- 在 C-Eval 基准上,BatGPT-15B 总体准确率达到 57.4%,其中社会科学领域为 72.1%,人文学科领域为 60.7%。
- 在完整 CMMLU 数据集上,使用直接答案提示(direct answer prompting)得分 38.48%,使用思维链提示(chain-of-thought prompting)得分为 35.91%,表明在更大规模下仍有进一步提升空间。
- 在 C-Eval Hard 子集上,BatGPT-15B 达到 36.9% 的准确率,展现出在复杂、非平凡任务上的强大推理能力。
- 模型在 CMMLU 的所有类别中均表现稳健,中国相关主题准确率为 37.00%,其他类别为 42.14%。
- BatGPT-15B 在不同提示策略下表现出一致的性能,表明其具备强大的泛化能力与对多样化输入格式的适应性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。