Skip to main content
QUICK REVIEW

[論文レビュー] BatGPT: A Bidirectional Autoregessive Talker from Generative Pre-trained Transformer

Zuchao Li, Shitou Zhang|arXiv (Cornell University)|Jul 1, 2023
Topic Modeling被引用数 4
ひとこと要約

BatGPT は武漢大学と上海交通大学が開発した双方向自己回帰的大型言語モデルであり、左から右および右から左の依存関係をモデル化することで、滑らかさ、一貫性、文脈の保持を向上させることを目的としている。中国語 NLP ベンチマークにおいて最先端の性能を発揮し、CMMLU で平均 36.72%、C-Eval で 57.4% の正答率を記録。特に難易度の高いサブセットにおいても強力なゼロショット推論能力を示している。

ABSTRACT

BatGPT is a large-scale language model designed and trained jointly by Wuhan University and Shanghai Jiao Tong University. It is capable of generating highly natural and fluent text in response to various types of input, including text prompts, images, and audio. In the modeling level, we employ a bidirectional autoregressive architecture that allows the model to efficiently capture the complex dependencies of natural language, making it highly effective in tasks such as language generation, dialog systems, and question answering. Moreover, the bidirectional autoregressive modeling not only operates from left to right but also from right to left, effectively reducing fixed memory effects and alleviating model hallucinations. In the training aspect, we propose a novel parameter expansion method for leveraging the pre-training of smaller models and employ reinforcement learning from both AI and human feedback, aimed at improving the model's alignment performance. Overall, these approaches significantly improve the effectiveness of BatGPT, and the model can be utilized for a wide range of natural language applications.

研究の動機と目的

  • 標準の自己回帰的モデルが抱える限界、たとえば記憶の制限や幻覚現象を解消するため、双方向自己回帰アーキテクチャを導入すること。
  • AI と人間のフィードバックの両方からの強化学習を活用し、人間の好みやタスク固有の目的との整合性を高めること。
  • パラメータ拡張とファインチューニング戦略を用いて、リソースが限られたタスクや複雑な推論タスクの性能を向上させること。
  • テキスト、画像、音声の入力を高品質で文脈的に一貫性のある形で処理できる、多様性に富んだ大規模言語モデルの開発。

提案手法

  • 左から右および右から左の両方向にシーケンスを処理する双方向自己回帰アーキテクチャを採用し、長距離依存関係を捉える。
  • 事前学習済みの小型モデルを活用するパラメータ拡張戦略を用い、大規模な BatGPT-15B モデルの効率的学習を実現。
  • 人間のフィードバックに加え、AI が生成したフィードバックから強化学習を適用し、人間の期待との整合性を高め、幻覚を低減。
  • インstructチューニングとテキストからテキストへのタスク定式化を適用し、多様な NLP タスクにおける性能を統一的かつ強化。
  • 中国語固有のコンテンツを含む多様で多言語のデータセットを学習に使用し、中国語中心のベンチマークでの性能向上を図る。
  • ゼロショットおよび少数ショットの一般化能力を評価するため、評価に 5 ショットプロンプティング設定を採用。
Figure 1: Annotation platform.
Figure 1: Annotation platform.

実験結果

リサーチクエスチョン

  • RQ1標準の自己回帰的モデルと比較して、双方向自己回帰アーキテクチャは記憶の劣化や幻覚現象を軽減できるか?
  • RQ2AI と人間の両方からのフィードバックによる強化学習は、大規模言語モデルにおける整合性と事実の正確性をどのように向上させるか?
  • RQ3小型事前学習モデルからのパラメータ拡張は、BatGPT のような大規模言語モデルの性能をどの程度向上させられるか?
  • RQ4双方向自己回帰設計は、CMMLU や C-Eval のような複雑で多分野にまたがるベンチマークにおけるゼロショット推論および少数ショット一般化を向上させるか?
  • RQ5既存のモデルと比較して、BatGPT は中国語 NLP ベンチマークの難易度の高い推論中心のサブセットでどの程度の性能を示すか?

主な発見

  • BatGPT-15B は CMMLU ベンチマークで平均 36.72% の正答率を達成し、評価されたすべての中国語指向 LLM よりも優れた性能を示した。
  • C-Eval ベンチマークでは、全体で 57.4% の正答率を記録し、社会科学分野で 72.1%、人文学分野で 60.7% の成績を上げた。
  • 直接回答プロンプティングを用いた場合、CMMLU 全体で 38.48% のスコアを記録し、チェーン・オブ・トゥオンク(思考の道筋)プロンプティングでは 35.91% を記録した。これは、より大規模なスケーリングによりさらなる改善が見込まれることを示唆している。
  • C-Eval の Hard サブセットでは 36.9% の正答率を達成し、挑戦的で非自明なタスクにおいても強力な推論能力を示した。
  • CMMLU のすべてのカテゴリで安定したパフォーマンスを示し、中国関連のトピックでは 37.00%、その他のカテゴリでは 42.14% の正答率を記録した。
  • BatGPT-15B はさまざまなプロンプティング戦略において一貫したパフォーマンスを示し、多様な入力フォーマットへの一般化能力および適応性が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。