[論文レビュー] RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
本稿では、リtrieval増強型マスクed言語モデルとプレフィックス言語モデルを組み合わせることで、事前学習と推論の分布の不一致を軽減し、文脈内学習を強化するRavenを提案する。これにより、事前学習-テストの不一致と制限されたコンテキスト長という課題を解決し、再トレーニングなしにより多くのコンテキスト例を活用できるFusion-in-Context Learning (FiCL)を導入。180倍もパラメータが少ないにもかかわらず、非常に大きなモデルと同等の性能を達成する。
In this paper, we investigate the in-context learning ability of retrieval-augmented encoder-decoder language models. We first conduct a comprehensive analysis of existing models and identify their limitations in in-context learning, primarily due to a mismatch between pretraining and inference, as well as a restricted context length. To address these issues, we propose RAVEN, a model that combines retrieval-augmented masked language modeling and prefix language modeling. We further introduce Fusion-in-Context Learning to enhance the few-shot performance by enabling the model to leverage more in-context examples without requiring additional training. Through extensive experiments, we demonstrate that our simple yet effective design significantly improves performance, achieving results comparable to the most advanced language models in certain scenarios, despite having substantially fewer parameters. Our work underscores the potential of retrieval-augmented encoder-decoder language models for in-context learning and encourages further research in this direction.
研究の動機と目的
- リtrieval増強型エンコーダ-デコーダモデル、特に最先端のAtlasモデルにおける文脈内学習能力の調査と向上を目的とする。
- Atlasの少样本学習性能を阻害する事前学習-テスト分布の不一致と制限されたコンテキスト長という課題を解決すること。
- ファインチューニングやアーキテクチャ変更なしに、より多くのコンテキスト例を効果的に活用できる手法の開発。
- コンテキスト例のリtrievalが少样本学習性能を向上させる役割を明らかにすること。
- より小さな、リtrieval増強型エンコーダ-デコーダモデルが、はるかに大きなデコーダオンリーモデルと同等の性能を達成できることを示すこと。
提案手法
- Ravenは、リtrieval増強型マスクed言語モデルとプレフィックス言語モデルを組み合わせることで、事前学習と推論の分布を一致させ、事前学習-テストの不一致を低減する。
- Fusion-in-Context Learning (FiCL)により、推論時に動的に統合することで、モデルがより多くのコンテキスト例に注目し、情報を統合できる。
- モデルは推論時に内部のリtrieverを用いて関連するコンテキスト例を検索し、少样本学習性能を向上させる。
- アーキテクチャは双方向エンコーダとデコーダ内での統合メカニズムを活用し、取得したパassageと入力コンテキストを効果的に統合する。
- 再トレーニングやモデル変更を避けるために、推論時にリtrievalと動的統合に依存する。
- ゼロショットおよび少样本ベンチマーク(MMLUおよびNQ)で評価され、リtrievalとコンテキスト長に関するアブレーションスタディが実施された。

実験結果
リサーチクエスチョン
- RQ1Atlasのようなリtrieval増強型エンコーダ-デコーダモデルは、文脈内学習を効果的に行えるか。その主な制限要因は何か?
- RQ2事前学習-テスト分布の不一致は、エンコーダ-デコーダモデルにおける文脈内学習性能にどのように影響するか?
- RQ3Fusion-in-Context Learningは、追加のトレーニングやモデル変更なしに、より良い少样本学習性能を実現できるか?
- RQ4推論時に関連するコンテキスト例をリtrieveすることは、さらに少样本学習性能を向上させるか?
- RQ5より小さな、リtrieval増強型エンコーダ-デコーダモデルは、はるかに大きなデコーダオンリーモデルと同等の性能を達成できるか?
主な発見
- Ravenは、ゼロショットおよび少样本設定の両方でAtlasを顕著に上回り、FiCLを用いることでMMLU(11Bバージョン)で4.9ポイントの向上を達成した。
- MMLUベンチマークでは、Raven-11BがFiCLを用いて5ショット学習で50.5%の正答率を達成し、GPT-3 175Bのゼロショット性能(43.9%)を上回り、PaLM 62B(69.3%)に近づいた。
- コンテキスト例のリtrievalを導入することで、RavenはNQで1ショット学習で9.8%の絶対的向上を達成(11Bモデル)、関連する例のリtrievalの価値を示した。
- GPT-3 175Bに比べ180倍もパラメータが少ないにもかかわらず、Raven-11BはMMLUで同等の少样本学習性能を達成し、その効率性を示した。
- Raven-3Bのゼロショット性能(45.7%)は、GPT-3 175Bの少样本性能(26.0%)を上回っており、ファインチューニングなしで優れた一般化性能を示している。
- FiCLにより、11Bモデルはゼロショットよりも少样本学習でより良い性能を達成でき、通常の文脈内学習で見られる性能低下の逆転を実現した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。