[論文レビュー] Human Parity on CommonsenseQA: Augmenting Self-Attention with External Attention
本稿では、知識グラフ、辞書、学習データからの外部知識を単純なテキスト連結によって統合することで、変換器モデルの推論性能を向上させる軽量なフレームワーク「推論のための知識豊富な外部注意(KEAR)」を提案する。アーキテクチャの変更なしに取得した外部知識を統合することで、KEARはCommonsenseQAで人間並みの性能(テスト精度89.4%、人間の88.9%)を達成し、GPT-3のような大規模モデルを上回る性能を示した。
Most of today's AI systems focus on using self-attention mechanisms and transformer architectures on large amounts of diverse data to achieve impressive performance gains. In this paper, we propose to augment the transformer architecture with an external attention mechanism to bring external knowledge and context to bear. By integrating external information into the prediction process, we hope to reduce the need for ever-larger models and increase the democratization of AI systems. We find that the proposed external attention mechanism can significantly improve the performance of existing AI systems, allowing practitioners to easily customize foundation AI models to many diverse downstream applications. In particular, we focus on the task of Commonsense Reasoning, demonstrating that the proposed external attention mechanism can augment existing transformer models and significantly improve the model's reasoning capabilities. The proposed system, Knowledgeable External Attention for commonsense Reasoning (KEAR), reaches human parity on the open CommonsenseQA research benchmark with an accuracy of 89.4\\% in comparison to the human accuracy of 88.9\\%.
研究の動機と目的
- モデルのスケーリングによる推論性能の向上の限界を克服するため、外部知識を統合すること。
- 巨大なモデルサイズに依存することを減らしながら、共通の常識的推論タスクにおける性能を向上させること。
- 非パrametricで更新可能な知識ソースを用いることで、モデルの解釈可能性と民主化を向上させること。
- 外部知識統合がベンチマークタスクで人間の性能を上回ることを実証すること。
- さまざまな下流NLPアプリケーションに容易に適応可能な軽量でモジュラーなフレームワークを提供すること。
提案手法
- 本手法は、3つの外部ソース(ConceptNet(知識グラフ)、Wiktionary(辞書)、学習データ(CommonsenseQAおよび関連16のデータセット))から関連する知識を検索する。
- 取得した知識は、入力シーケンスに直接連結され、元の変換器アーキテクチャに構造的変更を加えずに保持される。
- モデルは、入力と外部知識を組み合わせたものに対して標準的な自己注意を用い、内部および外部のコンテンツの両方に動的な注意を可能にする。
- 知識の検索は、キーワードマッチングや情報検索などの効率的な非パrametric手法を用い、計算コストを最小限に抑える。
- 39種類の多様なモデル(DeBERTa、ELECTRA、GPT-3の変種など)のアンサンブルを用いて性能を向上させ、最終予測には多数決を採用する。
- 実務家が知識ソース(例:知識グラフの編集やWikipediaのエントリの更新)を再訓練なしに更新できるようにフレームワークを設計している。
実験結果
リサーチクエスチョン
- RQ1モデルサイズを増大させずに、外部知識の検索と統合によって共通の常識的推論性能を向上させることができるか?
- RQ2軽量で非パrametricな知識インジェクション手法が、CommonsenseQAで人間の性能を上回ることができるか?
- RQ3知識グラフ、辞書、学習データの複数の外部知識ソースを組み合わせることで、推論の正確性にどのような影響を与えるか?
- RQ4外部知識を補完することで、小さなモデルがどの程度人間水準の性能に達するか?
- RQ5外部注意は、モデルの解釈可能性を向上させ、巨大な事前学習モデルへの依存を軽減できるか?
主な発見
- KEARモデルはCommonsenseQAのテストセットで89.4%の精度を達成し、人間のベンチマーク(88.9%)を上回った。
- アンサンブルモデルは開発セットで93.4%の精度を達成し、以前の最高性能モデルDEKCORを6%以上上回った。
- DeBERTa-xxlargeモデルの性能は、外部知識を追加することで開発セットで83.8%から90.8%に向上した。
- GPT-3のような大規模モデルですら、同じタスクで73.0%の精度にとどまり、外部注意アプローチの有効性を示した。
- 15億パラメータまでのモデルを用いて人間並みの性能を達成でき、超大規模モデルへの依存を軽減した。
- 事例研究では、知識グラフ、辞書、学習データの3つの知識ソースが、複雑な例における正しい推論に不可欠であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。