[論文レビュー] Pre-training Text-to-Text Transformers for Concept-centric Common Sense
この論文は、テキスト対テキスト変換器向けに、生成的および対照的目的を統合することで日常的概念に関する常識的知識を明示的に注入する概念中心の事前学習フレームワークを提案する。T5ベースのモデル(CALM)をこれらの中間的タスクで微調整することで、外部の知識ベースに依存せずに、5つの常識的ベンチマークで一貫してベースラインを上回る性能を達成し、NLUおよびNLGタスクの両方で向上を実現した。
Pretrained language models (PTLM) have achieved impressive results in a range of natural language understanding (NLU) and generation (NLG) tasks that require a syntactic and semantic understanding of the text. However, current pre-training objectives such as masked token prediction (for BERT-style PTLMs) and masked span infilling (for T5-style PTLMs) do not explicitly model the relational and compositional commonsense knowledge about everyday concepts, which is crucial to many downstream tasks requiring commonsense reasoning. To augment PTLMs with common sense, we propose generative and contrastive objectives as intermediate self-supervised pre-training tasks between general pre-training and downstream task-specific fine-tuning. We also propose a joint training framework to unify generative and contrastive objectives so that these objectives can be more effective. Our proposed objectives can pack more commonsense knowledge into the parameters of a pre-trained text-to-text transformer without relying on external knowledge bases, yielding better performance on both NLU and NLG tasks. We apply our method on a pre-trained T5 model in an intermediate task transfer learning fashion to train a concept-aware language model (CALM) and experiment with five commonsense benchmarks (four NLU tasks and one NLG task). Experimental results show that CALM outperforms baseline methods by a consistent margin.
研究の動機と目的
- 日常的で概念に関する関係的および構成的常識的知識をモデル化する既存の事前学習目的の限界を解決すること。
- テキスト対テキスト変換器に常識的知識を明示的に注入する中間的自己教師あり事前学習タスクを構築すること。
- より効果的な知識パッケージングのため、生成的および対照的目的を統合した共同学習フレームワークを統合すること。
- 外部の知識ベースに依存せずに、常識的推論を要する下流のNLUおよびNLGタスクの性能を向上させること。
- 5つの常識的ベンチマークにおける広範な評価を通じて、概念中心の事前学習の有効性を示すこと。
提案手法
- 文脈が与えられたもとで常識的コンセプトを予測するようにモデルを学習する生成的目的を提案し、知識統合を強化する。
- マスキングされた文脈において、正しいと誤った常識的コンセプトを区別するようモデルを促す対照的目的を導入する。
- 中間的事前学習中に生成的および対照的目的の両方を同時に最適化する共同学習フレームワークを設計する。
- 転移学習の設定で事前学習済みT5モデルにこの手法を適用し、概念に配慮した言語モデル(CALM)を生成する。
- 中間的タスクでの微調整の前に、双方向の目的で常識的例の収集済みデータセットを用いてCALMを事前学習する。
- 既存のT5スタイルのモデルおよび下流タスクのパイプラインとの互換性を維持するため、テキスト対テキストフォーマットを採用する。
実験結果
リサーチクエスチョン
- RQ1生成的および対照的事前学習目的を共同で適用することで、事前学習済みテキスト対テキスト変換器に常識的知識を効果的に注入できるか?
- RQ2提案手法は、標準的な事前学習目的と比較して、常識的推論タスクの性能をどのように向上させるか?
- RQ3外部の知識ベースが欠如している場合、モデルの性能にどのような影響が生じるか。内部での知識パッケージングは十分か?
- RQ4生成的および対照的目的の共同最適化は、単独で使用する場合よりも優れた一般化を達成するか?
- RQ5CALMは、NLUおよびNLGタスクを含む多様な常識的ベンチマークで、どのように性能を発揮するか?
主な発見
- CALMは、5つの常識的ベンチマークすべてでベースラインモデルを上回り、NLUおよびNLGタスクの両方で一貫した改善を示した。
- 生成的および対照的目的の共同学習は、いずれの目的を別々に使用するよりも、より優れた知識統合を実現した。
- 外部の知識ベースに依存せずに、性能が向上した。これは、常識的知識を内部的にパラメータ化する方法が有効であることを示している。
- 中間的事前学習を通じて、日常的コンセプトに関する推論能力が明確に向上した。
- 結果から、概念中心の事前学習は、テキスト対テキスト変換器における推論能力を顕著に向上させることを示している。
- 特に、構成的および関係的常識的理解を要するタスクにおいて、改善が顕著に見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。