Skip to main content
QUICK REVIEW

[論文レビュー] An Enhanced Knowledge Injection Model for Commonsense Generation

Zhihao Fan, Yeyun Gong|arXiv (Cornell University)|Dec 1, 2020
Topic Modeling参考文献 40被引用数 7
ひとこと要約

本論文は、外部テキストから取得したプロトタイプをより効果的に活用できるように、スケーリングモジュールとプロトタイプ位置インジケータを統合した、常識生成のための強化された知識注入モデルである EKI-BART を提案する。この手法により、BART が改善され、生成品質が向上し、CommonGen ベンチマーク上でノイズを低減し、シナリオの整合性を高める。ベースラインの BART やリトリーブオンative モデルを上回る性能を発揮する。

ABSTRACT

Commonsense generation aims at generating plausible everyday scenario description based on a set of provided concepts. Digging the relationship of concepts from scratch is non-trivial, therefore, we retrieve prototypes from external knowledge to assist the understanding of the scenario for better description generation. We integrate two additional modules, namely position indicator and scaling module, into the pretrained encoder-decoder model for prototype modeling to enhance the knowledge injection procedure. We conduct experiment on CommonGen benchmark, and experimental results show that our method significantly improves the performance on all the metrics.

研究の動機と目的

  • 与えられた概念から常識に適合するテキストを生成する課題に対処すること。標準的な言語モデルでは、しばしば不成立または意味的に一貫性のない文が生成されることがある。
  • 入力の概念と妥当なシナリオ記述との間の意味的ギャップを埋めるために、外部テキストコーパスからプロトタイプを検索・編集すること。
  • スケーリングモジュールと位置インジケータを導入することで、プロトタイプトークンに対する細かい制御を可能にし、事前学習済みエンコーダデコーダモデルにおける知識のインジェクションを改善すること。
  • ドメイン内およびドメイン外のプレーンテキストコーパスが、常識生成のための効果的な知識ソースとして機能できることを示すこと。

提案手法

  • 入力の概念に基づいて、外部テキストコーパスから関連するプロトタイプを検索し、それらをシナリオ知識として活用して文の生成をガイドする。
  • プロトタイプ内のトークンに学習可能な重みを割り当てることで、ノイズが多いか関係のないトークンを抑制するスケーリングモジュールを導入する。
  • 概念語のプロトタイプ内での相対的位置を符号化するためのプロトタイプ位置インジケータを採用し、モデルが意味的に関連する文脈に注目できるようにする。
  • 取得したプロトタイプと2つの補助モジュールを用いて、事前学習済み BART エンコーダデコーダモデルを微調整し、整合性があり常識に適合する文を生成する。
  • モデルが取得したプロトタイプを編集して、すべての必要な入力概念を含むようにし、同時にスムーズさと事実の妥当性を維持する「リトリーブ&エディット」フレームワークを採用する。
  • 交差エントロピー損失を用いて、生成品質と概念カバレッジの両方を最適化するように、モデルをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1プレーンテキストからプロトタイプを検索・編集することで、事前学習済み言語モデルの標準的な微調整を超えて、常識生成の品質を向上させることができるか?
  • RQ2スケーリングモジュールと位置インジケータは、モデルがプロトタイプ知識を効果的に活用し、ノイズを低減する能力をどのように向上させるか?
  • RQ3知識ソースとしてドメイン外のテキストコーパスを使用した場合でも、プロトタイプインジェクションによる性能向上が維持されるか?
  • RQ4モデルは、スムーズで妥当な文を生成する際、入力のすべての概念をどれほど正確に保持しているか?

主な発見

  • EKI-BART モデルは、CommonGen ベンチマークにおいて、自動評価指標(BLEU、ROUGE、FID)のすべてでベースライン BART やリトリーブオンリーモデルを顕著に上回る性能を発揮した。
  • ドメイン内データで微調整した BART と比較して、生成文における入力概念の欠落数を 300 件以上削減した。
  • スケーリングモジュールはプロトタイプのノイズを効果的に抑制し、BART 単体と比較してより正確で妥当な文の生成が可能になった。
  • プロトタイプ位置インジケータは、モデルがプロトタイプ内の関連する文脈に注目する能力を向上させ、シナリオの整合性を高めた。
  • 知識ソースとしてドメイン外のプレーンテキストを使用しても、本手法は優れた性能を示し、ロバストネスと一般化能力を示した。
  • アブレーションスタディの結果、スケーリングモジュールと位置インジケータの両方が、性能向上に独立してかつ顕著に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。