Skip to main content
QUICK REVIEW

[論文レビュー] Contextualized Scene Imagination for Generative Commonsense Reasoning

Peifeng Wang, J. Zamora|arXiv (Cornell University)|Dec 12, 2021
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、入力された概念間の妥当な関係を捉えた文脈に即した状況知識グラフ(SKG)を事前に想像することで、生成的常識推論を向上させる「想像して言語化する(I&V)」フレームワークを提案する。その後、SKGに従って自然言語の記述を生成する。この手法により、概念から文や物語への生成タスクにおけるゼロショットおよびフェイントショット性能が向上し、人的評価によりSKGが常識を反映しており、生成されたテキストがそれに整合していることが確認された。

ABSTRACT

Humans use natural language to compose common concepts from their environment into plausible, day-to-day scene descriptions. However, such generative commonsense reasoning (GCSR) skills are lacking in state-of-the-art text generation methods. Descriptive sentences about arbitrary concepts generated by neural text generation models (e.g., pre-trained text-to-text Transformers) are often grammatically fluent but may not correspond to human common sense, largely due to their lack of mechanisms to capture concept relations, to identify implicit concepts, and to perform generalizable reasoning about unseen concept compositions. In this paper, we propose an Imagine-and-Verbalize (I&V) method, which learns to imagine a relational scene knowledge graph (SKG) with relations between the input concepts, and leverage the SKG as a constraint when generating a plausible scene description. We collect and harmonize a set of knowledge resources from different domains and modalities, providing a rich auxiliary supervision signal for I&V. The experiments demonstrate the effectiveness of I&V in improving language models on both concept-to-sentence and concept-to-story generation tasks, while enabling the model to learn well from fewer task examples and generate SKGs that make common sense to human annotators.

研究の動機と目的

  • 神経的テキスト生成モデルに見られる常識推論の欠如に起因する、文法的に正しいが現実的でない文の生成を是正すること。
  • 入力に明示的に含まれない概念やそれらの間の妥当な関係をモデルが推論できるようにすること。
  • 生成的常識推論を2段階に分解すること:1)状況の想像(SKGの構築)、2)言語化(自然言語生成)。
  • 多様でマルチモーダルな知識源(例:視覚的キャプション、物語データセット)を活用し、常識知識を間接的に学習するための監視を提供すること。
  • 生成の前段階に明示的で構造化された推論ステップを導入することで、少データ学習の一般化性能とモデルの解釈可能性を向上させること。

提案手法

  • I&Vフレームワークは、入力概念と文脈から文脈に即した状況知識グラフ(SKG)を構築する想像モジュールと、SKGから自然言語を生成する言語化モジュールの2つのモジュールから構成される。
  • 想像モジュールは、視覚的キャプション、物語データセット、ConceptNetなど多様なソースから得られた外部のSKGの大量データセットで事前学習され、妥当な概念関係を学習する。
  • SKGは関係性グラフであり、ノードが概念(含む暗黙の概念)を表し、エッジが「CapableOf」や「UsedFor」、「LocatedAt」などの関係を表す。
  • 言語化モジュールは、下流のGCSRデータセットで微調整され、想像されたSKGから一貫性があり意味的に整合性のある文を生成する。
  • 両モジュールに事前学習済みのテキストトーテキスト変換器(例:BART)を用い、想像モジュールは複数のソース・マルチモーダルなSKGを活用して間接的監視を受ける。
  • 構造化された、常識に配慮した監視を提供することで、フレームワークは、未観測の概念の組み合わせに対しても効果的な少データ学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1入力概念から構造的で関係性のある状況知識グラフ(SKG)を事前に想像することで、妥当で常識に配慮した状況記述を生成できるか?
  • RQ2視覚的キャプションや物語など、複数のソース・マルチモーダルなSKGを統合することで、生成された記述の質と常識との整合性が向上するか?
  • RQ3想像モジュールは、少ない学習例で未観測の概念の組み合わせにどの程度一般化を助けるか?
  • RQ4生成されたSKGは人間の常識をどの程度反映しており、最終的な生成文と整合性があるか?
  • RQ5入力に存在しないが妥当性に不可欠な暗黙の概念(例:「投げる」には「人間」)をモデルが特定し、組み込むことができるか?

主な発見

  • I&Vフレームワークは、概念から文や物語への生成タスクにおいて、最先端のベースラインと同等またはそれ以上の性能を達成した。
  • 視覚的キャプションや物語データセットから抽出したSKGが、最も効果的な監視を提供し、生成品質を顕著に向上させた。
  • 少ない学習例で迅速に学習を進め、構造化された想像ステップのおかげで、少データ一般化性能が向上した。
  • 人的評価では、生成されたSKGが完全(必要な概念をすべて含む)であり、常識に従っており、アノテーター間の一致度(Fleiss Kappa)が0.21(中程度の一致)を示した。
  • 言語化モジュールは、常に想像されたSKGに整合した文を一貫して生成しており、生成プロセスが想像モジュールのガイダンスに従っていることが確認された。
  • より大きな言語モデルバックボーンを搭載した想像モジュールは、常識知識のエンコードと推論に優れた能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。