[論文レビュー] CommonGen: A Constrained Text Generation Challenge for Generative Commonsense Reasoning
この論文では、関係的推論と構成的一般化を要する、一連の与えられた概念から妥当で日常的常識に富んだ文を生成する能力を評価する、制約付きテキスト生成タスク「CommonGen」を紹介する。T5のような最先端モデルでさえ31.00のSPICEを達成するが、人間の性能(52.43)と比べて大きな格差が残っており、自然言語処理における生成的日常的常識推論の難しさが浮き彫りになる。
Recently, large-scale pre-trained language models have demonstrated impressive performance on several commonsense-reasoning benchmark datasets. However, building machines with commonsense to compose realistically plausible sentences remains challenging. In this paper, we present a constrained text generation task, CommonGen associated with a benchmark dataset, to explicitly test machines for the ability of generative commonsense reasoning. Given a set of common concepts (e.g., {dog, frisbee, catch, throw}); the task is to generate a coherent sentence describing an everyday scenario using these concepts (e.g., "a man throws a frisbee and his dog catches it"). The CommonGen task is challenging because it inherently requires 1) relational reasoning with background commonsense knowledge, and 2) compositional generalization ability to work on unseen concept combinations. Our dataset, constructed through a combination of crowdsourced and existing caption corpora, consists of 79k commonsense descriptions over 35k unique concept-sets. Experiments show that there is a large gap between state-of-the-art text generation models (e.g., T5) and human performance. Furthermore, we demonstrate that the learned generative commonsense reasoning capability can be transferred to improve downstream tasks such as CommonsenseQA by generating additional context.
研究の動機と目的
- テキスト生成における生成的日常的常識推論を評価するベンチマークタスクが不足しているという問題に対処する。既存の判別的日常的常識タスクを超えるものである。
- 与えられた一般的な概念のセットを用いて文法的に正しいかつ妥当な文を組み立てる必要がある、制約付き生成タスクを設計する。
- 2つのコアな課題、すなわち日常的常識知識上の関係的推論と、未知の概念の組み合わせにおける構成的一般化能力の評価を行う。
- 制御されたクラウドソーシングを用いて、35,141個の固有の概念セットを含む77,449文の大型で高品質なデータセットを構築する。
- 成功した生成的日常的常識モデルが、有用な文脈的シナリオを生成することで、下流タスクの性能を向上させられることを示す。
提案手法
- CommonGenタスクは、k個の概念の順不同の集合を、一貫性があり日常的なシナリオ文にマッピングするテキスト生成問題として定式化される。
- データセットは、既存のキャプションコーパスと制御されたクラウドソーシングを組み合わせたハイブリッドアプローチにより構築され、多様性と日常的常識的妥当性を確保する。
- T5、BART、GPT-2、UniLMなどの標準的な事前学習アーキテクチャを用いて、CommonGenデータセット上でモデルをファインチューニングする。デコードにはビームサーチを用い、開発セット上でハイパーパramータチューニングを実施する。
- 自動評価指標(ROUGE、BLEU、METEOR、CIDEr、SPICE)と手動アノテーションを併用して、事実的妥当性および日常的常識的妥当性を評価する。
- 転移学習の実験により、CommonGenで訓練されたモデルが、関連する文脈を生成することで、下流の日常的常識質問応答タスクの性能を向上させられることを示した。
- アノテーションインターフェースには品詞のヒントが含まれており、アノテーションの速度を向上させつつ、文の多様性と自然さを維持している。
実験結果
リサーチクエスチョン
- RQ1最先端のテキスト生成モデルは、与えられた概念のセットに制約を受けても、妥当で日常的常識に富んだ文を生成できるか?
- RQ2現在のモデルは、テキスト生成において、未知の概念の組み合わせに対してどの程度関係的推論および構成的一般化能力を示しているか?
- RQ3生成的モデルのCommonGenにおける性能は、事実的および日常的常識的妥当性の観点で、人間の性能と比べてどの程度か?
- RQ4日常的常識に富んだ文脈を生成する能力が、日常的常識推論における下流タスクの性能を向上させられるか?
- RQ5現在のモデルが日常的常識に適合する文を生成する際の主な失敗モードは何か?
主な発見
- 最高性能を示したモデル、T5-Largeは、SPICEスコア31.00を達成したが、人間の性能(52.43)と比べて著しく低いことから、生成的日常的常識推論における大きな格差が示された。
- 最先端のモデルは頻繁に妥当でない文を生成しており、例として「犬がフリスビーを投げる」や「テーブルにマッサージを施す」といった文が挙げられ、関係的推論能力の欠如が明らかになった。
- CommonGenで訓練されたモデルは、転送性を示しており、関連する文脈的背景を生成することで、下流の日常的常識質問応答タスクの性能を向上させた。
- データセットには35,141個の固有の概念セットを含む77,449の文が含まれており、関係的および構成的課題に強く焦点を当てている。
- ConceptNetにおける1ホップおよび2ホップ関係の頻度を分析した結果、多くの概念セットが複数ホップの日常的常識推論を要しており、タスクの難易度が高まっていることが示された。
- 手動評価により、人間がアノテートした文はモデルの生成文に比べて著しく妥当性が高く、文脈的にも一貫性があることが確認された。特に、主体-動作-対象の役割を適切に処理している点で顕著だった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。