[論文レビュー] COMET: Commonsense Transformers for Automatic Knowledge Graph Construction
COMET(Commonsense Transformers)は、大規模な事前学習言語モデルを微調整して、新しい高品質な常識知識タプルを生成する生成的手法を提案する。Atomicではトップ1で77.5%の精度、ConceptNetでは91.7%の精度を達成し、生成モデルが人間が手作業で整備したリソースと同等の品質の常識知識を生成できることを示している。
We present the first comprehensive study on automatic knowledge base construction for two prevalent commonsense knowledge graphs: ATOMIC (Sap et al., 2019) and ConceptNet (Speer et al., 2017). Contrary to many conventional KBs that store knowledge with canonical templates, commonsense KBs only store loosely structured open-text descriptions of knowledge. We posit that an important step toward automatic commonsense completion is the development of generative models of commonsense knowledge, and propose COMmonsEnse Transformers (COMET) that learn to generate rich and diverse commonsense descriptions in natural language. Despite the challenges of commonsense modeling, our investigation reveals promising results when implicit knowledge from deep pre-trained language models is transferred to generate explicit knowledge in commonsense knowledge graphs. Empirical results demonstrate that COMET is able to generate novel knowledge that humans rate as high quality, with up to 77.5% (ATOMIC) and 91.7% (ConceptNet) precision at top 1, which approaches human performance for these resources. Our findings suggest that using generative commonsense models for automatic commonsense KB completion could soon be a plausible alternative to extractive methods.
研究の動機と目的
- 抽出的手法を越えた自動常識知識ベース構築のための生成フレームワークの開発。
- 事前学習言語モデルが、新規で多様かつ高品質な常識タプルを生成できるかを調査すること。
- 主な常識知識ベース2つ(AtomicとConceptNet)における生成知識の品質、新規性、多様性を評価すること。
- 有効な知識生成に必要な初期タプルの数に着目した、手法の効率性の検討。
- 従来の抽出的知識ベース補完手法に対する代替手段として、生成モデルのスケーラビリティの可能性を検討すること。
提案手法
- 既存の常識知識ベース(AtomicおよびConceptNet)の初期タプルを微調整データとして用い、主語と関係を入力として与えた際の目的語を生成するように、事前学習トランスフォーマー言語モデルを微調整する。
- モデルが入力として主語(s)と関係(r)を受け取り、目的語(o)を予測するような、系列から系列への生成設定を採用する。
- 大規模事前学習モデル(例:GPT風)の深い文脈表現を活用し、豊富な意味的および常識的知識を捉える。
- 微調整中にマスク言語モデルの目的関数を適用し、モデルの常識的関係理解を保持・適応させる。
- 自動評価と人的評価を併用して、生成タプルの品質と新規性を評価し、学習データと比較する。
- 2つの異なる常識知識ベース(Atomic:出来事ベース、ConceptNet:関係ベース)を対象に訓練・評価することで、ドメイン間分析を可能にする。
実験結果
リサーチクエスチョン
- RQ1微調整された生成言語モデルは、学習データに存在しない新規で高品質な常識タプルを生成できるか?
- RQ2生成モデルの性能は、抽出的手法と比較して、生成知識の精度と品質においてどのように異なるか?
- RQ3既存の知識ベースから少量の初期タプルを用いて、多様で正確な常識知識に一般化できるモデルを訓練できるか?
- RQ4モデルは意味的に整合性があり、人間が妥当と評価するような知識を生成できるか?
- RQ5従来の抽出的知識ベース構築手法に対する代替手段として、生成モデルをスケーラブルに利用することは可能か?
主な発見
- Atomic知識ベースにおいて、COMETは生成タプルのトップ1で77.5%の精度を達成し、人間がアノテートした知識と強い整合性を示している。
- ConceptNetでは、トップ1で91.7%の精度を達成し、常識的関係の高品質な生成を実証している。
- 人的評価により、生成タプルの大部分が妥当かつ正しいと評価されたことから、強い事実的一致性が裏付けられた。
- 学習データに存在しない新規知識を生成しており、さまざまな主語・関係ペアにおいて高い多様性と一貫性を示している。
- 初期タプルの数が限られている状況でも効果を発揮するため、スケーラビリティと低データ依存性が示された。
- テキストに明示的に記載されていない、暗黙の常識的知識を抽出的手法よりも効果的に捉えている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。