Skip to main content
QUICK REVIEW

[論文レビュー] Commonsense Knowledge in Wikidata

Filip Ilievski, Pedro Szekely|arXiv (Cornell University)|Aug 18, 2020
Topic Modeling参考文献 28被引用数 9
ひとこと要約

本稿では、Wikidata に ConceptNet や ATOMIC などの既存のソースとは補完的な常識的知識が含まれるかどうかを調査する。3つの原則—一般ドメインの関係、一般的な概念、非実体—を適用することで、常識的サブグラフ(Wikidata-CS)を抽出し、その関係を ConceptNet にマッピングして、常識的知識グラフ(CSKG)に統合する。主な発見では、Wikidata-CS は新規で重複が少ない常識的 fact を含むが、カバレッジは依然として限定的であり、知識統合、インスタンスレベルの事実の一般化、新しい修飾語と関係の導入によるモデル拡張を通じて Wikidata を強化するよう提案する。

ABSTRACT

Wikidata and Wikipedia have been proven useful for reason-ing in natural language applications, like question answering or entitylinking. Yet, no existing work has studied the potential of Wikidata for commonsense reasoning. This paper investigates whether Wikidata con-tains commonsense knowledge which is complementary to existing commonsense sources. Starting from a definition of common sense, we devise three guiding principles, and apply them to generate a commonsense subgraph of Wikidata (Wikidata-CS). Within our approach, we map the relations of Wikidata to ConceptNet, which we also leverage to integrate Wikidata-CS into an existing consolidated commonsense graph. Our experiments reveal that: 1) albeit Wikidata-CS represents a small portion of Wikidata, it is an indicator that Wikidata contains relevant commonsense knowledge, which can be mapped to 15 ConceptNet relations; 2) the overlap between Wikidata-CS and other commonsense sources is low, motivating the value of knowledge integration; 3) Wikidata-CS has been evolving over time at a slightly slower rate compared to the overall Wikidata, indicating a possible lack of focus on commonsense knowledge. Based on these findings, we propose three recommended actions to improve the coverage and quality of Wikidata-CS further.

研究の動機と目的

  • Wikidata に ConceptNet や ATOMIC などの既存の常識的知識グラフとは補完的な常識的知識が含まれるかどうかを特定すること。
  • 一般ドメインの関係、一般的な概念、非実体という3つの原則を定義し、それらを用いて Wikidata 内の一般知識と常識的知識を区別するための操作的定義を行うこと。
  • これらの原則を用いて、Wikidata から構造化された常識的サブグラフ(Wikidata-CS)を抽出し、その関係を ConceptNet にマッピングして統合すること。
  • 他の常識的ソース(例:ConceptNet や WordNet)と比較して、Wikidata-CS の重複度、新規性、時間的変化を評価すること。
  • Wikidata における常識的知識のカバレッジと表現力の向上に向けた具体的な提案を提示すること。

提案手法

  • 常識的知識を規定する3つの指針を定義する:(1) 領域特化ではない一般ドメインの関係、(2) 名前付き実体ではない一般的な概念、(3) 特定の個人ではない非実体。
  • これらの指針を用いて、基準を満たす関係と実体に絞って、Wikidata から常識的サブグラフ(Wikidata-CS)を抽出する。
  • 多言語的かつ意味的整合性に基づくアプローチを用いて、Wikidata の関係を ConceptNet の関係にマッピングし、既存の常識的知識グラフ(CSKG)への統合を可能にする。
  • 既に ConceptNet と ATOMIC を含む CSKG に Wikidata-CS を統合し、統合された常識的知識ベースを構築する。
  • 2017年、2018年、2020年のバージョンを用いて、Wikidata-CS の時間的分析を実施し、全体の Wikidata に対する成長率と比較してその進化と拡大度を評価する。
  • 定量的および定性的な分析を実施し、ConceptNet や WordNet との重複度を計算することで、新規性と補完性を評価する。

実験結果

リサーチクエスチョン

  • RQ1Wikidata には、ConceptNet や ATOMIC などの既存の常識的知識グラフとは異なる常識的知識が含まれるか?
  • RQ2Wikidata-CS と他の常識的ソース(例:ConceptNet や WordNet)との重複度はどの程度か? これは知識統合にどのような意味を持つのか?
  • RQ3Wikidata-CS のサイズと構造は時間経過とともにどのように変化したか? また、全体の Wikidata 知識ベースと比較して、その成長率はいかがだったか?
  • RQ4Wikidata の現在のモデル化における主な制限は何か? これは、常識的知識の効果的表現を妨げる要因となっているか?
  • RQ5常識的知識の統合と品質向上を図るための具体的な行動は何か?

主な発見

  • Wikidata-CS は、Wikidata 全体に比べて小さな規模ではあるが、既存のソースとは補完的である関連性の高い新規な常識的知識を含む。
  • このサブグラフは ConceptNet の15の異なる関係にマッピングされており、意味的整合性と統合可能性が裏付けられている。
  • Wikidata-CS と他の常識的ソースとの重複度は低く、顕著な補完的カバレッジを示しており、統合作業の正当性が裏付けられている。
  • Wikidata-CS は全体の Wikidata 知識ベースよりもやや成長速度が遅く、コミュニティにおける常識的知識への注目が不足している可能性を示唆している。
  • 本研究では、3つの主な改善ルートを同定した:(1) 既存の常識的ソース(例:ConceptNet や ATOMIC)を Wikidata に統合すること、(2) インスタンスレベルの事実から一般化して常識的性質を推論すること、(3) 一般的性、目的、象徴性といった新たな修飾語と関係を導入して Wikidata のモデルを拡張すること。
  • 研究結果は、モデルの強化と貢献インcentive の整備を図る限り、Wikidata が将来的な常識的知識のソースとしての可能性を有していることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。