Skip to main content
QUICK REVIEW

[論文レビュー] Learning Causal Bayesian Networks from Text

Farhad Moghimifar, Afshin Rahimi|arXiv (Cornell University)|Nov 26, 2020
Topic Modeling参考文献 18被引用数 4
ひとこと要約

本稿では、言語的変数と形式的概念分析を用いて、テキストから高レベルの概念間の因果関係を抽出する新規手法を提案する。因果ベイジアンネットワーク(CBN)を構築し、心理的テキストデータセットで69.4%の精度を達成。これは最先端手法より13–20%高い。非隣接および双方向の因果関係の検出が可能である。

ABSTRACT

Causal relationships form the basis for reasoning and decision-making in Artificial Intelligence systems. To exploit the large volume of textual data available today, the automatic discovery of causal relationships from text has emerged as a significant challenge in recent years. Existing approaches in this realm are limited to the extraction of low-level relations among individual events. To overcome the limitations of the existing approaches, in this paper, we propose a method for automatic inference of causal relationships from human written language at conceptual level. To this end, we leverage the characteristics of hierarchy of concepts and linguistic variables created from text, and represent the extracted causal relationships in the form of a Causal Bayesian Network. Our experiments demonstrate superiority of our approach over the existing approaches in inferring complex causal reasoning from the text.

研究の動機と目的

  • 既存のNLP手法が低レベルで隣接する出来事の間でのみ因果関係を抽出するという制限を解消すること。
  • テキスト内の文の近接性に依存しない、概念レベルでの因果推論を可能にすること。
  • 後続のAI応用のため、構造的かつ確率的な形(因果ベイジアンネットワーク)で抽出された因果知識を表現すること。
  • 直接共起しない概念間の因果関係を推論できる階層的言語的変数フレームワークを開発すること。
  • 因果関係抽出の評価を支援するため、心理学分野向けにPsyCausデータセットを公開すること。再現可能性を重視した研究を促進する。

提案手法

  • Wuら(2012)の確率的アプローチを用いて、IsA(上位種・下位種)関係からテキスト内の言語的変数とその値を抽出する。
  • 形式的概念分析(GanterとWille, 2012)を用いて、言語的変数とその値の間の階層的関係をモデル化する形式的概念ラティスを構築する。
  • 新規の因果関係検出関数(式1)を適用し、変数ペア間の非対称類似度スコアを計算。閾値μを用いて因果の方向を特定する。
  • 階層的構造を活用し、テキスト内で直接共起していない概念間の因果リンクを推論する。
  • 最終的な因果知識を因果ベイジアンネットワーク(CBN)として表現し、確率的推論と対仮説的推論を可能にする。
  • CBNの有向性を考慮し、因果スコア関数の絶対値が対称的であることを検出することで双方向因果関係をモデル化するが、有向性のため後処理(例:決定木)を必要とする。

実験結果

リサーチクエスチョン

  • RQ1原因と結果が隣接する文にない場合でも、高レベルの概念間の因果関係を信頼性を持って抽出できるか?
  • RQ2階層的言語的変数フレームワークは、テキスト内の非隣接因果関係の検出を改善できるか?
  • RQ3本手法は、感情と摂食症などの概念間で双方向因果関係を効果的に特定できるか?
  • RQ4テキストデータから因果ベイジアンネットワークを有効に構築でき、複雑な因果的および対仮説的推論を支援できるか?
  • RQ5本手法は、既存の特徴ベース・分布ベース・ヒューリスティックベースのベースラインをどの程度上回るか?

主な発見

  • 本手法は因果関係分類のテスト精度として0.694を達成し、最先端の特徴ベース手法(0.56)と分布ベース手法(0.50)を顕著に上回った。
  • 最良の特徴ベースベースラインより13%、多数クラスベースラインより20%の向上を達成し、堅牢性と一般化性能が確認された。
  • 閾値μ = 0.05でマクロ平均F1スコアが0.66に達し、因果関係検出の閾値に対する感受性が最適であることが示された。
  • 明示的な因果接続語が存在しない状況でも、感情と摂食症の間の双方向因果関係を正しく同定できた。
  • 階層的構造のおかげで、同じ文内で共起していない概念間の因果リンク(例:妄想性障害と不快感)を正しく特定できた。
  • モデルの性能は閾値μに敏感であり、F1スコアはμ = 0.05でピークに達した。これは、最適な因果関係検出のためのハイパーパramータチューニングの重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。