Skip to main content
QUICK REVIEW

[논문 리뷰] Causal Discovery with Language Models as Imperfect Experts

Stephanie Long, Alexandre Piché|arXiv (Cornell University)|2023. 07. 05.
Bayesian Modeling and Causal Inference인용 수 6
한 줄 요약

이 논문은 진정한 인과 그래프가 높은 확률로 개선된 등가 클래스에 포함되도록 보장하면서, 대규모 언어 모델(Large Language Models)과 같은 불완전한 전문 지식을 통합함으로써 인과 발견에서 마르코프 등가 클래스(Markov equivalence classes, MECs)를 개선하기 위한 탐욕적이고 일致성 인식 방법을 제안한다. 이 방법은 비순환성과 조건부 인력성 제약 조건을 활용하여 잘못된 전문 지식의 방향성을 수정함으로써 실제 데이터셋에서 MEC 크기와 구조적 해밍 거리(SHD)를 크게 감소시킨다.

ABSTRACT

Understanding the causal relationships that underlie a system is a fundamental prerequisite to accurate decision-making. In this work, we explore how expert knowledge can be used to improve the data-driven identification of causal graphs, beyond Markov equivalence classes. In doing so, we consider a setting where we can query an expert about the orientation of causal relationships between variables, but where the expert may provide erroneous information. We propose strategies for amending such expert knowledge based on consistency properties, e.g., acyclicity and conditional independencies in the equivalence class. We then report a case study, on real data, where a large language model is used as an imperfect expert.

연구 동기 및 목표

  • 인과 발견 방법이 마르코프 등가 클래스(MECs)까지의 인과 그래프만 식별할 수 있어 간섭 추정에 대한 불확실성이 발생하는 데 대한 한계를 해결하기 위해.
  • 특히 대규모 언어 모델(LLMs)과 같은 불완전한 전문 지식을 활용하여 MECs를 개선하고 불확실성을 줄이는 프레임워크를 개발하기 위해.
  • 전문 지식 피드백에 오류가 포함되어 있어도 진정한 인과 그래프가 개선된 MEC에 포함될 가능성이 높도록 보장하기 위해.
  • 합성 노이즈 전문 지식과 LLM 기반 전문 지식을 사용하여 실제 데이터셋에서 이 방법의 효과성을 평가하기 위해.
  • 전문 지식의 신뢰성과 불확실성 캘리브레이션의 인과 개선 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 진정한 그래프가 높은 확률로 포함되도록 MEC 크기를 최소화하는 최적화 문제로 불완전한 전문 지식의 사용을 수식화하기 위해.
  • MEC 내 비순환성과 조건부 인력성 제약 조건과의 일치성을 테스트함으로써 전문 지식 피드백을 단계적으로 통합하는 탐욕 알고리즘을 제안하기 위해.
  • 두 가지 전략 도입: $S_{\text{size}}$ (MEC 크기 최소화) 및 $S_{\text{risk}}$ (진정한 그래프를 제외할 위험을 제어하는 데 사용되는 베이지안 추론).
  • 노이즈 모델을 사용하여 전문 지식 오류를 시뮬레이션하며, 각 전문 지식 방향성이 확률 $1 - \varepsilon$로 정확하다고 가정하고, 일치하지 않는 그래프를 기각하기 위해.
  • 기본 진짜 DAG에서 MEC를 추출한 후 전문 지식 질의를 통해 개선하는 방식으로 실제 베이지안 네트워크(예: Insurance, Asia, ALARM)에 이 방법을 적용하기 위해.
  • MEC 크기, 진짜 그래프와의 SHD, 그리고 진짜 그래프가 포함될 경험적 확률 $p(G^\star \in \mathcal{M}^{E,S})$를 사용하여 성능 평가하기 위해.

실험 결과

연구 질문

  • RQ1LLM과 같은 불완전한 전문 지식을 효과적으로 활용하여 마르코프 등가 클래스를 넘어서 인과 발견의 불확실성을 줄일 수 있는가?
  • RQ2전문 지식 피드백에 오류가 포함되어 있을 경우에도 진정한 인과 그래프가 개선된 등가 클래스에 포함되어 있도록 보장할 수 있는가?
  • RQ3MEC 개선에서 다양한 전문 지식 전략(예: 위험 제어형 대비 크기 최적화형) 간의 성능 트레이드오���은 무엇인가?
  • RQ4LLMs의 신뢰성과 불확실성 캘리브레이션은 인과 개선 품질에 어떤 영향을 미치는가?
  • RQ5LLMs는 난이도 없는 전문 지식 통합에 비해 인과적으로 관련된 지식을 제공함으로써 인과 발견 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 방법은 제어된 오류 비율을 가진 $\varepsilon$-전문 지식을 사용할 경우, Insurance, Asia, ALARM 등 모든 테스트 네트워크에서 MEC 크기와 SHD를 성공적으로 감소시키며, $p(G^\star \in \mathcal{M}^{E,S}) \geq 1 - \eta$를 유지한다.
  • $\eta = 1$일 경우, 이 방법은 Long 등(2023)의 난이도 없는 LLM 통합보다 낮은 SHD를 달성하여 더 높은 정확도와 제어 능력을 입증한다.
  • ALARM를 제외한 모든 데이터셋에서 LLM 기반 전문 지식은 적어도 하나의 $\varepsilon$-전문 지식과 비교하여 유사한 성능을 보이며, LLM으로부터 유용한 인과 지식을 추출할 수 있음을 시사한다.
  • ALARM 네트워크에서는 애매한 메타데이터와 전문 지식의 혼동으로 인해 작은 $\eta$일 때조차도 진짜 그래프가 $\mathcal{M}^{E,S}$에서 제외되었다.
  • text-davinci-003 모델은 불확실성 캘리브레이션이 열악하여 낮은 $\eta$일 때조차도 과도한 자신감을 보이며 진짜 그래프를 잘못 기각하는 결과를 초래했다.
  • 전문 지식의 신뢰성이 낮아질수록 방법의 성능이 저하됨을 확인하였으며, 이는 LLM을 전문 지식으로 사용할 경우 더 나은 노이즈 모델과 불확실성 캘리브레이션 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.