Skip to main content
QUICK REVIEW

[논문 리뷰] NELLIE: A Neuro-Symbolic Inference Engine for Grounded, Compositional, and Explainable Reasoning

Nathaniel Weir, Clark, Peter|arXiv (Cornell University)|2022. 09. 16.
Topic Modeling인용 수 7
한 줄 요약

Nellie는 대규모 언어 모델을 활용해 규칙 생성 및 검색 보강 추론을 통해 자연어 코퍼스에서 논리적 증명 트리를 구성함으로써 종단 간, 기반화되고 설명 가능한 질문 응답을 수행하는 신경기호 추론 엔진입니다. 인간이 제공한 텍스트에서 논리적 방향성과 사실 기반성을 확보하면서도 EntailmentBank에서 최신 기준 모델인 Entailer-3B보다 22% 높고, WorldTree에서는 26% 높은 성능을 기록합니다.

ABSTRACT

Our goal is a modern approach to answering questions via systematic reasoning where answers are supported by human interpretable proof trees grounded in an NL corpus of authoritative facts. Such a system would help alleviate the challenges of interpretability and hallucination with modern LMs, and the lack of grounding of current explanation methods (e.g., Chain-of-Thought). This paper proposes a new take on Prolog-based inference engines, where we replace handcrafted rules with a combination of neural language modeling, guided generation, and semiparametric dense retrieval. Our implementation, NELLIE, is the first system to demonstrate fully interpretable, end-to-end grounded QA as entailment tree proof search, going beyond earlier work explaining known-to-be-true facts from text. In experiments, NELLIE outperforms a similar-sized state-of-the-art reasoner [Tafjord et al., 2022] while producing knowledge-grounded explanations. We also find NELLIE can exploit both semi-structured and NL text corpora to guide reasoning. Together these suggest a new way to jointly reap the benefits of both modern neural methods and traditional symbolic reasoning.

연구 동기 및 목표

  • 의료 및 법적 분야와 같이 고위험 분야에서 현대의 LLM 기반 질문 응답 시스템의 해석 가능성과 기반화의 부족을 해결하기 위해.
  • 수동으로 작성된 기호 규칙에 의존하는 전통적 전문가 시스템의 취약성과 확장성 문제를 극복하기 위해.
  • 답안이 권위 있는 자연어 코퍼스에 기반한 인간이 이해할 수 있는 증명 트리에 의해 뒷받침되는 종단 간, 논리적으로 지향된 추론을 가능하게 하기 위해.
  • 수동 규칙 설계 없이도 LLM의 추론 능력과 기호 추론의 검증 가능성을 동시에 활용하기 위해.
  • 신경기호 시스템이 완전한 설명 가능성과 사실 기반성을 유지하면서도 경쟁적인 QA 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 핵심 추론 엔진으로는 백워드 체이닝 기반의 Prolog 기반 기호 정리 증명기(theorem prover)를 사용하며, 수동으로 작성된 규칙 대신 신경망 기반의 술어(predicates)를 활용합니다.
  • 검색된 사실과 사전 정의된 추론 템플릿을 조건으로 하여 대규모 언어 모델을 통해 동적으로 후보 추론 규칙을 생성합니다.
  • 규칙 생성을 위해 관련 사실을 코퍼스에서 검색하는 검색 보강 생성(Retrieval-Augmented Generation, RAG) 기법을 활용하여 관련성과 정확도를 향상시킵니다.
  • 자연어 추론(Natural Language Inference, NLI) 모델을 사용해 가설과 사실 간의 약한 통일(weak unification)을 수행함으로써 자유형 자연어에서의 함의 검증을 가능하게 합니다.
  • 증명 검색 과정은 질문을 하위 질문으로 재귀적으로 분해하고, 각 하위 질문을 함의 또는 추가 분해를 통해 증명함으로써 구성적 함의 트리를 형성합니다.
  • 규칙 생성을 이끄는 데 두 가지 조건부 생성 모듈인 템플릿 조건부 생성(Template-Conditioned Generation, TCG)과 검색 조건부 생성(Retrieval-Conditioned Generation, RCG)을 사용하며, 제거 실험(ablation studies) 결과 이들의 핵심적 역할을 입증합니다.

실험 결과

연구 질문

  • RQ1수동으로 작성된 기호 규칙에 의존하지 않고도 신경기호 시스템이 높은 QA 성능과 사실 기반성 모두를 달성할 수 있는가?
  • RQ2LLM을 활용해 기호 프레임워크 내에서 체계적이고 구성적인 추론을 뒷받침하는 동적 추론 규칙을 얼마나 잘 생성할 수 있는가?
  • RQ3검색 보강 및 템플릿 조건부 생성은 기반화된 추론에서 증명 트리 구축의 품질과 정확도를 얼마나 향상시키는가?
  • RQ4재학습이나 규칙 재작성 없이 지식 코퍼스를 단순히 확장하기만 해도 이러한 시스템이 다양한 도메인으로 일반화할 수 있는가?
  • RQ5다중 힙 추론에서 환영 또는 의미의 이탈이 발생할 경우 기반화되고 설명 가능한 추론의 주요 실패 유형은 무엇인가?

주요 결과

  • Nellie는 기반 증명이 요구되는 조건에서도 기준 모델인 동일 크기의 Entailer-3B보다 EntailmentBank에서 22% 높고, WorldTree에서는 26% 높은 성능을 기록합니다.
  • 기반 설명이 필요로 하지 않는 더 큰 11B 파라미터의 Entailer 모델을 능가하는 경쟁성 있는 성능을 달성합니다.
  • 제거 실험 결과, 검색 조건부 생성(RCG)과 템플릿 조건부 생성(TCG)을 모두 제거할 경우 성능이 1~1.5점 감소하고, RCG만 제거할 경우 3~4점 감소함으로써 이들의 실증적 필수성을 입증합니다.
  • OpenBookQA의 일반 지식을 통합함으로써 Nellie의 QA 정확도는 11~12% 향상되었고, 정확한 증명 구축 비율도 9~12% 증가하여 도메인 일반화 능력을 입증합니다.
  • 주요 오류 유형은 정답에 대한 증명을 찾지 못하는 데서 비롯되며, 그 다음으로는 상위어 성질 상속 오류와 추론 힙 간의 의미 이탈이 뒤이룹니다.
  • 오류 분석 결과, 잘못된 증명은 주로 NLI 기반 함의 검증에서 발생하는 거짓 양성 결과로, 추론 단계 간 의미의 이탈이 원인임을 드러내며 향후 개선의 핵심 과제로 지목됩니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.