Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Step-by-Step Reasoning through Symbolic Verification

Hanlin Zhang, Yifan Zhang|arXiv (Cornell University)|2022. 12. 16.
Intelligent Tutoring Systems and Adaptive Learning인용 수 4
한 줄 요약

이 논문은 관계 추론을 위한 소수의 예시를 통한 학습을 가능하게 하기 위해 기호적 일阶 논리 규칙과 지식 기반을 사용하는 신경 기반 기호 프레임워크인 언어 모델을 논리 프로그래머로 사용하는 LMLP를 제안한다. LMLP는 더 작은 모델을 사용함에도 불구하고 길이 일반화 벤치마크에서 체인 오브 토의(Chain-of-Thought, CoT) 프롬프팅보다 25퍼센트 이상 높은 성능을 보이며, 기호적 표현이 구성적 일반화와 추론 신뢰성 향상에 기여함을 보여준다.

ABSTRACT

Pre-trained language models (LMs) have shown remarkable reasoning performance using explanations or chain-of-thoughts (CoT)) for in-context learning. On the other hand, these reasoning tasks are usually presumed to be more approachable for symbolic programming. To understand the mechanism of reasoning of LMs, we curate synthetic datasets containing equivalent (natural, symbolic) data pairs, where symbolic examples contain first-order logic rules and predicates from non-parametric knowledge bases (KBs), supporting automated verification of intermediate reasoning results. Then we revisit neuro-symbolic approaches and propose to learn from demonstrations containing logic rules and corresponding examples to iteratively reason over KBs, recovering Prolog's backward chaining algorithm and supporting automated verification of LMs' outputs. Comprehensive experiments are included to systematically compare LMLP with CoT in deductive reasoning settings, showing that LMLP enjoys more than $25\%$ higher accuracy than CoT on length generalization benchmarks even with smaller model sizes.

연구 동기 및 목표

  • 기호적 표현이 관계 추론 작업을 위한 예시 기반 학습에 기여하는지 조사하기 위해.
  • 모델이 정보의 새로운 조합에서 실패하는 구성성 문제를 해결하기 위해.
  • 소수의 예시 프롬프팅에서 자연어 설명(CoT)과 기호적 논리 규칙의 효과성을 비교하기 위해.
  • 언어 모델이 기호적 예시를 사용하여 지식 기반에 추론을 효과적으로 기반으로 삼을 수 있는지 평가하기 위해.
  • 기호적 프롬프팅이 자연어 프롬프팅보다 더 신뢰성 있고 확장 가능한 추론을 가능하게 하는지 탐색하기 위해.

제안 방법

  • 제어된 비교를 가능하게 하기 위해 쌍으로 구성된 자연어 및 기호적(일阶 논리) 예제를 가진 합성 데이터셋을 사용한다.
  • LMLP는 논리 규칙 템플릿과 지식 기반(KB) 술어를 사용하여 추론을 이끌며, 각 생성 단계가 유효한 KB 관계에 국한되도록 한다.
  • 각 추론 단계에서 마스크된 번역 모델이 자연어 생성물을 KB 내 (주어, 관계, 목적어) 삼중항으로 매핑하여 의미적 기반을 확보한다.
  • 모델은 검색된 논리 규칙과 예시를 인라인 예시로 사용하여 KB 위에서 후행 추론(backward chaining)을 반복적으로 적용한다.
  • GPT-2와 Sentence-BERT를 백본으로 사용하며, 일반적인 CoT 모델보다 더 작은 모델을 사용하여 저자원 기반 기호 프롬프팅 하에서의 성능을 테스트한다.
  • 추론 경로는 수동으로 평가되며, 정확한 도출이 유효한 KB 단계를 통해 이루어지는 경우에 성공으로 간주한다.

실험 결과

연구 질문

  • RQ1일阶 논리 규칙을 사용한 기호적 프롬프팅이 자연어 설명과 비교해 소수의 예시 추론에서 구성적 일반화를 향상시키는가?
  • RQ2대규모 지식 기반(KB)에서의 사전 훈련 없이도 언어 모델이 기호적 예시를 사용하여 지식 기반에서 효과적으로 추론을 학습할 수 있는가?
  • RQ3길이 일반화 벤치마크에서 기호적 프롬프팅(LMLP)의 성능이 체인 오브 토의(CoT)와 비교해 어떻게 되는가?
  • RQ4훈련 중에 본 바와 다른 더 긴 추론 시퀀스에서 테스트할 경우 기호적 표현이 얼마나 치명적인 성능 저하를 감소시키는가?
  • RQ5기호적 프롬프팅이 자연어 프롬프팅보다 더 신뢰성 있고 설명 가능한 추론 경로를 가능하게 하는가?

주요 결과

  • LMLP는 GPT-2와 같은 더 작은 모델을 사용함에도 불구하고 길이 일반화 벤치마크에서 CoT보다 25퍼센트 이상 높은 정확도를 달성한다.
  • LMLP는 추론 길이가 훈련 시퀀스를 초월할수록 높은 성능를 유지하며, 뛰어난 구성적 일반화 성능를 보여준다.
  • CoT 프롬프팅은 더 긴 시퀀스에서 치명적인 성능 저하를 겪으며, 짧은 시퀀스에서는 뛰어난 성능를 보이지만 구성적 일반화에 실패한다.
  • 기호적 예시의 사용은 각 단계가 KB 술어에 기반하므로 더 안정적이고 설명 가능한 추론 경로를 가능하게 한다.
  • LMLP는 더 작은 모델과 KB 사전 훈련되지 않은 백본을 사용함에도 효과적이며, 이는 기호적 프롬프팅이 모델 규모의 제한을 상쇄할 수 있음을 시사한다.
  • 결과는 기호적 표현이 논리와 제어를 명시적으로 분리함으로써 자연어 기반 CoT보다 더 안정적이고 확장 가능한 추론을 가능하게 한다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.