[논문 리뷰] Logic-LM: Empowering Large Language Models with Symbolic Solvers for Faithful Logical Reasoning
이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 신뢰할 수 있는 논리적 추론 능력을 향상시키기 위해 기호적 해법 기반의 신경-기호적 프레임워크인 Logic-LM을 제안한다. 자연어 문제를 기호적 논리로 변환하는 데 LLM을 사용하고, 이후 결정적 기호 추론 엔진을 적용함으로써, 표준 프롬프팅 대비 평균 39.2% 향상, 체인 오브 토우징 프롬프팅 대비 18.4% 향상된 성능을 달성하였다. 이는 다섯 개인 논리적 추론 데이터셋에서 확인된 결과이다.
Large Language Models (LLMs) have shown human-like reasoning abilities but still struggle with complex logical problems. This paper introduces a novel framework, Logic-LM, which integrates LLMs with symbolic solvers to improve logical problem-solving. Our method first utilizes LLMs to translate a natural language problem into a symbolic formulation. Afterward, a deterministic symbolic solver performs inference on the formulated problem. We also introduce a self-refinement module, which utilizes the symbolic solver's error messages to revise symbolic formalizations. We demonstrate Logic-LM's effectiveness on five logical reasoning datasets: ProofWriter, PrOntoQA, FOLIO, LogicalDeduction, and AR-LSAT. On average, Logic-LM achieves a significant performance boost of 39.2% over using LLM alone with standard prompting and 18.4% over LLM with chain-of-thought prompting. Our findings suggest that Logic-LM, by combining LLMs with symbolic logic, offers a promising avenue for faithful logical reasoning. Code and data are publicly available at https://github.com/teacherpeterpan/Logic-LLM.
연구 동기 및 목표
- 추론 단계에서 결론이 논리적으로 따르지 않는, LLM에서 발생하는 비신뢰성 추론 문제를 해결한다.
- 순수 신경망 기반 추론의 한계를 극복하기 위해 논리적 충실도를 보장하는 기호 논리 시스템을 통합한다.
- 복잡한 논리적 문제의 정확한 기호적 표현을 생성하기 위해 LLM의 자연어 이해 능력을 활용한다.
- 기호 해법기의 오류 피드백을 활용한 자기 개선 메커니즘을 통해 기호 표현 정확도를 향상시킨다.
- 다양한 논리적 추론 벤치마크에서 LLM과 기호 추론의 융합이 효과적인지 입증한다.
제안 방법
- GPT-4와 같은 대규모 언어 모델을 사용해 자연어 문제를 기호적 논리 표현(예: 일阶논리, 제약 만족 문제, SAT 공식 등)으로 변환한다.
- 논리 프로그래밍 엔진, FOL 추론 엔진, 제약 최적화기, SAT 해법기 등 도메인 특화 기호 해법기를 활용해 기호 표현에 대해 결정적 추론을 수행한다.
- 기호 해법기의 오류 메시지를 피드백으로 사용해 기호 표현을 반복적으로 수정하는 자기 개선 모듈을 도입한다.
- 기호 해법기의 출력을 해석하고 최종 예측을 위해 원래의 답변 공간으로 매핑한다.
- 정답 기호 표현 생성을 유도하기 위해 예시를 포함한 소수의 프롬프팅을 사용해 LLM을 안내한다.
- 맞춤형 기호 도구를 통해 추론 유형을 다양화하여 연역 추론, FOL 추론, 제약 만족 문제, 분석적 추론을 모두 지원한다.

실험 결과
연구 질문
- RQ1표준 프롬프팅 대비 LLM과 기호 해법기를 융합함으로써 논리적 추론의 충실도와 정확도를 크게 향상시킬 수 있는가?
- RQ2추론 깊이가 증가함에 따라 LLM-기호 통합의 성능는 어떻게 변화하는가?
- RQ3기호 해법기의 오류 피드백을 활용한 자기 개선이 기호 표현의 질 향상에 얼마나 기여하는가?
- RQ4FOL, 제약 만족 문제, 분석적 추론을 포함한 다양한 논리적 추론 과제에서 이 프레임워크의 효과는 어떠한가?
- RQ5LLM이 기호 표현을 잘못 구성할 때 발생하는 주요 실패 유형은 무엇이며, 이는 전체 추론 성능에 어떤 영향을 미치는가?
주요 결과
- Logic-LM는 다섯 개인 논리적 추론 데이터셋에서 표준 프롬프팅 대비 평균 39.2% 향상, 체인 오브 토우징 프롬프팅 대비 18.4% 향상된 성능을 기록하였다.
- 추론 깊이가 증가할수록 프레임워크의 성능 향상이 뚜렷하게 나타나 복잡한 문제에 대해 우수한 확장성을 보였다.
- 기호 해법기의 오류 메시지를 활용한 자기 개선은 기호 표현 정확도 향상에 명백한 기여를 하였다.
- 오류 사례 분석 결과, LLM은 일반적으로 술어를 잘못 표현하거나, 공간 관계(예: '위에' vs. '아래에')를 혼동하거나, 문법적으로 잘못된 FOL 공식을 생성하는 경향을 보였다.
- 다양한 추론 유형(연역 추론, FOL, CSP, 분석적 추론 등)에 대해 프레임워크는 뛰어난 견고성을 보였다.
- 기호 표현 과정에서의 도전 과제가 존재하더라도, 기호 해법기의 통합은 추론 결과의 논리적 충실도와 투명성을 보장한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.