[논문 리뷰] SatLM: Satisfiability-Aided Language Models Using Declarative Prompting
SatLM는 추론을 향상시키기 위해 기호적 프롬프팅을 사용하는 만족 가능성 보조 언어 모델링 접근법을 제안한다. 지시어를 생성하는 대신, LLM은 자연어 문제를 논리적 제약 조건으로 해석하고, 표준 SAT 솔버를 사용해 이를 해결함으로써 정확성과 계획 오류를 줄인다. SatLM는 GSM, LSAT, BoardgameQA, StructuredRegex에서 최고 성능을 기록했으며, GSM-Sys에서 프로그램 보조 LLM보다 23% 높은 성능을 달성했고, 여러 벤치마크에서 새로운 SOTA를 수립했다.
Prior work has combined chain-of-thought prompting in large language models (LLMs) with programmatic representations to perform effective and transparent reasoning. While such an approach works well for tasks that only require forward reasoning (e.g., straightforward arithmetic), it is less effective for constraint solving problems that require more sophisticated planning and search. In this paper, we propose a new satisfiability-aided language modeling (SatLM) approach for improving the reasoning capabilities of LLMs. We use an LLM to generate a declarative task specification rather than an imperative program and leverage an off-the-shelf automated theorem prover to derive the final answer. This approach has two key advantages. The declarative specification is closer to the problem description than the reasoning steps are, so the LLM can parse it out of the description more accurately. Furthermore, by offloading the actual reasoning task to an automated theorem prover, our approach can guarantee the correctness of the answer with respect to the parsed specification and avoid planning errors in the solving process. We evaluate SATLM on 8 different datasets and show that it consistently outperforms program-aided LMs in the imperative paradigm. In particular, SATLM outperforms program-aided LMs by 23% on a challenging subset of the GSM arithmetic reasoning dataset; SATLM also achieves a new SoTA on LSAT and BoardgameQA, surpassing previous models that are trained on the respective training sets.
연구 동기 및 목표
- 복잡한 추론 작업에서 체인 오브 코스와 프로그램 보조 프롬프팅의 한계를 해결하기 위해.
- 사양과 실행을 분리함으로써 LLM 기반 추론에서 실행 오류와 계획 오류를 줄이기 위해.
- 자동 정리 증명기로 문제 사양에 대한 해결책을 검증함으로써 추론 정확도를 향상시키기 위해.
- 불만족 가능하거나 모호한 문제 사양을 탐지함으로써 선택적 예측을 가능하게 하기 위해.
- 산술, 논리, 기호 추론 작업을 포함한 다양한 추론 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- LLM은 자연어 문제 기술을 지시어 추론 단계가 아닌 논리적 제약 조건 집합(기호적 사양)으로 변환하도록 프롬프팅된다.
- 생성된 논리 공식은 SAT 솔버(SMT 및 일阶 논리 정리 증명기 포함)에 입력되어 해결책을 도출한다.
- SAT 솔버는 모든 제약 조건을 만족하는지 확인함으로써 정확성을 보장하고 실행 오류를 제거한다.
- LLM의 역할은 해석에 국한되고, 솔버의 역할은 추론 계획 및 실행에 할애되어, 오류가 많은 체인 오브 코스 생성에 의존도를 낮춘다.
- 소수 샘플 프롬프팅과 자기 일관성 디코딩을 사용해 제로샷 일반화와 강건성을 향상시킨다.
- 사양이 불만족 가능하거나 모호할 경우 시스템은 답변을 회피함으로써 선택적 예측 환경에서의 신뢰성을 높인다.

실험 결과
연구 질문
- RQ1기호적 프롬프팅과 SAT 솔버를 조합하면 지시어 프로그램 보조 프롬프팅에 비해 LLM의 추론 성능을 향상시킬 수 있는가?
- RQ2추론 계획을 SAT 솔버에 위임함으로써 복잡한 추론 작업에서 계획 오류와 실행 오류를 줄일 수 있는가?
- RQ3LLM과 SAT 솔버의 조합이 산술 및 논리 추론을 포함한 다양한 추론 벤치마크에서 최고 성능을 낼 수 있는가?
- RQ4불확실하거나 모호한 문제를 거부하는 선택적 예측 환경에서 이 접근법의 성능은 어떠한가?
- RQ5LLM이 기호적 사양을 생성하도록 요구함으로써 표준 체인 오브 코스 프롬프팅에 비해 추론 품질이 향상되는가?
주요 결과
- SatLM는 GSM 데이터셋의 과도한 난이도를 지닌 GSM-Sys 서브셋에서 프로그램 보조 LLM보다 23% 높은 성능을 기록하여 산술 추론에서 뚜렷한 향상을 보였다.
- SatLM는 소수 샘플 프롬프팅과 자기 일관성 디코딩을 사용해 GSM 데이터셋에서 84.8%의 새로운 SOTA 성능을 달성했으며, 전체 학습 세트로 미세조정된 모델과 동일한 성능를 기록했다.
- SatLM는 LSAT(Zhong et al., 2022)에서 새로운 SOTA 성능을 기록했으며, 이전에 훈련된 모델보다 동일한 벤치마크에서 뛰어난 성능을 보였다.
- SatLM는 BoardgameQA(Kazemi et al., 2023)와 StructuredRegex(Ye et al., 2020)에서 SOTA 성능을 달성해 다양한 추론 작업에 대한 광범위한 적용 가능성을 보였다.
- 이 접근법은 프로그램 보조 LLM에서 흔히 발생하는 잘못된 식 변환과 같은 계획 오류를 줄였으며, 논리적 일관성은 SAT 솔버에 의존함으로써 보장했다.
- 불만족 가능하거나 모호한 문제 사양을 탐지함으로써 SatLM는 신뢰성 있는 선택적 예측을 가능하게 하여 불확실한 경우의 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.