Skip to main content
QUICK REVIEW

[논문 리뷰] Neuro Symbolic Reasoning for Planning: Counterexample Guided Inductive Synthesis using Large Language Models and Satisfiability Solving

Sumit Kumar Jha, Susmit Jha|arXiv (Cornell University)|2023. 09. 28.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 블록 월드 문제를 위한 증명 가능하게 올바른 계획을 생성하기 위해 대규모 언어 모델(Large Language Models, LLMs)과 만족 가능성 모듈러 이론(Satisfiability Modulo Theories, SMT) 솔버를 결합한 신경-기호 프레임워크를 제안한다. 잘못된 LLM에 의해 생성된 계획에 대해 SMT 솔버를 반복적으로 사용하여 오류를 탐지하고 반례(counterexample)를 제공함으로써, 이 시스템은 피드백 루프를 통해 LLM을 안내하여 정확한 해를 도출한다. 이는 안전 기반 계획 작업에서 신뢰성을 크게 향상시킨다.

ABSTRACT

Generative large language models (LLMs) with instruct training such as GPT-4 can follow human-provided instruction prompts and generate human-like responses to these prompts. Apart from natural language responses, they have also been found to be effective at generating formal artifacts such as code, plans, and logical specifications from natural language prompts. Despite their remarkably improved accuracy, these models are still known to produce factually incorrect or contextually inappropriate results despite their syntactic coherence - a phenomenon often referred to as hallucination. This limitation makes it difficult to use these models to synthesize formal artifacts that are used in safety-critical applications. Unlike tasks such as text summarization and question-answering, bugs in code, plan, and other formal artifacts produced by LLMs can be catastrophic. We posit that we can use the satisfiability modulo theory (SMT) solvers as deductive reasoning engines to analyze the generated solutions from the LLMs, produce counterexamples when the solutions are incorrect, and provide that feedback to the LLMs exploiting the dialog capability of instruct-trained LLMs. This interaction between inductive LLMs and deductive SMT solvers can iteratively steer the LLM to generate the correct response. In our experiments, we use planning over the domain of blocks as our synthesis task for evaluating our approach. We use GPT-4, GPT3.5 Turbo, Davinci, Curie, Babbage, and Ada as the LLMs and Z3 as the SMT solver. Our method allows the user to communicate the planning problem in natural language; even the formulation of queries to SMT solvers is automatically generated from natural language. Thus, the proposed technique can enable non-expert users to describe their problems in natural language, and the combination of LLMs and SMT solvers can produce provably correct solutions.

연구 동기 및 목표

  • 안전 기반 시스템에서 치명적인 실패를 초래할 수 있는, 계획이나 코드와 같은 LLM에 의해 생성된 형식적 자료의 환각 현상 문제를 해결한다.
  • 구문적으로는 올바르지만 형식적 검증 보장을 갖지 못하는 순수 인도적 LLM의 한계를 극복한다.
  • 비전문가 사용자가 자연어로 계획 문제를 기술할 수 있도록 하면서도, 생성된 해가 형식적으로 올바르다는 것을 보장한다.
  • SMT 솔버를 통한 추론적 추론을 LLM과의 상호작용 루프에 통합하여, 반례 피드백을 통해 잘못된 출력를 수정한다.
  • 인도적 학습(Large Language Models)과 추론적 검증(SMT)을 융합하여 신뢰할 수 있는 프로그램 및 계획 합성의 타당성과 효율성을 입증한다.

제안 방법

  • 지시어울림 LLMs(GPT-4, GPT-3.5 Turbo 등)를 사용하여 자연어 문제 기술서에서 계획을 생성한다.
  • 자연어 프롬프트를 통해 LLM이 생성한 계획을 자동으로 형식적 논리 표현으로 번역한다.
  • SMT 솔버(Z3)를 사용하여 생성된 계획이 문제의 초기 상태와 목표 조건에 대해 올바른지 검증한다.
  • 계획이 잘못된 경우, SMT 솔버는 최소한의 비가능한 접두어를 식별하고 이를 LLM에게 반례로 반환한다.
  • 반례를 대화의 맥락에 다시 입력하여 LLM이 계획을 반복적으로 수정하도록 유도한다.
  • 정확한 계획이 생성될 때까지 검증 및 개선 루프를 반복함으로써 형식적 정확성을 보장한다.

실험 결과

연구 질문

  • RQ1SMT 솔버를 통한 형식적 검증을 유도함으로써, LLM이 블록 월드 문제에 대해 신뢰성 있게 정확한 계획을 생성할 수 있는가?
  • RQ2반례 기반 피드백 루프는 환각되거나 잘못된 LLM에 의해 생성된 계획을 얼마나 효과적으로 수정하는가?
  • RQ3다른 LLMs(GPT-4 대비 GPT-3.5 Turbo 등)는 정확한 계획을 생성하기 위해 필요한 성공률과 반복 횟수에 어떤 영향을 미치는가?
  • RQ4복잡도가 증가하는 계획 문제에서 SMT 검증 통합이 LLM에 의해 생성된 계획의 실패율을 어느 정도 감소시키는가?
  • RQ5비전문가 사용자가 자연어로 계획 문제를 효과적으로 기술할 수 있으며, 여전히 이 하이브리드 접근법을 통해 형식적으로 올바른 해를 얻을 수 있는가?

주요 결과

  • GPT-4는 3블록 문제에서 20개의 계획 중 19개를 성공적으로 생성했지만, 10블록 문제에서는 20개 중 2개로 성능이 급격히 떨어져 스케일링 한계를 보였다.
  • GPT-3.5 Turbo는 3블록 문제에서 20개 중 12개의 정확한 계획을 생성했으며, 5블록 문제에서는 성능이 20개 중 4개로 떨어졌다.
  • 반례 기반 피드백 루프는 정확한 계획 생성에 필요한 반복 횟수를 줄였으며, GPT-4는 평균 2~3회 반복으로 문제를 해결했다.
  • SMT 솔버는 잘못된 계획에서 비가능한 접두어를 성공적으로 식별했으며, 예를 들어 가장 위에 있지 않은 블록을 분리하는 등의 잘못된 동작 시퀀스를 탐지했다.
  • 이 방법은 형식적 논리나 SMT 문법에 대한 전문 지식 없이도 자연어에서 형식적으로 검증된 계획까지의 엔드 투 엔드 합성을 가능하게 했다.
  • SMT 검증 통합은 특히 복잡하거나 모호한 상황에서 LLM의 계획 생성 정확성과 신뢰성을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.