[논문 리뷰] Maieutic Prompting: Logically Consistent Reasoning with Recursive Explanations
Maieutic prompting은 대규모 언어 모델에서 논리적 일관성을 향상시키기 위해 진술의 가능한 두 가지 답(참/거짓)에 대해 추론적 설명을 순환적으로 생성하고, 상호 연관된 명제의 트리 구조를 구성하며, 가중치가 부여된 MAX-SAT를 통해 모순을 해결하여 가장 일관된 진리 할당을 유추하는 새로운 소수의 추론 방법이다. 이는 설명이 노이즈가 있거나 일관되지 않은 경우에도 공용리성 추론 벤치마크에서 최신의 추론 방법보다 최대 20% 높은 정확도를 달성한다.
Despite their impressive capabilities, large pre-trained language models (LMs) struggle with consistent reasoning; recently, prompting LMs to generate explanations that self-guide the inference has emerged as a promising direction to amend this. However, these approaches are fundamentally bounded by the correctness of explanations, which themselves are often noisy and inconsistent. In this work, we develop Maieutic Prompting, which infers a correct answer to a question even from the noisy and inconsistent generations of LM. Maieutic Prompting induces a tree of explanations abductively (e.g. X is true, because ...) and recursively, then frames the inference as a satisfiability problem over these explanations and their logical relations. We test Maieutic Prompting for true/false QA on three challenging benchmarks that require complex commonsense reasoning. Maieutic Prompting achieves up to 20% better accuracy than state-of-the-art prompting methods, and as a fully unsupervised approach, performs competitively with supervised models. We also show that Maieutic Prompting improves robustness in inference while providing interpretable rationales.
연구 동기 및 목표
- 모델이 생성한 설명이 논리적으로 일관되지 않거나 사실적으로 신뢰할 수 없는 설명 기반 추론의 근본적 한계를 해결하기 위해.
- 자신의 설명이 노이즈이거나 모순되는 경우에도 대규모 언어 모델이 정확한 답을 유추할 수 있도록 하기 위해.
- 내재된 자기 생성 추론을 활용하여 추론의 강건성과 해석 가능성 향상을 위한 완전히 비지도 학습 방법을 개발하기 위해.
- 논리적 관계를 기호적으로 모델링하여 MAX-SAT를 사용해 모순을 해결하고 가장 일관된 추론을 식별하기 위해.
- 복잡한 공용리성 추론 및 사실 검증 과제에서 소수의 추론 기반 베이스라인 및 지도 학습 모델을 모두 능가하기 위해.
제안 방법
- 주어진 질문의 참/거짓 가설에 대해 단일 설명이 아닌, 양쪽의 추론적 설명을 생성하도록 언어 모델을 유도한다.
- 자신의 설명을 검증하기 위해 모델을 순환적으로 프롬프트하여 논리적 의존성이 있는 명제의 트리 구조 계층을 생성한다.
- 각 설명과 원본 질문을 명제 변수로 간주하고, 신뢰도 점수를 믿음 강도로 표현한다.
- 명제 간 논리적 관계(예: 함의, 모순)를 가중치가 부여된 클라우즈로 구성된 MAX-SAT 공식화에 모델링한다.
- 가장 많은 클라우즈를 만족시키는 진리값 할당을 찾기 위해 가중치가 부여된 MAX-SAT 솔버를 사용하여 논리적 일관성을 보장한다.
- 소수의 프롬프트만 필요로 하며, 미세조정이나 인간이 애너테이션한 추론이 전혀 필요 없이 완전히 비지도 방식으로 적용한다.
실험 결과
연구 질문
- RQ1언어 모델이 생성한 일관되지 않거나 잘못된 설명을 활용하여 논리적으로 일관되고 정확한 답을 도출할 수 있는가?
- RQ2자기 생성된 설명의 트리에 대해 기호적 추론을 수행할 경우, 표준 설명 기반 추론을 넘어서 추론 정확도가 얼마나 향상되는가?
- RQ3기본 베이스라인 대비 Maieutic prompting은 질문과 프롬프트의 변형에 대해 얼마나 강건한가?
- RQ4완전히 비지도 방법이 복잡한 공용리성 추론 과제에서 지도 학습 모델과 경쟁 가능한 성능을 달성할 수 있는가?
- RQ5Maieutic prompting에서 생성된 모델 추론은 인간이 애너테이션한 추론과 비교해 품질과 일관성 면에서 어떻게 다른가?
주요 결과
- Maieutic prompting은 세 가지 도전적인 공용리성 추론 및 사실 검증 벤치마크에서 최신 소수의 추론 방법보다 최대 20% 높은 정확도를 달성한다.
- 모델의 미세조정이나 인간이 애너테이션한 추론이 전혀 없이도 지도 학습 모델과 경쟁 가능한 성능을 보인다.
- 틀린 답변이 나온 예시들 중 42%의 설명은 사실적으로 올바르며, 23%는 정답을 식별하는 데에 완전히 유용하다. 이는 잘못된 설명이라도 적절히 해결된다면 가치가 있음을 보여준다.
- 질문과 프롬프트의 입력 변형에 대해 강건성을 향상시켜, 악성 조건이나 노이즈가 있는 환경에서 기존의 베이스라인을 능가한다.
- 생성된 추론은 해석 가능하고 설득력 있으며, 종종 지표 설명 수준에 도달하거나 이를 초월하는 일관된 논리적 사슬을 형성한다.
- 명제 트리의 전반적인 모순을 MAX-SAT를 통해 해결함으로써, 개별 설명의 신뢰도 점수에만 의존하는 것보다 더 일관되고 신뢰할 수 있는 추론이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.