[논문 리뷰] Faithful Reasoning Using Large Language Models
충실성 주도 추론 프레임워크(halter가 있는 Selection-Inference 및 값 기반 빔 검색)가 해석 가능한 추론 흔적을 생성하고 ProofWriter 및 EntailmentBankQA 데이터셋에서 다단계 질문 응답을 개선한다.
Although contemporary large language models (LMs) demonstrate impressive question-answering capabilities, their answers are typically the product of a single call to the model. This entails an unwelcome degree of opacity and compromises performance, especially on problems that are inherently multi-step. To address these limitations, we show how LMs can be made to perform faithful multi-step reasoning via a process whose causal structure mirrors the underlying logical structure of the problem. Our approach works by chaining together reasoning steps, where each step results from calls to two fine-tuned LMs, one for selection and one for inference, to produce a valid reasoning trace. Our method carries out a beam search through the space of reasoning traces to improve reasoning quality. We demonstrate the effectiveness of our model on multi-step logical deduction and scientific question-answering, showing that it outperforms baselines on final answer accuracy, and generates humanly interpretable reasoning traces whose validity can be checked by the user.
연구 동기 및 목표
- 대형 언어 모델(LLMs)에서 해석 가능하고 충실한 다단계 추론의 필요성에 대한 동기를 부여한다.
- 추론 트레이스의 논리적 타당성을 반영하는 순방향 연쇄 아키텍처(Selection-Inference)를 개발한다.
- 트레이스에 의존적이 되도록 중단 결정 규칙을 도입하여 모델 편향이 아닌 트레이스에 따라 답을 출력하도록 한다.
- 추론 트레이스를 찾기 위한 가치 함수 가이드 빔 탐색을 도입한다.
- Reasoning 데이터셋에서 시스템을 평가하여 최종 답변 정확도와 트레이스 타당성의 향상을 입증한다.
제안 방법
- 두 개의 미세조정된 LM이 백본을 형성: Selection 모델과 Inference 모델로 일련의 추론 단계를 생성한다.
- halter LM은 각 단계 후 현재 추론이 답을 내기에 충분한지 결정하고, 추론 트레이스에 의존하는 경우에만 답을 반환한다.
- 가치 함수 LM이 부분 트레이스를 평가하여 추론 트레이스를 따라 빔 탐색을 안내하고 상위 트레이스를 선택해 이어 진행한다.
- 문장이 환각을 방지하도록 문장 레이블을 사용해 맥락에서 진술을 선택하고, 추론 단계는 선택된 진술로부터 함의를 예측한다.
- 추론 트레이스는 타당성, 연결성, 논리적 함의와의 일치성 측면에서 정의되고 평가된다.
- 시스템은 두 단계 Halter를 사용해 답을 산출하거나 트레이스가 불충분하면 Unknown를 선언한다.
- 빔 탐색은 P개의 후보 단계로 확장하고 각 깊이에서 상위 B개의 트레이스로 잘라 트레이스를 탐색하는 트리 구조를 따른다.
실험 결과
연구 질문
- RQ1선택 및 추론 단계가 있는 순방향 체인 추론 시스템이 유효하고 검증 가능한 추론 트레이스를 생성할 수 있는가?
- RQ2트레이스 충분성에 기반해 Answer 또는 Unknown를 출력함으로써 정밀도가 향상되는 Halter 메커니즘이 있는가?
- RQ3가치 함수 가이드 빔 탐색이 베이스라인 대비 최종 답변 정확도와 트레이스 품질을 향상시키는가?
- RQ4충실한 트레이스가 환각을 줄이고 맥락 및 트레이스 활용을 개선하는가?
주요 결과
- SI+Halter+Search 구성은 베이스라인 대비 PW에서 최종 답변 정확도 88.1%, EB에서 78.1%의 높은 정확도를 달성한다.
- SI는 베이스라인보다 더 높은 품질의 추론 트레이스를 제공하며 EntailmentBankQA 및 ProofWriter 데이터셋에서 잘못된 사실에 대한 중단 비율이 낮다.
- halter는 답을 알 때를 안정적으로 예측하여 Unknown 케이스를 필터링하고 정밀도를 크게 향상한다.
- 가치 함수 가이드 빔 탐색은 특히 더 깊은 추론(PW depth-5) 및 산만한 요소가 있는 EB에서 성능을 향상시킨다.
- 베이스라인 모델은 더 많은 환각을 일으키고 제공된 맥락과 트레이스의 사용이 덜한 경향이 있으며; SI+Halter는 더 나은 트레이스 타당성과 트레이스 기반 응답을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.