[논문 리뷰] Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoning
이 논문은 소형 언어 모델에서 체인 오브 타ught(Chain-of-Thought, CoT) 추론의 신뢰성(faithfulness)을 향상시키기 위해, 올바른 추론 단계를 생성하고 암묵적 피드백 및 인과적 선호도 목표를 통해 이를 견고하게 활용하도록 훈련하는 프레임워크 Frodo를 소개한다. Frodo는 강력한 기준 모델들보다 2–3%p의 절대 정확도 향상을 달성하며, 분포 외 추론 작업에서 뛰어난 견고성과 일반화 능력을 보여준다.
Large language models (LLMs) have been shown to perform better when asked to reason step-by-step before answering a question. However, it is unclear to what degree the model's final answer is faithful to the stated reasoning steps. In this paper, we perform a causal mediation analysis on twelve LLMs to examine how intermediate reasoning steps generated by the LLM influence the final outcome and find that LLMs do not reliably use their intermediate reasoning steps when generating an answer. To address this issue, we introduce FRODO, a framework to tailor small-sized LMs to generate correct reasoning steps and robustly reason over these steps. FRODO consists of an inference module that learns to generate correct reasoning steps using an implicit causal reward function and a reasoning module that learns to faithfully reason over these intermediate inferences using a counterfactual and causal preference objective. Our experiments show that FRODO significantly outperforms four competitive baselines. Furthermore, FRODO improves the robustness and generalization ability of the reasoning LM, yielding higher performance on out-of-distribution test sets. Finally, we find that FRODO's rationales are more faithful to its final answer predictions than standard supervised fine-tuning.
연구 동기 및 목표
- 대규모 언어 모델(Large Language Models, LLMs)이 최종 답변을 도출할 때 자신의 중간 추론 단계를 신뢰성 있게 사용하는지 여부를 조사하는 것.
- 체인 오브 타ught(CoT) 추론에서 추론 단계가 최종 출력에 인과적으로 영향을 주지 못하는, 즉 비신뢰성(unfaithful)한 원인을 진단하는 것.
- 추론 단계가 올바르고 최종 답변 생성에 충실하게 사용되도록 보장하는 방법을 개발하는 것.
- 표준 지도 미세조정보다 더 높은 견고성과 일반화 능력을 갖춘 소거된 추론 모델을 향상시키는 것.
제안 방법
- 12개의 LLM에서 세 가지 추론 작업에 대해 중간 추론 단계(매개자)가 최종 답변(결과)에 미치는 인과적 영향을 측정하기 위해 인과적 중재 분석을 수행한다.
- 훈련 중 암묵적 피드백을 위해 LLM을 사용하여 사실적 및 반사적 추론 체인을 생성하여 선호도 데이터를 만든다.
- 직접 선호도 최적화(Direct Preference Optimization, DPO)를 사용하여 사실적 추론 체인을 반사적 체인보다 우선시하는 추론 모듈을 훈련시킨다.
- 반사적 및 인과적 선호도 목표를 통해 추론 단계가 충실하게 사용되도록 보장하기 위해 추론 모듈을 훈련시킨다.
- DPO와 인과적 선호도 순위를 사용해 미세조정된 소형 언어 모델을 통해 큰 모델들로부터 신뢰할 수 있는 CoT 추론을 소거한다.
- Quarel, StrategyQA, OpenBookQA, QASC 네 가지 추론 벤치마크에서 다양한 모델 크기와 분석 실험을 통해 Frodo를 평가한다.

실험 결과
연구 질문
- RQ1LLMs는 최종 답변을 도출할 때 자신의 생성한 추론 단계에 얼마나 인과적으로 의존하는가?
- RQ2많은 LLMs가 최종 예측에 영향을 주지 않는, 그러나 설득력 있는 가짜 추론 흐름을 생성하는 이유는 무엇인가?
- RQ3LLMs가 생성한 암묵적 피드백을 사용해 소형 모델이 올바르고 인과적으로 관련된 추론 단계를 생성하도록 훈련시킬 수 있는가?
- RQ4추론 모듈은 중간 추론 단계를 충실하게 사용하도록 어떻게 훈련시켜야 최종 정답 정확도를 향상시킬 수 있는가?
- RQ5표준 소거 기법과 비교해 Frodo는 분포 외 추론 예제에서 일반화 능력과 견고성을 향상시키는가?
주요 결과
- 인과적 중재 분석 결과, GPT-3.5-Instruct와 같은 지시 미세조정 모델은 RLHF 미세조정 모델인 ChatGPT보다 추론 단계가 최종 답변에 더 강한 인과적 영향을 미친다.
- GPT-4는 반사적 추론 체인을 수정했을 때 최종 답변을 뿐만 아니라 30%의 경우에만 변경하므로, 추론 단계에 대해 약한 충실도를 보인다.
- Frodo는 지도 미세조정 및 CoT 소거 기법을 포함한 강력한 기준 모델들보다 2–3%p의 절대 정확도 향상을 달성한다.
- Frodo는 분포 외 테스트 세트에서 표준 소거 기법보다 뛰어난 견고성과 일반화 능력을 보여준다.
- 표준 지도 미세조정에 비해 Frodo가 생성한 추론 근거는 최종 예측에 훨씬 더 충실하다.
- 이 프레임워크의 성능은 외부 모델 출력에 의존하는 반사적 추론 근거의 질에 민감하게 영향을 받는다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.