[논문 리뷰] Question Decomposition Improves the Faithfulness of Model-Generated Reasoning
이 논문은 대규모 언어 모델(LM) 추론의 신뢰성 향상을 위해 질문 분해—특히 요소 분해—를 제안한다. 이는 원래 질문의 잠재적 편향으로부터 독립된 맥락에서 하위질문을 별도로 답변함으로써 이루어지며, 원래 질문의 부정확한 단서에 의존하는 것을 줄여 추론의 신뢰성을 크게 향상시킨다. 이 방법은 정확도를 희생시키지 않은 채 표준 체인 오브 토의(Chain-of-Thought, CoT)보다도 추론의 신뢰성 지표에서 뛰어난 성능을 보이며, 특히 복잡한 작업에서 신뢰성 있는 추론을 가능하게 한다.
As large language models (LLMs) perform more difficult tasks, it becomes harder to verify the correctness and safety of their behavior. One approach to help with this issue is to prompt LLMs to externalize their reasoning, e.g., by having them generate step-by-step reasoning as they answer a question (Chain-of-Thought; CoT). The reasoning may enable us to check the process that models use to perform tasks. However, this approach relies on the stated reasoning faithfully reflecting the model's actual reasoning, which is not always the case. To improve over the faithfulness of CoT reasoning, we have models generate reasoning by decomposing questions into subquestions. Decomposition-based methods achieve strong performance on question-answering tasks, sometimes approaching that of CoT while improving the faithfulness of the model's stated reasoning on several recently-proposed metrics. By forcing the model to answer simpler subquestions in separate contexts, we greatly increase the faithfulness of model-generated reasoning over CoT, while still achieving some of the performance gains of CoT. Our results show it is possible to improve the faithfulness of model-generated reasoning; continued improvements may lead to reasoning that enables us to verify the correctness and safety of LLM behavior.
연구 동기 및 목표
- 작업의 복잡성이 증가함에 따라 LLM 행동의 정확성과 안전성을 검증하는 데 점점 더 어려운 과제가 되고 있음을 다루기 위해.
- 모델의 내부 과정에 대해 체인 오브 토의(CoT) 추론이 진정으로 신뢰할 수 있는지, 편향되거나 忽시된 추론의 증거가 있는지 조사하기 위해.
- 성능을 희생시키지 않고도 신뢰성을 향상시키는 대안적 프롬프팅 전략을 탐색하기 위해.
- 특히 독립된 맥락 처리를 통해 질문을 하위질문으로 분해하는 것이 더 신뢰할 수 있고 해석 가능한 추론을 이끌어내는지 평가하기 위해.
제안 방법
- 이 방법은 각 하위질문이 별도의 맥락에서 답변되어 원래 질문의 잠재적 편향으로부터 추론을 격리시키는 요소 분해를 사용한다.
- 하위답변들이 결합되어 최종 답변을 도출되며, 이는 추론 단계가 독립적인 추론에 기반함을 보장한다.
- 표준 CoT와 대비되어 모든 추론이 하나의 맥락에서 이루어지며, 체인 오브 토의 분해와도 대비되어 하위질문들이 여전히 한 맥락에 연결되어 있다.
- 신뢰성은 추론 절단이나 손상에 대한 민감도를 통해 측정되며, 높은 점수는 추론이 최종 답변에 직접적인 영향을 미친다는 것을 의미한다.
- 성능 평가는 질문-답변 정확도로 평가되며, 신뢰성은 최종 답변의 추론 교란에 대한 민감도 및 편향된 맥락에 의한 정확도 변화와 같은 지표로 평가된다.
- 일반화를 향상시키기 위해 고품질의 예시를 포함한 few-shot 프롬프트를 사용한다.
실험 결과
연구 질문
- RQ1요소 분해는 표준 체인 오브 토의(CoT) 프롬프팅보다 더 높은 수준의 추론의 신뢰성을 제공하는가?
- RQ2요소 분해는 모델 추론에서 비언급된 편향에 대한 의존도를 어느 정도 줄이는가?
- RQ3분해 기반 방법은 성능을 희생시키지 않고도 높은 질문-답변 정확도를 유지하면서도 신뢰성을 향상시킬 수 있는가?
- RQ4다양한 프롬프팅 전략에서 추론 단계의 손상이나 잘라내기 시 최종 답변은 얼마나 민감한가?
- RQ5고립된 맥락에서 하위질문을 답변함으로써 모델이 추론을 忽시하거나 왜곡하는 경향이 줄어드는가?
주요 결과
- 요소 분해는 최종 답변 절단 민감도에서 가장 높은 신뢰성 점수(20.5)를 기록했으며, 표준 CoT(11.7)와 체인 오브 토의 분해(10.8)를 크게 앞섰다.
- 최종 답변 손상 민감도에서는 요소 분해가 33.6점을 기록했고, 체인 오브 토의 분해는 28.7점, 표준 CoT는 9.6점이었으며, 이는 추론이 출력에 더 강하게 영향을 미친다는 것을 시사한다.
- 요소 분해는 편향된 맥락 정확도 변화를 -3.6으로 줄였고, CoT는 -11.3이었으며, 이는 비언급된 편향에 대한 의존도가 감소했음을 보여준다.
- 신뢰성 향상에도 불구하고 요소 분해는 높은 성능을 유지하여 81.8%의 질문-답변 정확도를 기록했으며, CoT의 86.0%와 유사한 성능을 보였다.
- 손상된 추론 상황에서 요소 분해는 추론이 변경되었을 때 최종 답변이 더 자주 변경되는 경향을 보였으며, 이는 추론과 출력 간의 더 강한 일치를 의미한다.
- 이 방법은 네 가지 다양한 질문-답변 과제에서 뚜렷한 개선을 보이며, 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.