Skip to main content
QUICK REVIEW

[논문 리뷰] Diversity of Thought Improves Reasoning Abilities of LLMs

Ranjita Naik, Varun Chandrasekaran|arXiv (Cornell University)|2023. 10. 11.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Model, LLM)의 추론 성능을 향상시키기 위해 LLM 피드백을 통해 다양한 프롬프팅 전략을 생성하고, 여러 추론 호출 간 응답을 앙상블하는 방식(Div-Se) 또는 한 번의 호출 내에서 응답을 앙상블하는 방식(IDiv-Se)을 제안한다. 이 방법은 디코딩 방식을 수정하지 않으면서 정확도를 향상시켜, GPT-3.5와 GPT-4를 사용한 여러 추론 벤치마크에서 정확도-비용 파레토 경계를 개선하며, 4/5 Blocksworld 작업에서 최신 기준보다 최대 29.6个百分点 높은 성능을 기록한다.

ABSTRACT

Large language models (LLMs) are documented to struggle in settings that require complex reasoning. Nevertheless, instructing the model to break down the problem into smaller reasoning steps, or ensembling various generations through modifying decoding steps boosts performance. However, these methods assume that the input prompt is fixed and expect the decoding strategies to introduce the diversity needed for ensembling. In this work, we discuss how one can create and leverage variations of the input prompt as a means of diversity of thought. We propose a method that automatically improves prompt diversity by soliciting feedback from the LLM to ideate approaches that are apt for the problem. We then ensemble the diverse prompts in our method DIVSE (DIVerse reasoning path Self-Ensemble) across multiple inference calls, or use diverse approaches within a single inference call; we call the latter IDIV-SE (In-call DIVerse reasoning path Self-Ensemble). Apart from our approaches outperforming prior work, DIV-SE(in particular) advances state-of-the-art performance on the challenging planning and graph coloring benchmarks. Our results improve the Pareto frontier of the accuracy-cost trade-off.

연구 동기 및 목표

  • 단일 프롬프트에 의존하는 few-shot 및 zero-shot CoT 프롬프팅의 한계를 해결하기 위해, 성능 향상이 디코딩의 난수성에만 의존하는 문제를 해결한다.
  • 특히 상용 또는 블랙박스 배포 환경에서 디코딩 프로세스를 수정하지 않고도 LLM의 추론 성능을 향상시키는 것을 목표로 한다.
  • 다양한 문제 해결 접근 방식(예: 역으로 생각하기, 시각화, 제거)을 포함한 사고 수준의 다양성이 토큰 수준의 난수성보다 더 효과적으로 앙상블 정확도를 향상시킬 수 있는지 탐색한다.
  • IDiv-Se를 통해 여러 개의 다양한 프롬프트를 한 번의 호출에 통합함으로써 추론 비용을 줄이면서도 성능을 유지하거나 향상시키는 것을 목표로 한다.
  • 사고 수준의 다양성이 LLM 추론에서 정확도 대 비용의 파레토 경계를 향상시키는 원칙적인 프롬프팅 전략이 될 수 있음을 확립한다.

제안 방법

  • 주어진 추론 작업에 대해 LLM 피드백을 요청하여 고수준의 문제 해결 전략(예: 역으로 생각하기, 시각화, 제거 등)을 다수 생성한다.
  • 각각의 전략을 기반으로 이전 연구에서 제안된 예시 추론 단계(예: Chain-of-Thought)를 해당 전략에 맞게 스타일 전이하여 새로운 프롬프트 형식으로 변환한다.
  • Div-Se는 각기 다른 다양한 프롬프트를 사용해 복수의 독립적인 추론 호출을 수행하고, 다수결 투표를 통해 결과를 통합한다.
  • IDiv-Se는 n개의 다양한 프롬프트를 하나의 입력 프롬프트로 통합하여 한 번의 추론 호출에서 n개의 추론 경로를 생성한 후, 다수결 투표를 통해 출력을 통합한다.
  • 이 방법은 모델이 다양한 추론 전략을 제안할 수 있는 능력을 활용하여, 토큰 수준이 아닌 사고 수준에서의 다양성을 확보한다.
  • 결과 통합은 다수결 투표 또는 메타리ason링 기법을 통해 수행되어 최종 출력의 신뢰도를 향상시킨다.
Figure 1: Diversity of Thought enhances the inference cost and accuracy trade-off. We compare DIV-SE and IDIV-SE with SC (Wang et al., 2023 ) and CoT (Wei et al., 2022 ) across three benchmarks. Panels show (i) AQUA-RAT on GPT-3.5 in few-shot-CoT setting, and (ii) Blocksworld 3 and 4/5 on GPT-4 in z
Figure 1: Diversity of Thought enhances the inference cost and accuracy trade-off. We compare DIV-SE and IDIV-SE with SC (Wang et al., 2023 ) and CoT (Wei et al., 2022 ) across three benchmarks. Panels show (i) AQUA-RAT on GPT-3.5 in few-shot-CoT setting, and (ii) Blocksworld 3 and 4/5 on GPT-4 in z

실험 결과

연구 질문

  • RQ1LLM으로부터 다양한 문제 해결 전략을 요청함으로써, 표준 CoT 및 self-consistency 방법을 초월한 추론 성능 향상을 달성할 수 있는가?
  • RQ2예를 들어 역으로 생각하기나 시각화와 같은 다양한 전략을 포함한 사고 수준의 다양성이 토큰 수준의 다양성보다 더 높은 앙상블 정확도를 제공하는가?
  • RQ3단일 추론 호출 방법(IDiv-Se)이 복수의 호출 앙상블(Div-Se)과 유사한 성능을 달성하면서 비용을 줄일 수 있는가?
  • RQ4LLM 피드백을 통해 생성된 프롬프트 다양성이 추론 벤치마크에서 정확도-비용 파레토 경계를 얼마나 향상시키는가?
  • RQ5앙상블 통합 없이도, LLM이 제안한 접근 방식에서 유도된 다양한 프롬프트 전략이 zero-shot CoT를 독립적으로 뛰어넘을 수 있는가?

주요 결과

  • Div-Se와 IDiv-Se는 GPT-3.5와 GPT-4를 사용한 여러 추론 벤치마크(예: AQUA-RAT, Blocksworld 포함)에서 Chain-of-Thought(CoT) 및 self-consistency(SC) 프롬프팅을 모두 초월한다.
  • 어려운 4/5 Blocksworld 작업에서 Div-Se는 이전 최고 기록보다 29.6个百分点 높은 성능을 기록하여 그 기록을 초월했다.
  • AQUA-RAT 벤치마크에서 GPT-3.5를 사용한 few-shot 설정에서 IDiv-Se는 CoT 대비 16.52个百分点 성능 향상을 기록했다.
  • IDiv-Se는 훨씬 낮은 추론 비용으로 Div-Se와 유사한 정확도를 달성하여, 호출 내 앙상블 추론의 실현 가능성을 입증했다.
  • 앙상블 통합 없이도 LLM이 제안한 접근 방식에서 파생된 다양한 프롬프트가 표준 zero-shot CoT를 뛰어넘는 성능을 보이며, 프롬프트 다양성 자체의 내재적 가치를 입증했다.
  • 메타리ason링 통합 기법은 성능을 추가로 향상시켜, 추론 경로에 풍부한 정보가 존재하고 후처리 기법으로 활용 가능하다는 점을 시사한다.
Figure 2: Diversity of Thought . This illustration depicts CoT and IDiv-Se prompting strategies. Notice that both have a single example. However, IDiv-Se presents more diversity in terms of reasoning paths. This enables it to generate diverse completions, yielding more accurate responses.
Figure 2: Diversity of Thought . This illustration depicts CoT and IDiv-Se prompting strategies. Notice that both have a single example. However, IDiv-Se presents more diversity in terms of reasoning paths. This enables it to generate diverse completions, yielding more accurate responses.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.