Skip to main content
QUICK REVIEW

[논문 리뷰] Thought Propagation: An Analogical Approach to Complex Reasoning with Large Language Models

Junchi Yu, Ran He|arXiv (Cornell University)|2023. 10. 06.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 복잡한 추론을 향상시키기 위해 유사한 이전에 해결된 문제들에서 유사한 해결책을 재사용함으로써 대규모 언어 모델(Large Language Models, LLMs)의 추론 능력을 향상시키는 유추적 추론 프레임워크인 Thought Propagation (TP)을 제안한다. TP는 LLM에게 유사 문제를 식별하고, 이를 해결한 후 그 해법을 융합하여 대상 작업의 추론을 정교화하거나 이끌어내는 방식으로 작동하며, 태스크 특화 프롬프팅 엔지니어링 없이도 기준 모델 대비 최대 15% 향상된 성능을 달성한다.

ABSTRACT

Large Language Models (LLMs) have achieved remarkable success in reasoning tasks with the development of prompting methods. However, existing prompting approaches cannot reuse insights of solving similar problems and suffer from accumulated errors in multi-step reasoning, since they prompt LLMs to reason extit{from scratch}. To address these issues, we propose extbf{ extit{Thought Propagation} (TP)}, which explores the analogous problems and leverages their solutions to enhance the complex reasoning ability of LLMs. These analogous problems are related to the input one, with reusable solutions and problem-solving strategies. Thus, it is promising to propagate insights of solving previous analogous problems to inspire new problem-solving. To achieve this, TP first prompts LLMs to propose and solve a set of analogous problems that are related to the input one. Then, TP reuses the results of analogous problems to directly yield a new solution or derive a knowledge-intensive plan for execution to amend the initial solution obtained from scratch. TP is compatible with existing prompting approaches, allowing plug-and-play generalization and enhancement in a wide range of tasks without much labor in task-specific prompt engineering. Experiments across three challenging tasks demonstrate TP enjoys a substantial improvement over the baselines by an average of 12\% absolute increase in finding the optimal solutions in Shortest-path Reasoning, 13\% improvement of human preference in Creative Writing, and 15\% enhancement in the task completion rate of LLM-Agent Planning.

연구 동기 및 목표

  • LLM의 '스クラ치에서 추론' 방식의 한계를 해결하기 위해, 유사 문제에서의 통찰을 재사용하지 못하고 다단계 추론에서 누적 오류가 발생하는 문제를 해결한다.
  • 유사 문제의 해결책에서 유추하는 방식이 LLM의 추론 정확성과 강건성 향상에 기여할 수 있는지 탐구한다.
  • 기존 프롬프팅 기법과 호환되며, 태스크 특화 엔지니어링 없이 다양한 태스크에서 추론 능력을 향상시킬 수 있는 즉시 사용 가능한 프레임워크를 개발한다.
  • 성공적인 유사 문제 해결에서의 지식을 통합함으로써 다단계 추론에서의 오류 누적 문제를 줄인다.
  • 짧은 경로 계획, 창의적 글쓰기, LLM 에이전트 계획과 같은 복잡한 추론 태스크에서의 유추 전이의 효과를 입증한다.

제안 방법

  • TP는 먼저 LLM에게 입력 문제와 의미적 및 구조적 유사성에 기반해 관련된 유사 문제의 집합을 제안하도록 프롬프팅한다.
  • 각 유사 문제는 Chain-of-Thought (CoT)와 같은 기존 프롬프팅 기법을 사용해 해결되며, 중간 추론 추적과 최종 해법이 생성된다.
  • 집계 모듈은 유사 문제들로부터의 해법을 평가하고 융합하여 입력 문제의 정교화된 해법 또는 고수준 계획을 도출한다.
  • 집계 모듈은 입력 문제와 그 유사 문제들을 비교하고, LLM의 초기 스クラ치 추론을 이끌거나 수정할 수 있는 지식 집약형 계획을 수립한다.
  • 두 가지 평가 전략을 사용한다: Self-Evaluation (SE), 즉 LLM이 제로샷 프롬프팅을 통해 계획을 평가하는 방식과, Simulation (SM), 즉 환경에서 계획을 실행하여 성능을 평가하는 방식이다.
  • 이 프레임워크는 기존의 LLM 에이전트(예: ReAct, Reflexion)와 호환되며, 태스크 간에 플러그인 방식의 보완으로 적용 가능하다.

실험 결과

연구 질문

  • RQ1유사 문제의 해법을 재사용하는 것이 다단계 복잡한 태스크에서 LLM의 추론 정확성과 강건성 향상에 기여하는가?
  • RQ2이전에 성공한 문제 해결에서의 유추적 추론이 LLM의 추론 체인에서 오류 누적을 어떻게 줄이는가?
  • RQ3Task-specific 프롬프팅 엔지니어링 없이도 Thought Propagation와 같은 일반 목적의 프레임워크가 다양한 추론 태스크에 얼마나 잘 일반화되는가?
  • RQ4성공적인 유사 문제 해결에서의 통찰을 통합하면 LLM 에이전트 환경에서 더 나은 계획 수립과 높은 태스크 완료율 달성에 기여하는가?
  • RQ5반복적 실험 메커니즘을 공유하는 반면, Thought Propagation는 반사 기반 방법(예: Reflexion)과 비교해 어떻게 다를까?

주요 결과

  • Shortest-path Reasoning 태스크에서 TP는 기준 모델 대비 최적 해법을 찾는 데서 12%p의 절대적 성능 향상을 달성했다.
  • 창의적 글쓰기 태스크에서 TP는 기준 모델 대비 인간 선호도 점수를 13% 향상시켜 더 높은 품질과 더 나은 일관성을 보였다.
  • ALFWorld 환경에서 LLM 에이전트 계획 태스크에서 TP는 ReAct 및 Reflexion과 같은 강력한 기준 모델 대비 태스크 완료율을 15% 향상시켰다.
  • 실패 기록을 저장하는 메모리 모듈이 없더라도(예: TP-SE/TP-SM), TP는 파rameterized 및 프롬프팅 기반 기준 모델을 모두 능가했으며, 긍정적 유추 전이의 가치를 입증했다.
  • TP-SR-SE 및 TP-SR-SM와 같은 변형에서 Self-Reflection(SR)을 추가함으로써 성능 향상이 더욱 뚜렷해졌으며, 실패에 대한 반사와 유추적 통찰 재사용 간의 상호보완적 상호작용을 보여주었다.
  • 그림 6은 6회의 시행에서 일관된 성능 향상을 보이며, 이 프레임워크의 신뢰성과 반복적 개선 잠재력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.