Skip to main content
QUICK REVIEW

[논문 리뷰] ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs

Justin Chih-Yao Chen, Swarnadeep Saha|arXiv (Cornell University)|2023. 09. 22.
Semantic Web and Ontologies인용 수 4
한 줄 요약

ReConcile는 다양한 LLM(예: ChatGPT, Bard, Claude2)가 반복적인 원탁 회의를 통해 공감대를 형성함으로써 추론 성능을 향상시키는 다중 모델, 다중 에이전트 프레임워크를 제안한다. 신뢰도 가중 투표와 설득력 있는 설명 생성을 결합함으로써 ReConcile은 추론 성능을 향상시키며, GPT-4의 정확도를 10.0% 향상시키고 주요 벤치마크에서 이전 기준보다 7.7% 높은 성능을 기록한다.

ABSTRACT

Large Language Models (LLMs) still struggle with natural language reasoning tasks. Motivated by the society of minds (Minsky, 1988), we propose ReConcile, a multi-model multi-agent framework designed as a round table conference among diverse LLM agents. ReConcile enhances collaborative reasoning between LLM agents via multiple rounds of discussion, learning to convince other agents to improve their answers, and employing a confidence-weighted voting mechanism that leads to a better consensus. In each round, ReConcile initiates discussion between agents via a 'discussion prompt' that consists of (a) grouped answers and explanations generated by each agent in the previous round, (b) their confidence scores, and (c) demonstrations of answer-rectifying human explanations, used for convincing other agents. Experiments on seven benchmarks demonstrate that ReConcile significantly improves LLMs' reasoning -- both individually and as a team -- surpassing prior single-agent and multi-agent baselines by up to 11.4% and even outperforming GPT-4 on three datasets. ReConcile also flexibly incorporates different combinations of agents, including API-based, open-source, and domain-specific models, leading to an 8% improvement on MATH. Finally, we analyze the individual components of ReConcile, demonstrating that the diversity originating from different models is critical to its superior performance. Code: https://github.com/dinobby/ReConcile

연구 동기 및 목표

  • 단일 모델 추론의 한계, 특히 자기 반성에서의 사고 분열과 다중 에이전트 논의에서의 모델 편향 문제를 해결하기 위해.
  • 다양한 모델 패밀리에서 온 LLM 에이전트들이 구조화된 논의를 통해 공감대를 형성하고 추론 능력을 함께 향상시킬 수 있는지 탐구하기 위해.
  • 다중 모델 다중 에이전트 추론 시스템에서 신뢰도 추정과 설득력 있는 설명 생성이 미치는 영향을 조사하기 위해.
  • 다양한 모델 간 협력적 논의가 기존의 논의 기반 접근 방식보다 더 빠르고 정확한 공감대 형성으로 이어지는지 입증하기 위해.

제안 방법

  • ReConcile은 다양한 추론 능력과 지식 기반을 확보하기 위해 서로 다른 LLM(예: ChatGPT, Bard, Claude2)를 에이전트로 사용하는 다중 모델 다중 에이전트 설정을 채택한다.
  • 각 토론 라운드는 이전 답변, 불확실성 추정치, 인간이 애너테이션한 수정 설명을 포함한 구조화된 '토론 프롬프트'를 통해 시작되며, 설득을 유도한다.
  • 에이전트들은 다른 이들의 통찰을 바탕으로 자신의 답변을 수정하여 오류를 수정하거나 정확한 답변에 대한 자신감을 강화한다.
  • 최종 예측은 각 에이전트의 신뢰도 점수가 공감대 형성에서의 투표 권한에 영향을 주는 신뢰도 가중 투표 메커니즘을 통해 집계된다.
  • 프레임워크는 반복적인 개선이 가능하도록 다수의 토론 라운드를 지원하며, 공감대 도달 또는 최대 라운드 수에 도달할 때까지 진행된다.
  • 이 방법은 공통 지식 및 수학적 추론 벤치마크를 조합하여 평가되며, 단일 에이전트 및 다중 에이전트 기준과의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1다양한 모델 패밀리에서 온 LLM 에이전트들이 구조화된 논의를 통해 공동으로 추론 성능을 향상시킬 수 있는가?
  • RQ2신뢰도 추정과 설득력 있는 설명 생성을 통합할 경우, 기존의 논의 또는 자기 개선 방법보다 더 빠르고 정확한 공감대 형성이 이루어지는가?
  • RQ3GPT-4와 같은 고성능 모델이 다른 다양한 모델들과 함께 ReConcile 토론에 참여할 경우, 자신의 추론 능력을 얼마나 향상시킬 수 있는가?
  • RQ4수렴 속도와 최종 정확도 측면에서 ReConcile의 공감대 형성 메커니즘은 다중 에이전트 논의 기준보다 어떻게 비교되는가?

주요 결과

  • ReConcile은 다양한 벤치마크에서 추론 성능을 크게 향상시켜, 이전의 단일 에이전트 및 다중 에이전트 기준보다 평균 7.7% 높은 성능을 기록한다.
  • GPT-4가 ReConcile의 에이전트 중 하나로 참여할 경우, 다른 모델들의 토론과 피드백을 통해 초반 정확도가 10.0%p 상승한다.
  • 각 토론 라운드 이후 관찰된 정확도 향상으로 볼 때, ReConcile은 다중 에이전트 논의 기준 대비 더 빠르고 더 나은 공감대 형성을 달성한다.
  • 다양한 모델의 강점을 결합하고, 신뢰도 가중 투표 및 설득력 있는 피드백을 통합할 경우 더 견고하고 정확한 추론 결과를 도출할 수 있음을 입증한다.
  • ReConcile은 몇몇 벤치마크에서 GPT-4를 뛰어넘으며, 다양한 모델 간 협력적 추론이 심지어 가장 고성능 단일 모델의 성능을 초월할 수 있음을 시사한다.
  • 프레임워크는 후행적 신뢰도 추정과 API 기반 모델에 의존하는 점이 제한점이지만, 이러한 제약에도 불구하고 결과는 여전히 강력하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.