Skip to main content
QUICK REVIEW

[논문 리뷰] Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate

Kai Xiong, Xiao Ding|arXiv (Cornell University)|2023. 05. 19.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 공통된 추론 과제에서 협업하는 대규모 언어 모델(Large Language Models, LLMs) 간의 상호 일관성(inter-consistency)을 연구하기 위한 공식적 논의 프레임워크인 FORD를 소개한다. 세 단계의 논의—공정한 논의, 능력이 맞지 않는 논의, 원탁 회의—를 통해 LLMs는 상호 일관성의 결여에도 불구하고 공감대를 이끌어내지만, 능력이 균형을 이루지 못할 경우 성능이 저하된다. GPT-4를 심판으로 사용할 경우 성과가 약간 향상되며, 이는 협업 LLM 시스템에서 권위 있는 감시의 역할을 강조한다.

ABSTRACT

Large Language Models (LLMs) have shown impressive capabilities in various applications, but they still face various inconsistency issues. Existing works primarily focus on the inconsistency issues within a single LLM, while we complementarily explore the inter-consistency among multiple LLMs for collaboration. To examine whether LLMs can collaborate effectively to achieve a consensus for a shared goal, we focus on commonsense reasoning, and introduce a formal debate framework (FORD) to conduct a three-stage debate among LLMs with real-world scenarios alignment: fair debate, mismatched debate, and roundtable debate. Through extensive experiments on various datasets, LLMs can effectively collaborate to reach a consensus despite noticeable inter-inconsistencies, but imbalances in their abilities can lead to domination by superior LLMs. Leveraging a more advanced LLM like GPT-4 as an authoritative judge can boost collaboration performance. Our work contributes to understanding the inter-consistency among LLMs and lays the foundation for developing future collaboration methods. Codes and data are available at https://github.com/Waste-Wood/FORD

연구 동기 및 목표

  • 협업 추론 과정에서 다수의 LLM 간 상호 일관성을 조사함으로써 기존의 단일 모델 자가 일관성 연구를 보완한다.
  • 실제 적용 가능한 상황에서 LLM 협업의 체계적이고 정량적인 분석이 가능한 체계적인 논의 프레임워크(FORD)를 설계한다.
  • 다양한 능력을 지닌 LLM이 논의 과정에서 어떻게 상호작용하며, 공통된 신뢰할 수 있는 결론에 도달할 수 있는지 평가한다.
  • 더 고급 LLM(GPT-4)이 논의 요약 및 최종 공감대 형성에 기여함으로써 협업 성과에 미치는 영향을 평가한다.

제안 방법

  • 세 단계 논의 프레임워크를 제안: 공정한 논의(유사한 LLM), 능력이 맞지 않는 논의(다른 LLM 능력), 원탁 논의(여러 LLM 참가).
  • 다중 선택 공통 추론 데이터셋(예: CSQA, PIQA, StrategyQA)을 사용하여 상호 일관성과 협업 성과를 정량화한다.
  • LLM이 번갈아가며 주장, 반론, 잠재적 타협안을 제시하는 공식화된 논의 절차를 적용한다.
  • LLM 예측 간 상호 일관성을 정량적으로 측정하기 위해 INCON 지표를 도입한다.
  • GPT-4를 심판으로 활용하여 논의를 요약하고 최종 결론을 부여함으로써 공감대의 신뢰성을 향상시킨다.
  • 합의가 이루어지지 않을 경우 투표 기반 메커니즘을 적용하며, 최종 답변은 다수결 기반으로 도출한다.
Figure 1: (a) compromise and (b) refutation in LLMs debates. is the proponent, and is the opponent.
Figure 1: (a) compromise and (b) refutation in LLMs debates. is the proponent, and is the opponent.

실험 결과

연구 질문

  • RQ1다양한 LLM이 본질적인 상호 일관성 결여에도 불구하고 체계적인 논의를 통해 어느 정도 공감대를 이룰 수 있는가?
  • RQ2LLM 간 능력 격차가 논의의 동적 흐름과 최종 공감대 품질에 어떤 영향을 미치는가?
  • RQ3더 고급 LLM(GPT-4 등)이 협업 성과 향상에 효과적인 심판 역할을 할 수 있는가?
  • RQ4다른 LLM 아키텍처(예: 채팅 기반 vs. 텍스트 완성 기반)는 논의 환경에서 협업 추론 능력에서 어떻게 비교되는가?
  • RQ5원탁 논의에서 논의 순서 또는 참가자 수가 최종 결과에 유의미한 영향을 미치는가?

주요 결과

  • 동일한 기본 모델에서 유래한 다양한 LLM 유형 간에도 높은 상호 일관성 결여가 나타나며, 이는 추론 행동의 본질적 변동성을 시사한다.
  • GPT-3.5 시리즈와 같은 동일한 LLM 시리즈 내에서도 신규 버전이 이전 버전을 완전히 대체하지 못하며, 이는 이전 모델이 일부 추론 능력을 유지하고 있음을 의미한다.
  • 유사한 능력을 지닌 LLM은 효과적으로 협업하여 공감대를 이끌어내며 공통 추론 과제에서 높은 성능을 달성한다.
  • 능력이 맞지 않는 논의에서는 우월한 LLM이 지배적이며 자신의 견해를 바꾸지 않으며, 약한 모델는 더 자주 타협에 동의함으로써 전체 성능 저하를 초래할 수 있다.
  • GPT-4를 심판으로 활용할 경우 협업 성과가 다소 향상되며, 데이터셋 평균 정확도가 80.05%에서 80.23%로 상승한다.
  • 원탁 논의에서는 특정 LLM이 항상 결과에 영향을 미치는 경향이 나타나며, 이는 다중 에이전트 협업 환경에서의 구조적 편향을 시사한다.
Figure 2: The overall workflow of FORD on two LLMs. Step 1 : LLMs independently give a choice and explanation for each sample as the stance and argument, respectively. Step 2 : LLMs debate alternately on the inconsistent samples. Step 3 : A judge summarizes the whole debate process and gives the fin
Figure 2: The overall workflow of FORD on two LLMs. Step 1 : LLMs independently give a choice and explanation for each sample as the stance and argument, respectively. Step 2 : LLMs debate alternately on the inconsistent samples. Step 3 : A judge summarizes the whole debate process and gives the fin

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.