Skip to main content
QUICK REVIEW

[논문 리뷰] Generalizable Chain-of-Thought Prompting in Mixed-task Scenarios with Large Language Models

Anni Zou, Zhuosheng Zhang|arXiv (Cornell University)|2023. 10. 10.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 입력 질문 유형이 알려져 있지 않은 혼합 작업 시나리오를 위한 일반화 가능한 체인 오브 토의 프롬프팅 프레임워크인 GeM-CoT을 제안한다. 이는 동적으로 업데이트되는 풀에서 유형 분류 및 다양성 기반의 예시 검색 또는 구축을 통해 작동하며, 33개의 추론 작업(공개 데이터셋 10개 및 BBH 작업 23개 포함)에서 최고 성능을 기록하고 강력한 일반화 능력을 보인다.

ABSTRACT

Large language models (LLMs) have unveiled remarkable reasoning capabilities by exploiting chain-of-thought (CoT) prompting, which generates intermediate reasoning chains to serve as the rationale for deriving the answer. However, current CoT methods either simply employ general prompts such as Let's think step by step, or heavily rely on pre-defined task-specific demonstrations to attain preferable performances, thereby engendering an inescapable gap between performance and generalization. To bridge this gap, we propose GeM-CoT, a Generalizable CoT prompting mechanism in Mixed-task scenarios where the type of input questions is unknown. GeM-CoT first categorizes the question type and subsequently samples or constructs demonstrations from the corresponding data pool in an automatic pattern. With this technical design, GeM-CoT simultaneously enjoys superior generalization capabilities and remarkable performances on 10 public reasoning tasks and 23 BBH tasks.

연구 동기 및 목표

  • 질문 유형이 알려져 있고 동적으로 혼합되는 실제 혼합 작업 시나리오에서 체인 오브 토의 프롬프팅의 성능-일반화 격차를 해결한다.
  • 작업별 특화된 예시나 수동 레이블링에 의존하지 않고도 높은 성능을 유지할 수 있는 프롬프팅 메커니즘을 개발한다.
  • 장기적인 적응성을 위해 자동으로 확장 가능하고 비용이 들지 않는 예시 검색 및 구축을 가능하게 한다.
  • 자기 업데이트 가능한 프레임워크를 통해 제로샷 일반화와 피셔샷 성능 사이의 상충 관계를 해소한다.
  • 산술, 공통 지식, 기호 추론을 포함한 다양한 추론 작업에서의 강건성과 일반화 능력을 입증한다.

제안 방법

  • 사전에 구축된 예시 풀과의 의미적 유사도 매칭을 통해 입력 질문을 작업 유형으로 분류한다.
  • 성공적으로 매칭된 질문의 경우, 해당 작업 유형에 맞는 다양한 고품질 예시를 해당 작업 전용 데이터 풀에서 검색한다.
  • 매칭되지 않은 질문의 경우 제로샷 추론을 수행하고, 입력-질문-답변 트리플을 데이터 캐시에 저장한다.
  • 캐시에 그룹화된 질문들에 밀도 기반 클러스터링을 적용하여 품질 기준을 충족하는 클러스터를 식별한다.
  • 각 자격을 갖춘 클러스터에서 다양하고 작업에 관련된 예시를 자동으로 구축하고, 향후 사용을 위해 예시 풀에 추가한다.
  • 지속적으로 예시 풀과 캐시를 업데이트하여 장기적인 적응성과 시간이 지남에 따라 향상되는 일반화 능력을 확보한다.
Figure 1: Comparison of conventional single-task scenarios and our concerned setting: mixed-task scenarios . There are three major characteristics of mixed-task scenarios: (i) the type of any incoming question is unknown; (ii) the input data comes from a set of mixed tasks; (iii) the questions come
Figure 1: Comparison of conventional single-task scenarios and our concerned setting: mixed-task scenarios . There are three major characteristics of mixed-task scenarios: (i) the type of any incoming question is unknown; (ii) the input data comes from a set of mixed tasks; (iii) the questions come

실험 결과

연구 질문

  • RQ1체인 오브 토의 프롬프팅 메커니즘이 질문 유형이 알려져 있지 않은 혼합 작업 시나리오에서 높은 성능을 유지하면서도 강력한 일반화 능력을 보일 수 있는가?
  • RQ2소수 예시 CoT 프롬프팅에서 다양성 기반 예시 선택 전략이 유사도 기반 또는 무작위 샘플링에 비해 얼마나 효과적인가?
  • RQ3의미적 유사도 기반 유형 매칭이 API 비용이나 프롬프트 엔지니어링 없이도 LLM 기반 분류기보다 비용, 정확도, 일반화 능력 측면에서 뛰어나게 성능을 내는가?
  • RQ4다양한 추론 작업에서 정밀도와 재현율을 최적화하기 위해 유형 매칭 모듈에서 어떤 임계값을 설정할 수 있는가?
  • RQ5클러스터링된 데이터에서 자동으로 예시를 구축하는 것이 제로샷 및 소수 예시 설정 모두에서 성능과 일반화 능력을 향상시키는가?

주요 결과

  • GeM-CoT은 10개의 공개 추론 벤치마크에서 최고 성능을 기록했으며, AddSub에서는 93.7%의 정확도, Coin에서는 100%의 정확도를 달성했다.
  • 유사도 기반 및 무작위 선택 전략보다 성능이 뛰어나며, AQuA에서는 51.9%의 정확도, Strategy에서는 63.5%의 정확도를 기록했다.
  • 의미적 유사도 기반 유형 매칭 모듈은 API 비용이나 프롬프트 엔지니어링 없이도 LLM 기반 분류기와 유사한 성능을 달성했다.
  • 유형 매칭 모듈에서 임계값으로 0.35를 사용할 경우 분석 대상 1,200개의 테스트 질문을 대상으로 모든 작업에서 최적의 F1 및 정확도를 확보했다.
  • GeM-CoT은 강력한 일반화 능력을 보이며, 배치 2부터 성능이 점차 향상되어 더 많은 데이터가 축적될수록 점차 적응력이 향상됨을 보였다.
  • 이 방법은 성능과 일반화를 통합하여 23개의 BBH 작업에서 높은 정확도를 달성하면서도 개방형, 혼합 작업 환경에서 넓은 적용 가능성을 확보했다.
Figure 2: Overview of our proposed GeM-CoT mechanism. GeM-CoT first routes the input question to different paths ( Type Matching ): i) path matched $\rightarrow$ : For a successful match, it fetches demonstrations from the demo pool ( Demo Acquisition ) and performs a final inference ( Answer Deriva
Figure 2: Overview of our proposed GeM-CoT mechanism. GeM-CoT first routes the input question to different paths ( Type Matching ): i) path matched $\rightarrow$ : For a successful match, it fetches demonstrations from the demo pool ( Demo Acquisition ) and performs a final inference ( Answer Deriva

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.