Skip to main content
QUICK REVIEW

[논문 리뷰] Cappy: Outperforming and Boosting Large Multi-Task LMs with a Small Scorer

Bowen Tan, Yun Zhu|arXiv (Cornell University)|2023. 11. 12.
Topic Modeling인용 수 4
한 줄 요약

Cappy는 360M 파라미터를 가진 사전 훈련된 스코어러로, 지시어에 대한 후보 응답을 평가함으로써 대규모 다중 작업 언어 모델(LLM)의 성능을 향상시킵니다. 파라미터 미세조정 없이도 성능 향상을 이룹니다. 11개의 분류 과제에서 훨씬 더 큰 LLM보다 뛰어난 성능을 보이며, FLAN-T5의 45개의 복잡한 BIG-Bench 과제에서 효율적이고 파라미터 효율적인 응답 선택을 통해 성능 향상을 이룹니다.

ABSTRACT

Large language models (LLMs) such as T0, FLAN, and OPT-IML, excel in multi-tasking under a unified instruction-following paradigm, where they also exhibit remarkable generalization abilities to unseen tasks. Despite their impressive performance, these LLMs, with sizes ranging from several billion to hundreds of billions of parameters, demand substantial computational resources, making their training and inference expensive and inefficient. Furthermore, adapting these models to downstream applications, particularly complex tasks, is often unfeasible due to the extensive hardware requirements for finetuning, even when utilizing parameter-efficient approaches such as prompt tuning. Additionally, the most powerful multi-task LLMs, such as OPT-IML-175B and FLAN-PaLM-540B, are not publicly accessible, severely limiting their customization potential. To address these challenges, we introduce a pretrained small scorer, Cappy, designed to enhance the performance and efficiency of multi-task LLMs. With merely 360 million parameters, Cappy functions either independently on classification tasks or serve as an auxiliary component for LLMs, boosting their performance. Moreover, Cappy enables efficiently integrating downstream supervision without requiring LLM finetuning nor the access to their parameters. Our experiments demonstrate that, when working independently on 11 language understanding tasks from PromptSource, Cappy outperforms LLMs that are several orders of magnitude larger. Besides, on 45 complex tasks from BIG-Bench, Cappy boosts the performance of the advanced multi-task LLM, FLAN-T5, by a large margin. Furthermore, Cappy is flexible to cooperate with other LLM adaptations, including finetuning and in-context learning, offering additional performance enhancement.

연구 동기 및 목표

  • 하위 작업을 위한 대규모 다중 작업 LLM의 높은 계산 비용과 비효율적인 미세조정 문제를 해결하기 위해.
  • 파라미터에 접근할 수 없는 강력한 그러나 접근 불가능한 LLM(예: OPT-IML-175B, FLAN-PaLM-540B)의 성능 향상을 위해 파라미터를 수정하지 않고도 가능하게 하기 위해.
  • 독립적으로나 LLM과 함께 사용할 수 있는 경량적이고 효율적이며 유연한 구성 요소를 개발하기 위해.
  • LLM이 생성한 정확성 스코어를 사용하여 회귀 스타일 훈련을 위한 약한 지도 학습 기반의 사전 훈련 데이터 구성 방법을 개발하기 위해.

제안 방법

  • Cappy는 주어진 (지시어, 응답) 쌍에 대해 정확성 스코어(0~1)를 예측하도록 훈련된 360M 파라미터의 RoBERTa 기반 모델입니다.
  • 약한 지도 학습 기반의 데이터 구성 파이프라인을 사용합니다: 기존의 다중 작업 LLM이 응답을 생성하고, Rouge-L 스코어를 약한 지도 학습으로 사용하여 회귀 레이블을 생성합니다.
  • 사전 훈련 데이터는 기존 LLM을 사용한 데이터 증강을 통해 구성되며, 사전 훈련 데이터셋에서 다양한 (지시어, 응답, 스코어) 삼중항을 생성합니다.
  • Cappy는 후보 선택 파ragm을 사용합니다: 주어진 지시어에 대해 여러 후보 응답을 평가하고 가장 높은 스코어를 가진 응답을 선택합니다.
  • 분류 과제용으로 독립적으로 사용하거나, 파라미터 미세조정 없이 LLM의 성능 향상에 보조 구성 요소로 사용할 수 있습니다.
  • 기존의 적응 기법(예: 컨텍스트 내 학습 및 미세조정)과도 호환되어 추가적인 성능 향상을 가능하게 합니다.

실험 결과

연구 질문

  • RQ1작고 가벼운 스코어러가 파라미터 수가 훨씬 많은 다중 작업 LLM보다 제로샷 분류 과제에서 뛰어난 성능을 낼 수 있는가?
  • RQ2작은 스코어러가 파라미터 업데이트 없이도 복잡하고 새로운 과제에서 대규모 다중 작업 LLM의 성능을 효과적으로 향상시킬 수 있는가?
  • RQ3LLM이 생성한 응답과 Rouge-L 스코어를 활용한 약한 지도 학습이 고성능 정확성 스코어러를 훈련하는 데 얼마나 효과적인가?
  • RQ4이 스코어러는 컨텍스트 내 학습이나 미세조정과 같은 다른 LLM 적응 전략과 얼마나 잘 통합될 수 있는가?

주요 결과

  • Cappy는 PromptSource의 11개 언어 이해 과제에서 더 큰 다중 작업 LLM보다 높은 정확도를 달성했으며, 파라미터 수가 수 개의 주기수만큼 작다는 점에서 뛰어난 성능을 보였습니다.
  • BIG-Bench의 45개의 복잡한 과제에서 Cappy는 FLAN-T5의 성능을 뚜렷이 향상시켰으며, LLM의 어떤 미세조정도 필요로 하지 않았습니다.
  • 절단 실험 결과, 지속적인 사전 훈련과 LLM 기반 데이터 증강이 Cappy의 성능에 필수적이며, 특히 데이터 증강이 더 큰 영향을 미쳤습니다.
  • Cappy는 컨텍스트 내 학습 및 미세조정과 같은 다른 적응 방법과 결합되었을 때 성능 향상을 보이며, 호환성과 확장성을 입증했습니다.
  • Rouge-L을 약한 지도 학습 지표로 사용하는 것은 효과적이지만 완벽하지 않으며, 향후 연구에서는 다중 작업 환경에 더 적합한 정확성 지표 탐색이 필요할 수 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.