Skip to main content
QUICK REVIEW

[논문 리뷰] Let's Learn Step by Step: Enhancing In-Context Learning Ability with Curriculum Learning

Yinpeng Liu, Jiawei Liu|arXiv (Cornell University)|2024. 02. 16.
Online and Blended Learning인용 수 4
한 줄 요약

이 논문은 간소한 예시에서 복잡한 예시로의 순서로 시범 예제를 정렬함으로써 소수의 예제를 사용한 컨텍스트 내 학습 성능을 향상시키는 In-Context Curriculum Learning (ICCL)를 제안한다. 이 방법은 지시 테이닝을 통해 컨텍스트 내 학습에서의 순서 기반 능력을 개발함으로써, 특히 작은 모델에서 과학적 추론 과제에서 뚜렷한 성능 향상을 보이며, 인간이 설계한 순서가 LLM이 자가 생성한 순서보다 우수하다.

ABSTRACT

Demonstration ordering, which is an important strategy for in-context learning (ICL), can significantly affects the performance of large language models (LLMs). However, most of the current approaches of ordering require high computational costs to introduce the priori knowledge. In this paper, inspired by the human learning process, we propose a simple but effective demonstration ordering method for ICL, named the few-shot In-Context Curriculum Learning (ICCL). The ICCL implies gradually increasing the complexity of prompt demonstrations during the inference process. The difficulty can be assessed by human experts or LLMs-driven metrics, such as perplexity. Then we design extensive experiments to discuss the effectiveness of the ICCL at both corpus-level and instance-level. Moreover, we also investigate the formation mechanism of LLM's ICCL capability. Experimental results demonstrate that ICCL, developed during the instruction-tuning stage, is effective for representative open-source LLMs. To facilitate further research and applications by other scholars, we make the code publicly available.

연구 동기 및 목표

  • 증가하는 난이도 순서로 컨텍스트 내 시범 예제를 정렬함으로써 소수의 예제를 사용한 컨텍스트 내 학습 성능 향상 여부를 조사하는 것.
  • LLM이 컨텍스트 기반 시범 예제 순서에 유의미하게 기여할 수 있는 능력을 언제, 어떻게 습득하는지 규명하는 것.
  • 컨텍스트 내 학습에서 인간이 설계한 순서와 LLM이 생성한 순서 간의 효과성을 평가하는 것.
  • 재학습 없이 추론 단계에서 직접 컨텍스트 기반 학습을 적용하는 것이 가능한지 탐색하는 것.

제안 방법

  • 복잡도가 낮은 예제에서 높은 예제로의 순서로 정렬함으로써 컨텍스트 내 학습 성능을 향상시키는 시범 예제 순서 전략인 In-Context Curriculum Learning (ICCL)를 제안한다.
  • 사용자 전문가 또는 LLM을 '정렬기'로 활용하여 난이도를 판단하고, 이를 기반으로 컨텍스트 기반 학습을 위한 순서 계획을 수립한다.
  • 동일한 모델 파라미터를 유지하면서, 순서가 바뀐 시범 예제를 추론 프롬프트의 컨텍스트로 적용한다.
  • 과학적 추론 데이터셋(SciCite, SciNLI)을 대상으로 베이스 모델과 지시 테이닝된 LLM을 대상으로 실험하여 ICCL과 기준 컨텍스트 내 학습(ICL) 간 성능을 비교한다.
  • LLM이 자가로 효과적인 순서 계획을 생성할 수 있는지 평가하기 위해 프롬프트를 설계하고, 인간이 설계한 순서와의 성능을 비교한다.
  • F1 점수를 측정하고, 무작위 순서 및 표준 ICL 대비 성능 향상 또는 감소를 분석한다.

실험 결과

연구 질문

  • RQ1증가하는 난이도 순서로 컨텍스트 내 시범 예제를 정렬함(즉, ICCL)하는 것이 LLM의 소수의 예제를 사용한 컨텍스트 내 학습 성능을 향상시키는가?
  • RQ2모델이 컨텍스트 기반 시범 예제 순서에 기여할 수 있는 능력을 습득하는 시점은 사전학습 단계인지, 지시 테이닝 단계인지?
  • RQ3인간이 설계한 순서 계획과 LLM이 생성한 순서 계획 간의 성능는 어떻게 비교되는가?
  • RQ4GPT-4와 같은 고성능 모델에서 ICCL가 제한되거나 부정적인 영향을 미치는 이유는 무엇인가?

주요 결과

  • ICCL는 지시 테이닝된 오픈소스 LLM에서 성능을 크게 향상시키며, Mixtral 8x7B의 경우 SciNLI에서 평균 F1 점수 5.62% 향상되었다.
  • 지시 테이닝된 Llama 2 70B는 ICCL를 사용할 경우 F1 점수에서 5.62% 향상되었지만, 베이스 모델의 경우 4.12% 감소하여, ICCL 능력은 지시 테이닝 단계에서 유도된다는 것을 시사한다.
  • 인간이 설계한 순서 계획이 LLM이 생성한 순서 계획보다 뛰어나며, 후자는 무작위 순서 대비 평균 0.29% 성능 감소를 보였다.
  • GPT-4에서는 ICCL가 효과적이지 않으며, 평균 F1 점수에서 2.56% 감소를 보여, 고성능 모델은 시범 예제 순서에 덜 민감할 수 있음을 시사한다.
  • 베이스 모델의 경우 ICCL 적용으로 인해 성능이 불안정해지며, 표준 ICL 대비 평균 F1 점수 7.16% 감소를 보여, 지시 테이닝 없이선 컨텍스트 기반 순서에 본질적인 민감성이 없음을 나타낸다.
  • 본 연구는 인간 전문가가 ICCL에서 핵심적인 역할을 하며, 모델의 파라미터 활용도를 극대화하는 지식 기반의 효과적인 순서 계획을 제공한다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.