[논문 리뷰] Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor
이 논문은 자연어 지시와 해당 입력/출력을 자동으로 생성한 240,670개의 예제를 포함하는 Unnatural Instructions 데이터셋을 소개한다. 이 데이터셋은 단지 15개의 시드 예제만을 사용해 언어 모델을 통해 생성되었으며, 노이즈가 포함되어 있음에도 불구하고, 이 데이터로 11B T5 모델을 피지컬 튜닝하면 T0++ 및 Tk-Instruct와 같은 수동으로 코딩된 데이터셋을 사용해 훈련한 모델들을 초월하는 성능을 보이며, 모델에 의해 생성된 데이터가 인간이 작성한 데이터와 동등하거나 그 이상의 품질과 다양성을 확보할 수 있음을 입증한다. 이는 노동 비용을 극도로 줄일 수 있음을 의미한다.
Instruction tuning enables pretrained language models to perform new tasks from inference-time natural language descriptions. These approaches rely on vast amounts of human supervision in the form of crowdsourced datasets or user interactions. In this work, we introduce Unnatural Instructions: a large dataset of creative and diverse instructions, collected with virtually no human labor. We collect 64,000 examples by prompting a language model with three seed examples of instructions and eliciting a fourth. This set is then expanded by prompting the model to rephrase each instruction, creating a total of approximately 240,000 examples of instructions, inputs, and outputs. Experiments show that despite containing a fair amount of noise, training on Unnatural Instructions rivals the effectiveness of training on open-source manually-curated datasets, surpassing the performance of models such as T0++ and Tk-Instruct across various benchmarks. These results demonstrate the potential of model-generated data as a cost-effective alternative to crowdsourcing for dataset expansion and diversification.
연구 동기 및 목표
- 다양하고 고품질의 지시 튜닝 데이터셋을 만드는 데 있어 확장 가능하고 노동 비용이 낮은 방법을 개발하는 것.
- 언어 모델에 의해 생성된 데이터가 수동으로 코딩된 지시 튜닝 데이터셋과 동등하거나 그 이상의 성능을 낼 수 있는지 조사하는 것.
- 일반적인 지시 튜닝을 위해 인간의 감독 없이 모델에 의해 생성된 지시를 사용할 수 있는지 가능성 탐색하는 것.
- 데이터의 다양성과 창의성이 표준 벤치마크 외의 분포를 벗어난 작업에서의 최종 모델 일반화에 미치는 영향 평가하는 것.
제안 방법
- 저자는 Super-Natural Instructions의 세 개의 시드 예제를 사용해 프롬프트를 제공한 사전학습된 언어 모델을 활용하여 64,000개의 지시-입력-출력 삼중항을 생성한다. 이 과정은 다섯 개의 다른 시드 세트를 사용하여 수행된다.
- 두 단계 생성 프로세스를 적용한다: 먼저 지시와 입력을 생성한 후, 정확도를 극대화하기 위해 결정론적으로 출력을 생성한다.
- 다양성을 향상시키기 위해 동일한 모델을 사용해 각 지시를 다듬어 표현 방식만 변경하면서도 입력과 출력의 내용은 유지한다.
- 반복적인 다듬림을 통해 데이터셋을 약 240,000개의 예제로 확장하며, 인간의 참여는 최소한으로 유지된다.
- 성능 평가는 Unnatural Instructions로 11B T5 모델을 피지컬 튜닝한 후, T0++ 및 Tk-Instruct로 훈련한 모델들과 여러 벤치마크에서 비교하여 평가한다.
- 제거 분석에서는 일괄 생성(통합) 방식과 두 단계 생성(분리) 방식을 비교하여, 결정론적 출력 생성 방식이 성능 향상에 기여하는 것으로 나타났다.
실험 결과
연구 질문
- RQ1언어 모델이 인간의 노동을 최소한으로 사용해 다양하고 고품질의 지시 튜닝 데이터셋을 생성할 수 있는가?
- RQ2수동으로 코딩된 지시 튜닝 데이터셋을 사용해 훈련한 것과 비교해 모델에 의해 생성된 데이터로 훈련하면 최종 성능에서 우월한가?
- RQ3모델에 의해 생성된 지시의 다양성과 창의성은 인간이 작성한 데이터와 비교해 어떻게 되는가?
- RQ4생성 전략(예: 일괄 vs. 두 단계)이 모델 성능에 어떤 영향을 미치는가?
- RQ5모델에 의해 생성된 데이터는 표준 벤치마크에 포함되지 않은 분포를 벗어난 작업으로의 일반화를 향상시킬 수 있는가?
주요 결과
- Unnatural Instructions로 11B T5 모델을 피지컬 튜닝하면, 기준 모델 대비 BIG-bench Hard 벤치마크에서 18점의 성능 향상을 기록한다.
- Unnatural Instructions로 훈련한 모델은 LMentry 벤치마크에서 16점의 성능 향상을 기록하여 비표준 NLP 작업으로의 일반화 능력이 뛰어나다는 것을 시사한다.
- 노이즈가 포함되어 있음에도 불구하고, 생성된 예제의 50% 이상이 정확하며, 잘못된 예제들조차도 지시 튜닝에 유용한 정보를 포함하고 있는 경우가 많다.
- 두 단계 생성 프로세스(입력과 출력을 별도로 생성)는 일괄 통합 생성 방식보다 Super-Natural Instructions 검증 세트에서 1.7점 높은 성능을 기록한다.
- Unnatural Instructions는 Super-Natural Instructions보다 훨씬 높은 작업 및 표현 다양성을 보이며, 창의적이고 비표준적인 NLP 작업을 포함하고 있다.
- 성능는 데이터셋 크기와 로그-선형적으로 증가하므로, 모델에 의해 생성된 데이터의 스케일을 더 늘리면 추가적인 성능 향상이 가능할 것으로 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.