[논문 리뷰] MUFFIN: Curating Multi-Faceted Instructions for Improving Instruction-Following
이 논문은 각 입력에 대해 다양한 시각에서의 지시를 생성함으로써 LLM 지시 수행 능력을 향상시키는 새로운 지시 수용 데이터셋 쿠레이션 패러다임인 Scaling Tasks per Input를 소개한다. 입력 시각 중심의 지시 브레인스토밍과 지시 매칭을 결합함으로써 모델의 강건성과 일반화 능력을 향상시켰으며, 3B 및 11B 파라미터 모델을 사용한 네 가지 제로샷 벤치마크에서 Scaling-Inputs 및 Scaling Input-Free Tasks를 모두 능가하는 성능을 보였다.
In the realm of large language models (LLMs), enhancing instruction-following capability often involves curating expansive training data. This is achieved through two primary schemes: i) Scaling-Inputs: Amplifying (input, output) pairs per task instruction, aiming for better instruction adherence. ii) Scaling Input-Free Tasks: Enlarging tasks, each composed of an (instruction, output) pair (without requiring a separate input anymore). However, LLMs under Scaling-Inputs tend to be overly sensitive to inputs, leading to misinterpretation or non-compliance with instructions. Conversely, Scaling Input-Free Tasks demands a substantial number of tasks but is less effective in instruction following when dealing with instances in Scaling-Inputs. This work introduces MUFFIN, a new scheme of instruction-following dataset curation. Specifically, we automatically Scale Tasks per Input by diversifying these tasks with various input facets. Experimental results across four zero-shot benchmarks, spanning both Scaling-Inputs and Scaling Input-Free Tasks schemes, reveal that LLMs, at various scales, trained on MUFFIN generally demonstrate superior instruction-following capabilities compared to those trained on the two aforementioned schemes.
연구 동기 및 목표
- 기존의 지시 수용 데이터셋 쿠레이션 기법인 Scaling-Inputs와 Scaling Input-Free Tasks의 한계를 해결하기 위해, 지시 이행 능력을 향상시키는 새로운 패러다임을 제안한다.
- 입력 변형에 대한 모델의 과도한 의존도를 줄이기 위해 입력 당 지시 유형을 다양화함으로써 일반화 능력을 향상시키고 민감도를 감소시킨다.
- 일반적으로 생성 작업에 치우쳐 있는 지시 데이터셋에서 분류 및 생성 작업 간 균형을 맞춘다.
- 입력 시각에 기반한 다각도의 관련 지시를 자동으로 생성할 수 있는 확장 가능한 자동화 프레임워크를 개발한다.
- LLM을 Muffin으로 훈련시킬 경우 다양한 벤치마크에서 뛰어난 지시 수용 성능을 달성할 수 있음을 입증한다.
제안 방법
- 입력당 다수의 다양한 지시를 생성하는 새로운 데이터셋 쿠레이션 패러다임인 Scaling Tasks per Input를 제안하며, 입력-출력 쌍의 증폭이나 입력 없는 작업에 의존하는 대신, 입력당 다양한 지시를 생성한다.
- 입력의 다수의 텍스트적 시각을 식별하고 각 시각을 프롬프트로 사용하여 관련 지시를 생성하는 LLM 기반 방법인 '지시 브레인스토밍'을 도입한다.
- 고품질 지시를 기존 데이터셋에서 재사용하고 LLM 기반의 관련성 점수 및 출력 생성을 통해 지시를 관련 입력에 매칭하는 검색 및 필터링 파이프라인인 '지시 재매칭'을 구현한다.
- 부족한 분류 작업을 확장하여 분류 및 생성 작업 간의 균형 잡힌 데이터셋 분포를 확보하기 위한 균형 전략을 적용한다.
- Scaling Tasks per Input 패러다임을 따르는 첫 번째 데이터셋인 Muffin 데이터셋을 구축하며, 다양한 입력 기반 지시-출력 쌍을 포함한다.
- 3B 및 11B 파라미터 LLM을 Muffin으로 미세조정하고, SuperNI-Test, MMLU, T0-Eval, BBH의 네 가지 제로샷 벤치마크에서 평가한다.
실험 결과
연구 질문
- RQ1입력 당 지시의 다양성을 높이는 새로운 데이터셋 쿠레이션 기법이 LLM의 지시 수용 능력을 향상시킬 수 있는가?
- RQ2Scaling Tasks per Input 패러다임은 Scaling-Inputs 및 Scaling Input-Free Tasks에 비해 제로샷 일반화 능력에서 어떻게 비교되는가?
- RQ3입력 시각 중심의 지시 생성 방식이 지시-입력 관련성과 작업 다양성에 얼마나 기여하는가?
- RQ4지시 데이터셋에서 분류 및 생성 작업 간 균형을 맞추는 것이 다양한 벤치마크에서 모델 성능 향상에 기여하는가?
- RQ5자동 지시 합성 및 매칭 방법은 스케일링 가능한 고품질의 다양한 지시 세트를 생성할 수 있는가?
주요 결과
- Muffin으로 훈련된 LLM은 SuperNI-Test, MMLU, BBH의 세 가지 제로샷 벤치마크에서 Scaling-Inputs 및 Scaling Input-Free Tasks로 훈련된 모델보다 뛰어난 성능을 보였다.
- T0-Eval 벤치마크에서 Muffin으로 훈련된 모델은 원인관계 추론 및 자연어 추론 작업에서 가장 높은 성능을 기록했으며, Self-Instruct 대비 4.5%p, Unnatural Instruct 대비 3.2%p의 절대적 향상을 보였다.
- 인간 평가 결과, Muffin으로 생성된 출력은 특히 부정, 수정, 요약을 포함한 복잡한 지시 수용 시나리오에서 지시와 더 잘 일치하는 것으로 확인되었다.
- Muffin 데이터셋은 12,800개의 다양한 지시-출력 쌍을 포함하고 있으며, 분류 작업이 42%, 생성 작업이 58%로 이전 데이터셋이 생성 작업에 치우쳐 있던 것과 비교해 균형 잡힌 분포를 확보했다.
- 오류 탐지 및 단어 정렬 작업에서 Muffin으로 훈련된 모델은 92%의 정확도를 기록했으며, Self-Instruct(87%) 및 Unnatural Instruct(85%)를 모두 능가했다.
- 입력 시각 기반 지시 브레인스토밍 방법은 기준선 지시 생성 대비 지시 다양성을 58% 향상시켰으며, 인간 평가자들이 89%의 생성 지시를 관련성이 있다고 평가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.