Skip to main content
QUICK REVIEW

[논문 리뷰] MoDS: Model-oriented Data Selection for Instruction Tuning

Qianlong Du, Chengqing Zong|arXiv (Cornell University)|2023. 11. 27.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 지시 테이닝을 위한 모델 기반 데이터 선택 프레임워크인 MoDS를 제안한다. MoDS는 품질, 포괄성, 필요성 기준을 통합하여 고품질, 다양하고 필수적인 지시 데이터를 선택한다. 품질 평가 모델, 포괄성을 극대화하기 위한 k-center 근사 알고리즘, 모델 성능 격차 기반의 필요성 평가 모델을 활용하여, 전체 214,000개 데이터셋을 사용한 미세조정보다 우수한 성능을 보이는 4,000개의 지시 쌍만을 선택한다.

ABSTRACT

Instruction tuning has become the de facto method to equip large language models (LLMs) with the ability of following user instructions. Usually, hundreds of thousands or millions of instruction-following pairs are employed to fine-tune the foundation LLMs. Recently, some studies show that a small number of high-quality instruction data is enough. However, how to select appropriate instruction data for a given LLM is still an open problem. To address this problem, in this paper we present a model-oriented data selection (MoDS) approach, which selects instruction data based on a new criteria considering three aspects: quality, coverage and necessity. First, our approach utilizes a quality evaluation model to filter out the high-quality subset from the original instruction dataset, and then designs an algorithm to further select from the high-quality subset a seed instruction dataset with good coverage. The seed dataset is applied to fine-tune the foundation LLM to obtain an initial instruction-following LLM. Finally, we develop a necessity evaluation model to find out the instruction data which are performed badly in the initial instruction-following LLM and consider them necessary instructions to further improve the LLMs. In this way, we can get a small high-quality, broad-coverage and high-necessity subset from the original instruction datasets. Experimental results show that, the model fine-tuned with 4,000 instruction pairs selected by our approach could perform better than the model fine-tuned with the full original dataset which includes 214k instruction data.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)의 미세조정을 위한 최적의 지시 데이터를 선택하는 데 있어 열려 있는 문제를 해결하기 위해.
  • 데이터 품질과 다양성 외에도 대상 LLM의 특정 능력 격차를 고려한 데이터 선택 방법을 개발하기 위해.
  • 지시 데이터의 거대한 데이터셋에 의존하는 것을 줄이고, 지시 수행 쌍의 최소이면서도 높은 영향력을 가진 부분집합을 식별하기 위해.
  • 더 적은 수의 전략적으로 선택된 데이터 포인트로도 지시 수행 성능을 향상시키기 위해.

제안 방법

  • 모든 (지시, 입력, 출력) 삼중조를 품질 평가 모델이 평가하여 고품질 예시를 걸러낸다.
  • 고품질 데이터에서 다양성을 확보하기 위해 k-center 근사 알고리즘을 사용하여 포괄성을 극대화하는 부분집합을 선택한다.
  • 선택된 시드 데이터셋을 사용해 대상 LLM을 미세조정하여 초기 지시 수행 모델을 생성한다.
  • 미세조정된 모델이 낮은 성능을 보이는 지시를 식별하기 위해 필요성 평가 모델을 활용한다. 이는 능력 격차를 나타낸다.
  • 고품질 데이터에서 모델의 추론 결과를 분석하여 성능이 떨어지는 지시를 탐지하고, 이를 증강 데이터로 수집한다.
  • 최종 데이터셋은 시드 데이터와 증강 데이터를 결합하여, 고품질, 광범위한 포괄성, 높은 필요성을 갖춘 부분집합을 형성한다.

실험 결과

연구 질문

  • RQ1품질, 포괄성, 필요성 기준을 통합한 모델 기반 데이터 선택 전략이 기존의 데이터 선택 방법보다 지시 테이닝에서 뛰어난 성능을 보일 수 있는가?
  • RQ2전체 데이터셋 미세조정과 비교해도, 작고 철저히 선택된 지시 데이터의 소량 집합으로도 더 뛰어난 지시 수행 성능을 달성할 수 있는가?
  • RQ3모델 성능 격차를 기반으로 선택된 필요성 인식 데이터의 포함 여부가 최종 모델의 지시 수행 능력에 어떤 영향을 미치는가?
  • RQ4미세조정된 LLM의 능력 격차를 효과적으로 보완하기 위해 필요한 증강 데이터의 최적 크기는 얼마인가?

주요 결과

  • MoDS가 4,000개의 지시 쌍을 선택해 미세조정한 모델이 전체 214,000개 지시 데이터셋을 사용한 미세조정 모델보다 뛰어난 성능을 보였다.
  • k-center 근사 알고리즘이 무작위 샘플링보다 성능을 크게 향상시켜, 다양하고 포괄적인 데이터를 효과적으로 선택한다는 점을 입증했다.
  • 모델 성능 격차 기반으로 선택된 증강 데이터의 포함은 시드 데이터셋만을 사용한 경우에 비해 상당한 성능 향상을 이끌어냈다.
  • 3,000개의 증강 데이터 포인트를 사용했을 때 MoDS 모델의 승리 점수는 1.0을 초월하여 전체 데이터셋 기준보다 뛰어난 성능을 보였다.
  • 증강 데이터셋 크기가 3,000개에 도달할 경우 성능 향상이 정체되며, 이 이상으로는 수익 감소 현상이 나타남을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.