[논문 리뷰] Instruction Following without Instruction Tuning
이 논문은 언어 모델이 명시적 지시 튜닝을 통해가 아니라 암묵적 적응을 통해 강력한 지시 따라하기 능력을 발달시킬 수 있음을 보여준다. 예를 들어 응답 전용 튜닝이나 시중의 시와 같은 좁은 도메인에서의 단일 작업 미세조정 등이다. 놀랍게도, 확률 분포를 수정하는 단순한 규칙 기반 어댑터조차도 전체 지시 튜닝 수준의 지시 따라하기 성능을 낼 수 있으며, 이는 지시 따라하기 능력이 최소한의 비대상적인 분포 조정에서 유추된다는 것을 보여준다.
Instruction tuning commonly means finetuning a language model on instruction-response pairs. We discover two forms of adaptation (tuning) that are deficient compared to instruction tuning, yet still yield instruction following; we call this implicit instruction tuning. We first find that instruction-response pairs are not necessary: training solely on responses, without any corresponding instructions, yields instruction following. This suggests pretrained models have an instruction-response mapping which is revealed by teaching the model the desired distribution of responses. However, we then find it's not necessary to teach the desired distribution of responses: instruction-response training on narrow-domain data like poetry still leads to broad instruction-following behavior like recipe generation. In particular, when instructions are very different from those in the narrow finetuning domain, models' responses do not adhere to the style of the finetuning domain. To begin to explain implicit instruction tuning, we hypothesize that very simple changes to a language model's distribution yield instruction following. We support this by hand-writing a rule-based language model which yields instruction following in a product-of-experts with a pretrained model. The rules are to slowly increase the probability of ending the sequence, penalize repetition, and uniformly change 15 words' probabilities. In summary, adaptations made without being designed to yield instruction following can do so implicitly.
연구 동기 및 목표
- 언어 모델에서 지시 따라하기 능력이 명시적 지시 튜닝 없이도 유도될 수 있는지 조사하기.
- 지시 토큰이 전혀 없는 응답 전용 데이터로만 훈련하면 지시 따라하기 행동이 유도되는지 검토하기.
- 시와 같은 좁은 도메인 데이터로 미세조정하면 암묵적으로 다양한 지시 따라하기 작업에 대한 능력이 유도되는지 탐색하기.
- 언어 모델의 출력 확률 분포에 대한 단순한 규칙 기반 수정이 지시 따라하기를 유도할 수 있는지 평가하기.
- 지시 튜닝이 지시 따라하기 능력에 필수적이라는 가정을 도전하기.
제안 방법
- 응답 튜닝: LIMA 데이터셋에서 응답 전용 데이터로 언어 모델을 미세조정하며, 해당 지시 토큰은 전혀 포함하지 않음.
- 단일 작업 미세조정: 시와 같은 좁은 도메인 데이터로 훈련한 후, 다양한 지시 따라하기 벤치마크에서 평가함.
- 규칙 기반 어댑터: 규칙 기반 분포가 기본 모델의 출력 확률을 곱하기 정규화 방식으로 수정하는 제품-오브-에이전트 모델을 구성함.
- 핵심 식: 최종 출력 확률 분포는 $ p_a(w\mid\mathbf{x}) = p_{\text{base}}(w\mid\mathbf{x}) p_{\text{rules}}(w\mid\mathbf{x}) / Z(\mathbf{x}) $ 로 정의되며, 기본 분포와 규칙 기반 분포를 조합함.
- 규칙에는 다음이 포함됨: (1) 응답 길이에 비례해 EOS 토큰의 확률을 선형으로 증가시키기, (2) 15개의 핵심 단어(예: 'I', 'We', '<', 'Should')의 확률을 균일하게 조정하기, (3) 이전에 생성된 토큰의 반복을 방지하기 위해 페널티 적용하기.
- AlpacaEval 2 승리율을 통해 지시 튜닝된 LIMA 모델과 비교 평가하며, 규칙 기여도를 분리하기 위한 아블레이션 실험 수행함.
실험 결과
연구 질문
- RQ1지시 토큰이 전혀 없는 응답 전용 데이터로만 훈련했을 때 언어 모델에서 지시 따라하기가 유도될 수 있는가?
- RQ2시와 같은 좁은 도메인에서 미세조정하면, 요리 조리법 생성과 같은 분포 외 작업에서도 지시 따라하기 능력이 암묵적으로 유도되는가?
- RQ3학습이나 튜닝 없이도 단순한 수작업 규칙 기반 어댑터가 지시 따라하기 행동을 유도할 수 있는가?
- RQ4언어 모델의 출력 확률 분포에 어떤 변화가 가해져야 지시 따라하기가 가능해지는가?
- RQ5암묵적 적응이 명시적 지시 튜닝의 능력을 어느 정도 재현할 수 있는가?
주요 결과
- 지시 토큰 없이 응답 전용 데이터로만 훈련한 결과, AlpacaEval 2에서 지시 튜닝된 모델과 비교해 43%의 승리율을 기록했으며, 동등한 성능을 내는 데 필요한 50% 기준에 근접함.
- 시 데이터로만 단일 작업 미세조정을 수행한 결과, 지시가 시와 관련이 없더라도 요리 조리법 생성과 같은 다양한 작업에서 지시 따라하기 행동을 보였음.
- 세 가지 단순한 규칙(EOs 가중치, 균일한 토큰 확률 조정, 반복 페널티)을 가진 규칙 기반 어댑터가 지시 튜닝된 LIMA 모델과 비교해 24.4%의 승리율을 기록함.
- 아블레이션 실험 결과, 세 가지 규칙 각각이 성능 향상에 크게 기여했으며, 개별 규칙 제거 시 승리율이 17% 이하로 떨어짐.
- 미세조정 이전에도 사전 학습된 모델이 정답 응답을 무작위 응답보다 높게 평가하는 비율이 지시 튜닝된 모델과 유사하게 나타나, 튜닝 이전에도 암묵적인 지시-응답 매핑이 존재할 가능성이 있음.
- 심지어 최소한의 비대상적인 분포 조정—예를 들어 15개 단어의 확률를 수정하거나 반복을 방지하는 것—조차도 상당한 수준의 지시 따라하기 행동을 유도할 수 있음.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.