Skip to main content
QUICK REVIEW

[논문 리뷰] Stay on topic with Classifier-Free Guidance

Guillaume Sanchez, Honglu Fan|arXiv (Cornell University)|2023. 06. 30.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 자동회귀 언어 모델에 대한 추론 시 기법으로 분류기 없는 가이던스(Classifier-Free Guidance, CFG)를 소개하며, 지시에 대한 부합도, 일관성, 사실 일관성 등 다양한 작업에서 지시 가중치 $\gamma$ 를 증가시킬수록 성능 향상이 이루어짐을 입증한다. LLaMA-7B를 사용하여 LAMBADA에서 최신 기술 수준(SOTA) 성능을 달성하였으며, PaLM-540B를 능가하였고, 계산 비용과 데이터 비용을 절감하면서도 크기가 두 배인 모델의 성능을 재현할 수 있도록 한다.

ABSTRACT

Classifier-Free Guidance (CFG) has recently emerged in text-to-image generation as a lightweight technique to encourage prompt-adherence in generations. In this work, we demonstrate that CFG can be used broadly as an inference-time technique in pure language modeling. We show that CFG (1) improves the performance of Pythia, GPT-2 and LLaMA-family models across an array of tasks: Q\&A, reasoning, code generation, and machine translation, achieving SOTA on LAMBADA with LLaMA-7B over PaLM-540B; (2) brings improvements equivalent to a model with twice the parameter-count; (3) can stack alongside other inference-time methods like Chain-of-Thought and Self-Consistency, yielding further improvements in difficult tasks; (4) can be used to increase the faithfulness and coherence of assistants in challenging form-driven and content-driven prompts: in a human evaluation we show a 75\% preference for GPT4All using CFG over baseline.

연구 동기 및 목표

  • 분류기 없는 가이던스(CFG)가 피팅 트레이닝 없이 순수 언어 모델링에서 정렬(alignment)과 성능 향상에 기여할 수 있는지 조사하기.
  • 제로샷, 체인 오브 톰, 장문 생성, 챗봇 스타일의 프롬프트와 같은 다양한 프롬프팅 패러다임에서 CFG의 효과성 평가하기.
  • CFG가 모델 크기의 두 배에 해당하는 성능을 달성할 수 있는지 확인하기.
  • Chain-of-Thought 및 Self-Consistency와 같은 다른 추론 시 기법과의 호환성 평가하기.
  • 복잡한 형식 기반 및 콘텐츠 중심의 어시스턴트 상호작용에서 CFG 가이드된 생성 결과에 대한 인간 선호도 평가하기.

제안 방법

  • 텍스트에서 이미지로의 디퓨전 모델에서의 CFG를 자동회귀 언어 모델에 적용하기 위해, 모델의 자체 로짓을 암시적 분류기로 사용한다.
  • 디코딩 중에 지시 가중치 $\gamma$ 를 적용하여 로짓을 스케일링함으로써 지시 관련 토큰에 대한 주의를 증가시킨다.
  • 프롬프트의 특정 측면에 집중할 수 있도록 음성 프롬프트(negative prompt)를 도입하여 세밀한 제어를 가능하게 한다.
  • CFG를 디코딩 중에 적용하기 위해 로짓 분포를 다음과 같이 수정한다: $\text{logits}_{\text{guided}}} = \text{logits} + \gamma \cdot (\text{logits} - \text{logits}_{\text{uncond}})$, 여기서 $\text{logits}_{\text{uncond}}$ 는 프롬프트 없이 모델이 출력한 결과이다.
  • LAMBADA, GSM8K, HumanEval, MMLU 및 기계 번역 작업을 포함한 여러 벤치마크에서 CFG 평가하기.
  • 특히 어시스턴트 스타일 및 복잡한 프롬프트 시나리오에서 CFG 가이드된 생성 결과와 일반 샘플링 간의 인간 평가 수행하기.
Figure 1: A notional 2D projection of a textual latent space showing how increasing the guidance weight $\gamma$ increases the importance of the prompt “Today in France,”.
Figure 1: A notional 2D projection of a textual latent space showing how increasing the guidance weight $\gamma$ increases the importance of the prompt “Today in France,”.

실험 결과

연구 질문

  • RQ1CFG는 피팅 트레이닝 없이도 자동회귀 언어 모델에서 지시 부합도와 생성 품질 향상에 기여할 수 있는가?
  • RQ2CFG는 제로샷, 체인 오브 톰, 복잡한 어시스턴트 스타일 프롬프트와 같은 다양한 프롬프팅 스타일에서 성능 향상에 기여하는가?
  • RQ3CFG는 모델 크기에 비해 어느 정도 성능 향상을 이룰 수 있는가 — 크기가 두 배인 모델의 성능을 달성할 수 있는가?
  • RQ4CFG는 Chain-of-Thought 및 Self-Consistency와 같은 다른 추론 시 기법과 어떻게 상호작용하는가?
  • RQ5CFG는 특히 형식 기반 및 콘텐츠 중심의 프롬프트에서 어시스턴트 스타일 생성의 인간 선호도와 일관성 향상에 기여하는가?

주요 결과

  • LLaMA-7B를 사용하여 LAMBADA 벤치마크에서 최신 기술 수준 성능 달성 — PaLM-540B를 능가함.
  • 질의응답, 추론, 코드 생성, 기계 번역 등 다양한 작업에서 CFG가 일관된 성능 향상을 보임.
  • 동일한 추론 비용에서 파라미터 수가 절반인 모델에 CFG를 적용하면 더 큰 무가이드 모델과 유사한 성능 달성 가능.
  • 어시스턴트 스타일 생성에서 인간 선호도 향상 — 75%의 평가자가 CFG를 적용한 GPT4All 출력을 일반 샘플링보다 선호함.
  • CFG는 토큰 샘플링 분포의 엔트로피를 감소시켜 더 집중적이고 일관성 있는 생성 결과 유도.
  • 시각화 결과 CFG가 지시 관련 단어에 대한 주의를 증가시킴을 확인 — 이는 설명 가능성을 제공하고 프롬프트 엔지니어링에 도움이 됨.
Figure 3: CFG impact on chain-of-thought prompting with respect to GSM8K dataset. For small CFG values, using CFG increases the percentage of chains which end in a valid answer structure while increasing the model accuracy. For large values the invalid percentage remains small but the accuracy drop.
Figure 3: CFG impact on chain-of-thought prompting with respect to GSM8K dataset. For small CFG values, using CFG increases the percentage of chains which end in a valid answer structure while increasing the model accuracy. For large values the invalid percentage remains small but the accuracy drop.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.