Skip to main content
QUICK REVIEW

[논문 리뷰] Making Large Language Models Better Reasoners with Alignment

Peiyi Wang, Lei Li|arXiv (Cornell University)|2023. 09. 05.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 평가 오정렬 문제(모델이 고품질 사고과정(COT) 응답을 저품질 응답보다 낮게 평가하는 문제)를 해결함으로써 대규모 언어모델의 추론 능력을 향상시키는 '정렬 미세조정(AFT)'을 소개한다. AFT는 고품질 COT에 높은 점수를 주되, 부정적 점수는 하한선으로 제한하여 성능 저하를 방지하는 새로운 제약 정렬 손실을 사용한다. 이는 추론 벤치마크 전반에서 성능을 크게 향상시키며, 다중 작업 및 외부 분포 설정에서도 효과적이다.

ABSTRACT

Reasoning is a cognitive process of using evidence to reach a sound conclusion. The reasoning capability is essential for large language models (LLMs) to serve as the brain of the artificial general intelligence agent. Recent studies reveal that fine-tuning LLMs on data with the chain of thought (COT) reasoning process can significantly enhance their reasoning capabilities. However, we find that the fine-tuned LLMs suffer from an extit{Assessment Misalignment} problem, i.e., they frequently assign higher scores to subpar COTs, leading to potential limitations in their reasoning abilities. To address this problem, we introduce an extit{Alignment Fine-Tuning (AFT)} paradigm, which involves three steps: 1) fine-tuning LLMs with COT training data; 2) generating multiple COT responses for each question, and categorizing them into positive and negative ones based on whether they achieve the correct answer; 3) calibrating the scores of positive and negative responses given by LLMs with a novel constraint alignment loss. Specifically, the constraint alignment loss has two objectives: a) Alignment, which guarantees that positive scores surpass negative scores to encourage answers with high-quality COTs; b) Constraint, which keeps the negative scores confined to a reasonable range to prevent the model degradation. Beyond just the binary positive and negative feedback, the constraint alignment loss can be seamlessly adapted to the ranking situations when ranking feedback is accessible. Furthermore, we also delve deeply into recent ranking-based alignment methods, such as DPO, RRHF, and PRO, and discover that the constraint, which has been overlooked by these approaches, is also crucial for their performance. Extensive experiments on four reasoning benchmarks with both binary and ranking feedback demonstrate the effectiveness of AFT.

연구 동기 및 목표

  • 기본 미세조정된 LLM에서 발생하는 평가 오정렬 문제를 특정하고 해결하는 것 — 즉, 모델이 고품질 COT과 저품질 COT을 구분하지 못하는 문제.
  • 사고과정 품질에 대한 모델 신뢰도를 재보정함으로써 추론 능력을 향상시키는 3단계 정렬 미세조정(AFT) 프레임워크를 제안하는 것.
  • 정렬 손실에 포함된 제약 항이 모델 성능 저하를 방지하고 성능 향상에 기여하는 데 핵심적이라는 것을 입증하는 것.
  • 제한된 점수 제약을 통합함으로써 AFT가 이진 피드백 및 순위 기반 피드백 기반 정렬 방법을 모두 향상시킬 수 있음을 보여주는 것.
  • AFT가 도메인 내, 다중 작업, 외부 분포 설정 등 다양한 추론 시나리오에서 효과적이라는 것을 검증하는 것.

제안 방법

  • 표준 최대우도 추정을 사용하여 COT 학습 데이터로 LLM을 미세조정한다.
  • 질문당 여러 개의 COT 응답을 생성하고, 정답인 경우를 양성(positive)으로, 오답인 경우를 음성(negative)으로 분류한다.
  • 양성 점수는 음성 점수를 초과하도록 강제하고(정렬), 음성 점수는 합리적인 하한선으로 제약하는(제약) 새로운 제약 정렬(CA) 손실을 적용한다.
  • CA 손실은 이진 피드백 및 순위 기반 피드백 설정에 모두 적응 가능하도록 설계되어 있어 더 넓은 적용 범위를 확보한다.
  • 경계 제약은 하한선을 조절하는 하이퍼파라미터 β를 사용하며, 점수의 구분 능력과 생성 능력 간의 균형을 맞춘다.
  • 이 방법은 고품질 COT가 더 높은 점수를 받기 때문에 선택 확률이 높아지는 자기일致성 추론(self-consistency inference)과도 호환된다.

실험 결과

연구 질문

  • RQ1기본 미세조정(VFT)은 저품질 COT에 대해 더 높은 점수를 매기는 평가 오정렬 문제를 야기하는가?
  • RQ2제약 인식 정렬 손실이 고품질과 저품질 COT을 더 잘 구분함으로써 LLM의 추론 능력을 향상시킬 수 있는가?
  • RQ3AFT는 추론 벤치마크에서 표준 VFT 및 DPO, RRHF, PRO와 같은 다른 정렬 방법과 비교해 어떻게 성능을 내는가?
  • RQ4AFT는 고품질 COT의 샘플링 가능성을 높여 자기일치성 성능을 향상시키는가?
  • RQ5AFT는 다중 작업 및 외부 분포 추론 시나리오에서 성능 향상에 기여하는가?

주요 결과

  • AFT는 네 가지 추론 벤치마크에서 성능을 크게 향상시키며, VFT 대비 GSM8K에서 최대 2.29% 향상되고 ECQA에서 2.10% 향상된다.
  • MMLU 벤치마크(제로샷, 외부 분포)에서 AFT는 VFT를 능가하며 일반화 및 전이 능력 향상이 확인된다.
  • AFT는 자기일치성 성능을 향상시킨다: 샘플링한 COT 경로 수가 증가할수록 AFT는 VFT보다 더 큰 성능 향상을 보이며, 고품질 추론 경로의 선택 능력이 뛰어나다는 것을 시사한다.
  • 제거 실험 결과, 경계 제약 항(β)이 핵심임을 입증한다 — 성능은 β ≈ 0.3 근처에서 최고로 나타나며, 너무 크거나 작은 값에서는 성능 저하가 발생함을 확인했으며, 이는 철저한 하이퍼파라미터 튜닝의 필요성을 강조한다.
  • DPO, RRHF, PRO와 같은 순위 기반 정렬 방법에서도 제약 항이 매우 중요하다. 이 제약 항이 생략될 경우 성능 저하가 발생한다.
  • AFT는 다중 작업 학습에서도 강력한 성능 유지를 보이며, 복합 데이터셋으로 학습할 경우 평가된 모든 테스트 세트에서 동시에 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.