[논문 리뷰] RAIN: Your Language Models Can Align Themselves without Finetuning
RAIN은 파라미터 동 冻결된 대규모 언어 모델이 자기 평가와 되돌릴 수 있는 생성 과정을 통해 학습 또는 외부 데이터 없이도 인간의 선호도에 자가 정렬할 수 있도록 하는 새로운 추론 전용 방법이다. LLaMA 30B에 대해 피드백 없이도 HH 데이터셋에서 97%의 해로움 방지 성능을 달성하였고, 도움이 되는 성능 유지를 유지하면서 TruthfulQA에서 진실성 성능을 5% 향상시켰다.
Large language models (LLMs) often demonstrate inconsistencies with human preferences. Previous research typically gathered human preference data and then aligned the pre-trained models using reinforcement learning or instruction tuning, a.k.a. the finetuning step. In contrast, aligning frozen LLMs without requiring alignment data is more appealing. This work explores the potential of the latter setting. We discover that by integrating self-evaluation and rewind mechanisms, unaligned LLMs can directly produce responses consistent with human preferences via self-boosting. We introduce a novel inference method, Rewindable Auto-regressive INference (RAIN), that allows pre-trained LLMs to evaluate their own generation and use the evaluation results to guide rewind and generation for AI safety. Notably, RAIN operates without the need of extra data for model alignment and abstains from any training, gradient computation, or parameter updates. Experimental results evaluated by GPT-4 and humans demonstrate the effectiveness of RAIN: on the HH dataset, RAIN improves the harmlessness rate of LLaMA 30B from 82% of vanilla inference to 97%, while maintaining the helpfulness rate. On the TruthfulQA dataset, RAIN improves the truthfulness of the already-well-aligned LLaMA-2-chat 13B model by 5%.
연구 동기 및 목표
- 학습, 데이터 수집, 파라미터 업데이트 없이 대규모 언어 모델이 인간의 선호도에 정렬되도록 하는 것.
- 강화 학습 기반 정렬 방법(RLHF, DPO)이 요구하는 감독적 미세조정 및 보상 모델링에 의존하는 높은 비용과 비효율성을 해결하는 것.
- 동 冻결된 LLM이 추론 시기 메커니즘만으로도 자가 정렬이 가능한지 탐색하는 것.
- 모델 가중치를 수정하지 않고도 안전성과 진실성을 향상시키는 즉시 사용 가능한 추론 방법을 개발하는 것.
- 자기 평가와 제어 가능한 생성 후퇴가 무작위 샘플링 또는 단순한 기각 샘플링보다 우수한 성능을 낼 수 있는지 검증하는 것.
제안 방법
- RAIN은 자기 평가 기반으로 정방향 생성과 역방향 후퇴를 번갈아 수행하는 되돌릴 수 있는 자동 회귀 추론 기법을 도입한다.
- 모든 생성 단계 이후에 자기 평가 단계를 통합하여 모델이 내부 추론을 활용해 자신의 출력 품질을 평가한다.
- 자기 평가 결과에 따라 이전 토큰 상태로 후퇴하고, 히우리스틱 속성 업데이트에 따라 더 유망한 경로에서 재생성한다.
- 모델 자체의 평가 결과를 활용해 안전하고 도움이 되며 더 진실한 생성 결과로 유도하는 검색 과정을 운영하며, 무작위 샘플링을 피한다.
- 기울기 계산, 파라미터 업데이트, 외부 보상 모델 의존 없이 추론 시기 전적으로 작동한다.
- 모델 가중치를 수정하지 않고도 인간의 인지 행동과 유사하게 반성하고 평가하며 수정하는 방식을 모방한다.
실험 결과
연구 질문
- RQ1학습 또는 외부 정렬 데이터 없이도 동 冻결된 대규모 언어 모델이 인간의 선호도에 자가 정렬할 수 있는가?
- RQ2추론 시 자기 평가가 되돌릴 수 있는 생성 과정을 이끌어 안전성과 도움이 되는 성능을 향상시킬 수 있는가?
- RQ3무작위 기각 샘플링(예: 반복적 샘플링 및 선별)과 비교해 RAIN의 샘플 효율성과 성능은 어떠한가?
- RQ4잠재적인 오류가 존재하더라도 자기 평가 정확도가 정렬 성과 향상에 얼마나 기여할 수 있는가?
- RQ5재학습 없이도 RAIN이 LLaMA-2 70B와 같이 잘 정렬된 모델의 안전성과 진실성을 향상시킬 수 있는가?
주요 결과
- HH 데이터셋에서 RAIN은 LLaMA 30B의 해로움 방지율을 기존 방식(바닐라)의 82%에서 GPT-4 평가 기준 97%로 향상시켰고, 도움이 되는 성능은 유지하였다.
- 인간 평가 결과 RAIN의 효과성이 확인되었으며, 해로움 방지율은 바닐라 추론 대비 96.6%로 상승했다.
- TruthfulQA에서 RAIN은 잘 정렬된 LLaMA-2-chat 13B 모델의 진실성 성능을 모델 업데이트 없이도 5% 향상시켰다.
- 다양한 모델에서 해로움 탐지에 대한 자기 평가 정확도는 52%에서 98%까지 다양하게 나타났으며, 무작위 가능성(50%)을 크게 초월해 효과적인 가이드라인 제공이 가능했다.
- 500회 반복 샘플링 대비 RAIN은 LLaMA 30B에서 단지 4.36배의 시간 오버헤드로 훨씬 뛰어난 성능을 달성하여 샘플 효율성이 뛰어나다는 것을 입증했다.
- RAIN의 시간 오버헤드는 수용 가능하며 모델 크기가 증가함에 따라 감소하며, LLaMA-2 70B에서는 3.78배 증가에 그쳐 확장성이 뛰어나다는 것을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.