[논문 리뷰] Amortizing intractable inference in large language models
이 논문은 생성형 플로우 네트워크(GFlowNets)를 사용해 대규모 언어 모델(LLMs)를 피지컬 퍼포먼스로 미세조정하여 비가역적 사후분포에서 효율적이고 다양한 샘플링을 가능하게 하는 암시적 베이지안 추론을 제안한다. 이는 체인오스틸드 추론 및 제약 조건이 있는 생성과 같은 과제에 필요로 하는 분포를 다루는 데 유용하다. 이 방법은 데이터 효율성과 샘플 다양성 면에서 지도 미세조정 및 PPO를 능가하며, 50개의 시드 추론 과정을 사용할 경우 내분포 정수 산술 과제에서 95.2%의 정확도를 달성한다.
Autoregressive large language models (LLMs) compress knowledge from their training data through next-token conditional distributions. This limits tractable querying of this knowledge to start-to-end autoregressive sampling. However, many tasks of interest -- including sequence continuation, infilling, and other forms of constrained generation -- involve sampling from intractable posterior distributions. We address this limitation by using amortized Bayesian inference to sample from these intractable posteriors. Such amortization is algorithmically achieved by fine-tuning LLMs via diversity-seeking reinforcement learning algorithms: generative flow networks (GFlowNets). We empirically demonstrate that this distribution-matching paradigm of LLM fine-tuning can serve as an effective alternative to maximum-likelihood training and reward-maximizing policy optimization. As an important application, we interpret chain-of-thought reasoning as a latent variable modeling problem and demonstrate that our approach enables data-efficient adaptation of LLMs to tasks that require multi-step rationalization and tool use.
연구 동기 및 목표
- 자기회귀적 LLM의 자기회귀적 샘플링을 초월해 지식을 효율적으로 쿼리할 수 있는 방법의 한계를 해결하기 위해.
- 시퀀스 계속 이어가기, 인페일링, 제약 조건이 있는 생성과 같은 과제에서 비가역적 사후분포에서 효율적이고 다양한 샘플링을 가능하게 하기 위해.
- 기본적인 미세조정 및 강화학습과 비교해 소수의 예시를 통한 추론 및 도구 사용 적응에서 데이터 효율성과 샘플 다양성을 향상시키기 위해.
- 체인오스틸드 추론을 암시적 베이지안 추론에 적합한 잠재변수 모델링 문제로 재정의하기 위해.
제안 방법
- 생성형 플로우 네트워크(GFlowNets)를 사용해 사전학습된 LLM을 미세조정하며, 이는 보상 함수 비례 확률로 객체를 샘플링하는 정책을 훈련하는 다각도를 추구하는 강화학습 알고리즘이다.
- 훈련 중 시퀀스 평가를 위해 LLM 자체의 가능도를 보상 함수로 사용하여 자기지도 보상 모델링을 가능하게 한다.
- GFlowNet 정책을 사전학습된 LLM으로 초기화하고, 입력, 추론 과정, 출력의 결합 확률을 일치시키는 보상 목표를 통해 계속해서 훈련한다.
- 특히 저데이터 환경에서 탐색과 초기 정책 품질 향상을 위해 시드 추론 과정의 버퍼를 활용한다.
- 훈련 안정성 향상과 수렴 개선을 위해 온도 스케줄링과 커리큘럼 학습을 적용한다.
- 샘플 다양성과 보상 최대화를 위해 최적화된 초모수를 사용해 LoRA를 활용해 효율적인 미세조정을 수행한다.

실험 결과
연구 질문
- RQ1GFlowNet 미세조정을 통한 암시적 추론은 LLM에서 비가역적 사후분포에서 효과적이고 다양한 샘플링을 가능하게 할 수 있는가?
- RQ2GFlowNet 미세조정은 추론 과제에서 데이터 효율성과 샘플 다양성 면에서 지도 미세조정 및 PPO와 비교해 어떻게 성능을 냈는가?
- RQ3GFlowNet 미세조정은 제한된 감독 하에 산술 추론을 위한 유효하고 올바른 추론 과정을 효과적으로 학습할 수 있는가?
- RQ4추론 과정의 시드 버퍼 사용이 저데이터 소수 예시 추론 시나리오에서 성능을 크게 향상시키는가?
- RQ5GFlowNet 미세조정은 PPO 기반 정책 학습에서 흔히 발생하는 모드 붕괴 및 과최적화 문제를 줄일 수 있는가?
주요 결과
- 50개의 시드 추론 과정을 사용할 경우, GFlowNet 미세조정은 내분포 정수 산술 과제에서 테스트 정확도 95.2%를 달성했으며, 이는 제로샷 프롬프팅 및 기준 미세조정보다 뚜렷이 뛰어난 성능을 보였다.
- 50개의 시드 추론 과정을 사용할 경우, 외분포(OOD) 산술 문제에서 75.4%의 정확도를 기록하여 훈련 분포를 초월한 강력한 일반화 능력을 입증했다.
- 이 방법은 PPO가 종종 반복되거나 유효하지 않은 시퀀스를 생성하는 것과는 달리, 유효하고 단계별로 정확한 표현을 평가하는 추론 과정을 생성했다.
- 더 많은 시드 추론 과정을 사용할수록 성능이 단조롭게 향상되었으며, 0개의 시드 예시일 경우 뿐만 아니라 22.6%의 정확도에 머물러 있어 탐색을 위한 초기 지도의 중요성을 강조했다.
- PPO 모델은 높은 보상이지만 유효하지 않은 추론 과정(예: 표현 반복)을 생성한 반면, GFlowNets는 정확하고 다양한 추론 체인을 생성하여 모드 붕괴가 감소한 것으로 나타났다.
- 제거 실험을 통해 시드 추론 과정이 성능에 매우 중요한 역할을 한다는 점을 확인했으며, 이는 사전 지식 없이 탐색이 매우 어렵다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.