[논문 리뷰] Bayesian Flow Networks
베이지안 플로우 네트워크(BFNs)는 반복적인 베이지안 추론을 통해 사전 분포를 갱신하고, 이를 신경망을 통해 상호의존적인 출력 분포로 변환하는 새로운 생성 모델링 프레임워크를 제안한다. 이 방법은 1.41 비트/문자로 텍스트8 문자 수준 언어 모델링 작업에서 최고 성능을 기록하며, 기존의 모든 이산 확산 모델을 능가한다. 또한 이산 도메인에서 기울기 기반 샘플 가이던스가 가능하다.
This paper introduces Bayesian Flow Networks (BFNs), a new class of generative model in which the parameters of a set of independent distributions are modified with Bayesian inference in the light of noisy data samples, then passed as input to a neural network that outputs a second, interdependent distribution. Starting from a simple prior and iteratively updating the two distributions yields a generative procedure similar to the reverse process of diffusion models; however it is conceptually simpler in that no forward process is required. Discrete and continuous-time loss functions are derived for continuous, discretised and discrete data, along with sample generation procedures. Notably, the network inputs for discrete data lie on the probability simplex, and are therefore natively differentiable, paving the way for gradient-based sample guidance and few-step generation in discrete domains such as language modelling. The loss function directly optimises data compression and places no restrictions on the network architecture. In our experiments BFNs achieve competitive log-likelihoods for image modelling on dynamically binarized MNIST and CIFAR-10, and outperform all known discrete diffusion models on the text8 character-level language modelling task.
연구 동기 및 목표
- 자연어와 같은 이산 데이터 도메인에서 엔드 투 엔드 기울기 기반 학습과 기울기 기반 샘플 가이던스를 가능하게 하는 생성 모델링 프레임워크를 개발하는 것.
- 이산 데이터로 인해 이산적인 노이즈 전이가 발생하는 문제를 야기하는 기존 이산 확산 모델의 한계를 극복하기 위해 연속적이고 플로우 유사한 프로세스를 도입하는 것.
- 손실 함수를 직접적으로 압축 효율성 최적화하도록 유도함으로써 데이터 압축과 생성 모델링 원리를 통합하는 것.
- 확률 단체 위에서 연속적인 갱신을 활용하여 이산 시퀀스에서 효율적이고 소수의 스텝으로 생성하는 것을 가능하게 하는 것.
- 이산(텍스트) 및 연속(이미지) 데이터 모두에서 경쟁적인 성능을 보이며, 언어 모델링에 중점을 두는 것.
제안 방법
- BFNs는 이중 단계 프로세스를 사용한다: 첫째, 노이즈가 섞인 데이터 샘플을 바탕으로 베이지안 추론이 사전 분포를 갱신하여 사후 분포를 생성한다; 둘째, 사후 분포의 매개변수는 신경망을 통과하여 상호의존적인 새로운 분포를 생성한다.
- 모델은 변분 추론 원리에서 유도된 연속시간 및 이산시간 손실 함수를 사용하며, 증거 하한값(ELBO)을 통한 데이터 압축 최적화를 목표로 한다.
- 이산 데이터의 경우, 네트워크 입력은 확률 단체 위에 위치하여 완전한 기울기 기반 성질과 기울기 기반 샘플 가이던스를 가능하게 하며, 이는 기존의 표준 이산 확산 모델에서는 실현 불가능하다.
- 네트워크 아키텍처는 매우 유연하며 제한되지 않으며, 본 논문은 언어 모델링 실험을 위해 24층의 딥 트랜스포머와 GELU 활성화 함수를 사용한다.
- 모델은 전방 확산 프로세스를 피하고, 대신 데이터 분포에 대한 모델의 믿음이 점진적으로 향상되는 반복적인 베이지안 갱신에 의존한다.
- 샘플 생성은 단순한 사전에서 시작하여 반복적으로 네트워크를 적용해 사후 분포를 갱신함으로써 수행된다.

실험 결과
연구 질문
- RQ1이산 데이터에 대해 기울기 기반 샘플 가이던스와 소수의 스텝으로 생성이 가능한 연속적이고 기울기 기반의 플로우 프로세스를 설계할 수 있는가?
- RQ2베이지안 추론 기반의 반복적 분포 개선이 언어 모델링에서 기존의 이산 확산 모델을 능가하는가?
- RQ3동일한 프레임워크를 연속적, 이산화된, 이산 데이터에 적용할 수 있으며, 통합된 손실 함수와 학습 절차를 사용할 수 있는가?
- RQ4변분 추론 원리에서 유도된 손실 함수가 다양한 데이터 유형에서 압축과 생성에 모두 효과적인가?
- RQ5전방 확산 프로세스가 필요 없이도 이미지 및 텍스트 벤치마크에서 경쟁적인 로그-가능도를 달성할 수 있는가?
주요 결과
- BFNs는 텍스트8 데이터셋에서 테스트 시 1.41 비트/문자(BPC)를 기록하여, 문헌에 보고된 모든 알려진 이산 확산 모델을 능가했다.
- 모델은 단 100개의 생성 스텝 내에 1.43 BPC를 달성하여 강력한 내구성과 소수의 추론 스텝 가능성에 대한 잠재력을 보였다.
- BFNs는 최고의 순서 무관 모델(MAC)의 1.40 BPC 성능을 재현하였으며, 다른 이산 확산 모델들(1.45~1.72 BPC)을 크게 능가했다.
- 다이나믹하게 이진화된 MNIST와 CIFAR-10에서도 경쟁적인 로그-가능도를 기록하여 이미지 데이터에서의 효과성을 입증했다.
- 확률 단체 입력의 사용은 완전한 기울기 기반 성질을 가능하게 하여, 이전의 이산 확산 모델에서 부재했던 이산 도메인 내 기울기 기반 샘플 가이던스를 실현했다.
- 학습 설정은 24층의 트랜스포머(1.7억 파라미터)를 사용하였으며, 모델은 과적합의 징후를 보였기에 정규화를 통해 성능 향상을 더욱 이룰 수 있을 것으로 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.