Skip to main content
QUICK REVIEW

[논문 리뷰] DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models

Zhengfu He, Tianxiang Sun|arXiv (Cornell University)|2022. 11. 28.
Topic Modeling인용 수 13
한 줄 요약

DiffusionBERT는 사전 훈련된 BERT와 이산 확산 모델을 공통된 노이즈 제거 목적을 활용하여 결합하는 새로운 생성형 마스킹 언어 모델을 제안한다. 비마르코프성이고 토큰 인식 기반의 노이즈 스케줄(스퍼링 슈두일)과 시간에 민감하지 않은 디코딩을 도입하여, 이전의 확산 모델 및 자동회귀 모델에 비해 더 빠른 수렴 속도와 향상된 퍼플렉서티 및 BLEU 점수를 달성하며 무조건적 텍스트 생성에서 최고 성능을 기록한다.

ABSTRACT

We present DiffusionBERT, a new generative masked language model based on discrete diffusion models. Diffusion models and many pre-trained language models have a shared training objective, i.e., denoising, making it possible to combine the two powerful models and enjoy the best of both worlds. On the one hand, diffusion models offer a promising training strategy that helps improve the generation quality. On the other hand, pre-trained denoising language models (e.g., BERT) can be used as a good initialization that accelerates convergence. We explore training BERT to learn the reverse process of a discrete diffusion process with an absorbing state and elucidate several designs to improve it. First, we propose a new noise schedule for the forward diffusion process that controls the degree of noise added at each step based on the information of each token. Second, we investigate several designs of incorporating the time step into BERT. Experiments on unconditional text generation demonstrate that DiffusionBERT achieves significant improvement over existing diffusion models for text (e.g., D3PM and Diffusion-LM) and previous generative masked language models in terms of perplexity and BLEU score.

연구 동기 및 목표

  • 사전 훈련된 노이즈 제거 언어 모델(예: BERT)과 확산 모델 간의 격차를 해소하기 위해 그들의 공통된 노이즈 제거 목적을 활용함으로써 텍스트 생성을 위한 확산 모델로의 전환을 목표로 한다.
  • BERT로 초기화하고 역방향 과정을 적응시킴으로써 이산 확산 모델의 텍스트 생성 품질과 훈련 효율성을 향상시키는 것을 목표로 한다.
  • 이미지 및 오디오 분야에서 성공한 바에도 불구하고 여전히 미비한 분야인 이산 텍스트 데이터에 대한 확산 모델 적용의 과제를 해결하는 것을 목표로 한다.
  • 이전 단계뿐 아니라 원본 청소년 시퀀스까지 조건부로 설정된 비마르코프성 확산 과정을 탐색함으로써 노이즈 제거 과정에서 더 나은 정보 흐름을 가능하게 한다.
  • 비자기회적 텍스트 생성에서 생성 품질, 수렴 속도, 추론 효율성 간의 트레이드오프를 최적화하는 것을 목표로 한다.

제안 방법

  • 훈련 코퍼스 내에서 각 토큰의 빈도에 따라 고유한 노이즈 수준을 할당하는 '스퍼링 슈두일'이라고 불리는 새로운 노이즈 스케줄을 제안하여 확산 과정 전반에 걸쳐 손상된 정보의 균일한 분포를 보장한다.
  • 이전에 손상된 시퀀스뿐 아니라 원본 청소년 시퀀스 $\mathbf{x}_0$까지도 고려하는 비마르코프성 전방 확산 과정을 도입함으로써 노이즈 제거에 더 풍부한 맥락을 제공한다.
  • BERT를 역방향 노이즈 제거 네트워크 $p_\theta(\mathbf{x}_{t-1}|\mathbf{x}_t, t)$로 적응시켜 사전 훈련된 토큰 재구성 능력을 활용한다.
  • 시간 단계 $t$ 를 BERT에 통합하는 데 다수의 전략을 검토한 결과, 시간 정보를 제거하는 것(시간에 민감하지 않은 디코딩)이 가장 우수한 성능을 내는 것으로 밝혀졌다.
  • 역방향 과정에서 $x_0$-파arameterization을 활용하여 역방향 단계 수를 조정함으로써 다양한 추론 속도 제어가 가능하도록 한다.
  • 확산 경로 전반에 걸쳐 재구성 손실을 최소화하는 변동하한 경계(ELBO) 목적함수를 사용하여 모델을 종합적으로 훈련한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 노이즈 제거 언어 모델(예: BERT)이 텍스트 생성을 위한 이산 확산 모델의 핵심으로 효과적으로 재사용될 수 있는가?
  • RQ2톆켄 특화 노이즈 스케줄(스퍼링 슈두일)이 이산 확산 모델의 텍스트 생성 품질과 안정성에 어떤 영향을 미치는가?
  • RQ3이전 단계 $\mathbf{x}_{t-1}$ 뿐 아니라 원본 시퀀스 $\mathbf{x}_0$까지 조건부로 설정한 비마르코프성 과정이 표준 마르코프성 확산에 비해 생성 품질을 향상시키는가?
  • RQ4BERT 기반 노이즈 제거 모델에 시간 단계 정보를 통합하는 최적의 방법은 무엇인가?
  • RQ5BERT와 확산 모델의 조합이 기존의 비자기회적 또는 자동회귀 모델에 비해 더 나은 품질-효율성 트레이드오프를 달성할 수 있는가?

주요 결과

  • DiffusionBERT는 기존의 확산 기반 텍스트 모델(D3PM 및 Diffusion-LM)에 비해 무조건적 텍스트 생성 벤치마크에서 훨씬 낮은 퍼플렉서티와 더 높은 BLEU 점수를 기록한다.
  • D3PM보다 훨씬 더 빠른 수렴 속도를 보이며, 훈련 예산의 30%만(0.5백만 단계)으로도 유사한 성능에 도달한다.
  • 시간에 민감하지 않은 디코딩(TAD)은 추론 중 시간 단계를 무시하는 방식으로, 시간 조건부 변형들보다 더 뛰어난 생성 품질을 제공한다.
  • 스퍼링 노이즈 스케줄은 시퀀스 전반에 걸쳐 더 균일한 손상 분포를 제공하며, 역방향 과정의 모든 단계에서 의미 있는 텍스트 재구성 능력을 향상시킨다.
  • DiffusionBERT는 비자기회적 생성에서 품질-분산 트레이드오프를 뛰어나게 개선하여 퍼플렉서티와 디코딩 효율성 양면에서 BERT-Mouth를 능가한다.
  • 제어 가능한 역방향 단계 수를 통해 DiffusionBERT는 경쟁 가능한 생성 속도를 유지하면서도 최고 수준의 성능을 달성하며, 뛀난 효율성-품질 균형을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.