Skip to main content
QUICK REVIEW

[논문 리뷰] Exposing the Implicit Energy Networks behind Masked Language Models via Metropolis--Hastings

Kartik Goyal, Chris Dyer|arXiv (Cornell University)|2021. 06. 04.
Topic Modeling인용 수 13
한 줄 요약

이 논문은 마스크된 언어 모델(Masked Language Models, MLMs)을 암시적 에너지 기반 모델로 해석함으로써, 고품질의 무조건적 및 조건부 텍스트 샘플을 추출하기 위한 메트로폴리스–해스팅스 샘플링 프레임워크를 제안한다. 사전에 학습된 MLMs로부터 두 가지 에너지 매개변수화를 유도하고, 그 마스크된 조건부 분포를 제안 분포로 사용함으로써, 이전의 무방향 생성 방법보다 기계 번역 및 개방형 생성 작업 모두에서 우수한 성능을 보이는 유효한 MCMC 샘플링을 가능하게 한다.

ABSTRACT

While recent work has shown that scores from models trained by the ubiquitous masked language modeling (MLM) objective effectively discriminate probable from improbable sequences, it is still an open question if these MLMs specify a principled probability distribution over the space of possible sequences. In this paper, we interpret MLMs as energy-based sequence models and propose two energy parametrizations derivable from the trained MLMs. In order to draw samples correctly from these models, we develop a tractable sampling scheme based on the Metropolis--Hastings Monte Carlo algorithm. In our approach, samples are proposed from the same masked conditionals used for training the masked language models, and they are accepted or rejected based on their energy values according to the target distribution. We validate the effectiveness of the proposed parametrizations by exploring the quality of samples drawn from these energy-based models for both open-ended unconditional generation and a conditional generation task of machine translation. We theoretically and empirically justify our sampling algorithm by showing that the masked conditionals on their own do not yield a Markov chain whose stationary distribution is that of our target distribution, and our approach generates higher quality samples than other recently proposed undirected generation approaches (Wang et al., 2019, Ghazvininejad et al., 2019).

연구 동기 및 목표

  • 마스크된 언어 모델(MLMs)을 암시적 에너지 기반 모델로 해석함으로써, 시퀀스에 대한 원칙적인 확률 해석을 수립한다.
  • 사전에 학습된 MLMs로부터 유도된 두 가지 에너지 매개변수화를 개발하여, 시퀀스에 점수를 할당함으로써 확률 모델링을 가능하게 한다.
  • 마스크된 조건부 분포를 제안 분포로 사용하는 메트로폴리스–해스팅스를 이용한 실현 가능한 샘플링 기법을 설계하여, 양방향 모델에서의 조상 및 지브스 샘플링의 한계를 극복한다.
  • 조건부(기계 번역) 및 무조건적 생성 설정 모두에서 이러한 에너지 모델에서 추출된 샘플의 품질을 경험적으로 검증한다.
  • 표준 목표로 훈련된 MLMs가 암묵적으로 전역 에너지 네트워크를 학습함으로써, MCMC를 통한 유효한 샘플링이 가능하다는 것을 보여준다.

제안 방법

  • 사전에 학습된 MLM의 은닉 표현에서 두 가지 에너지 매개변수화—원시 점수와 局소 정규화된 에너지—를 유도하며, 주의 점수 또는 로짓 출력을 에너지 점수로 사용한다.
  • MLM의 마스크된 조건부 분포를 메트로폴리스–해스팅스 MCMC 샘플러의 제안 분포로 사용하여, 목표 에너지 기반 분포에서의 샘플링을 가능하게 한다.
  • 마르코프 체인의 혼합 및 수렴 속도를 향상시키기 위해, 비연속적인 블록 치환 제안 메커니즘을 도입한다.
  • 온도 안내를 사용하여 에너지 분포의 모드 주변 영역을 탐색함으로써, 조건부 생성에서 모드 탐색을 촉진한다.
  • 기계 번역에서는 BLEU 점수를, 무조건적 생성에서는 인간 평가(일관성, 유창성)를 통해 샘플 품질을 검증한다.
  • 이론적 분석을 통해, 마스크된 조건부 분포를 사용한 난이도 있는 지브스 샘플링은 유효하지 않음을 보여주며, 이는 적절한 공동 분포에 대응하지 않기 때문이다.

실험 결과

연구 질문

  • RQ1표준 MLM 목표로 훈련된 마스크된 언어 모델은 시퀀스에 대한 원칙적인 확률 분포를 정의하는 암시적 에너지 기반 모델로 간주될 수 있는가?
  • RQ2MLM 훈련에서 사용된 마스크된 조건부 분포는 목표 에너지 기반 분포의 정적 분포와 일치하는 유효한 마르코프 체인을 형성하는가?
  • RQ3MLM 조건부 분포를 제안 분포로 사용하는 메트로폴리스–해스팅스 샘플링은 기존의 무방향 생성 방법보다 더 높은 품질의 샘플을 생성할 수 있는가?
  • RQ4다양한 에너지 매개변수화(원시 대비 정규화)는 무조건적 및 조건부 생성에서 샘플 품질에 어떤 영향을 미치는가?
  • RQ5목표 분포를 안내함으로써 샘플 품질이 향상되고 기계 번역에서 효과적인 모드 탐색이 가능한가?

주요 결과

  • 원시 에너지 매개변수화를 사용하는 제안된 MH 샘플러는 De-En 테스트 세트에서 BLEU 점수 30.12를 기록했으며, Ro-En에서는 30.86를 기록하여 마스크 예측 기반 베이스라인 및 열악한 지브스 샘플링을 능가한다.
  • 기계 번역 작업에서 원시 에너지 매개변수화를 사용하는 MH 샘플러는 자동회귀 모델과 경쟁 가능한 성능을 보이며, De-En에서 30.12 BLEU, Ro-En에서 30.86 BLEU를 기록한다.
  • 인간 평가 결과, MH 샘플러(특히 원시 에너지)는 BERT-base에서 유창성(2.05)과 일관성(2.05) 점수에서 열악한 지브스 샘플러(각각 1.23 및 1.20)보다 높은 점수를 기록한다.
  • MH 샘플러의 샘플은 열악한 지브스 샘플러보다 훨씬 낮은 GPT-2 퍼플렉서티(원시 에너지 기반 BERT-base에서는 125.42)를 보이며, 더 높은 유창성과 타당성을 시사한다.
  • 특히 목표 분포가 안내된 경우, 원시 에너지 매개변수화에서 MH 샘플러의 수용률이 정규화된 버전보다 높으며, 이는 더 나은 생성 성능과 관련이 있다.
  • 비연속적인 블록 치환 제안 방식은 혼합을 향상시키고 샘플링 시간을 단축시켜 더 빠른 수렴과 더 나은 샘플 다양성을 이끈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.