Skip to main content
QUICK REVIEW

[논문 리뷰] BERT as a Teacher: Contextual Embeddings for Sequence-Level Reward

Florian Schmidt, Thomas Hofmann|arXiv (Cornell University)|2020. 03. 05.
Topic Modeling참고 문헌 50인용 수 7
한 줄 요약

이 논문은 n-그램 수를 대체하여 문맥적 BERT 임베딩을 사용하는 조건부가 아닌 텍스트 생성을 위한 새로운 시퀀스 수준 보상 함수를 제안한다. BERT 임베딩을 바탕으로 토큰을 'BERT-그램'으로 군집화하고, 임베딩 기반 유사도를 계산함으로써 장기적 의존성을 포착할 수 있는 확장 가능한 단어 수준의 보상 신호를 제공한다. 이는 강화학습 환경에서 기존의 n-그램 보상보다 더 높은 품질과 더 높은 다양성을 가진 시퀀스 생성에 앞서 성능을 뛰어올린다.

ABSTRACT

Measuring the quality of a generated sequence against a set of references is a central problem in many learning frameworks, be it to compute a score, to assign a reward, or to perform discrimination. Despite great advances in model architectures, metrics that scale independently of the number of references are still based on n-gram estimates. We show that the underlying operations, counting words and comparing counts, can be lifted to embedding words and comparing embeddings. An in-depth analysis of BERT embeddings shows empirically that contextual embeddings can be employed to capture the required dependencies while maintaining the necessary scalability through appropriate pruning and smoothing techniques. We cast unconditional generation as a reinforcement learning problem and show that our reward function indeed provides a more effective learning signal than n-gram reward in this challenging setting.

연구 동기 및 목표

  • n-그램 기반 보상의 한계를 해결하기 위해, 시퀀스 수준 강화학습에서 희박한 보상, 단일 기호 신호 부족, 장기적 의미 포착 실패 문제를 해결하고자 한다.
  • BERT에서 유도된 문맥적 단어 임베딩을 활용하여 보다 표현력 있고 확장 가능한 보상 함수를 만들고, 자연스럽게 각 단어의 기여도를 지원하고자 한다.
  • 원천 입력이 없는 조건부가 아닌 텍스트 생성 환경에서 효과적인 강화학습 훈련을 가능하게 하고자 한다.
  • 사전 훈련된 문맥 임베딩이 기존의 n-그램 통계에 비해 보상 모델링의 더 나은 기초가 될 수 있는지 조사하고자 한다.
  • 제안된 보상 함수가 조건부가 아닌 생성에서 품질과 다양성 측면에서 개선되었는지 평가하고자 한다. 특히 보상의 희박성과 정책 붕괴 문제에 대비하여 검토한다.

제안 방법

  • 기존의 n-그램 수를 대체하기 위해, 참조 시퀀스의 각 토큰을 BERT로 인코딩하여 BERT 기반 임베딩 유사도를 계산한다.
  • 벡터 양자화를 사용해 BERT 임베딩을 효율적인 대표성 있는 'BERT-그램' 집합으로 군집화함으로써, 참조 코퍼스 크기와 무관한 확장성을 확보한다.
  • 생성된 시퀀스의 토큰과 참조 코퍼스 내 가장 가까운 BERT-그램 간의 유사도 합을 보상으로 계산한다.
  • 훈련 중의 안정성과 효율성을 유지하기 위해 BERT-그램 표현에 대한 정렬 및 스무딩 기법을 적용한다.
  • REINFORCE 기반 강화학습 프레임워크에 기반한 임베딩 기반 보상을 적용하여 조건부가 아닌 텍스트 생성을 수행한다.
  • BERT-그램 보상을 사용해 정책 네트워크를 훈련함으로써, GPT-2 퍼플렉서티로 측정한 품질과 고유한 n-그램 비율로 측정한 다양성 측면에서 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1BERT와 같은 문맥 임베딩이 확장성 유지 조건에서 n-그램 통계를 대체할 수 있는가?
  • RQ2임베딩 기반 보상은 카운트 기반 n-그램 보상에 비해 더 세밀한 단어 수준의 학습 신호를 제공하는가?
  • RQ3BERT-그램이 참조 코퍼스 내에서 장기적 의존성과 복잡한 의미를 어느 정도 포착할 수 있는가?
  • RQ4원천 입력이 없는 조건부가 아닌 텍스트 생성 환경에서 제안된 보상 함수의 성능은 어떠한가?
  • RQ5BERT 기반 보상 사용이 강화학습 기반 텍스트 생성에서 흔히 발생하는 모드 붕괴 및 다양성 문제를 완화하는가?

주요 결과

  • BERT-그램 보상은 GPT-2 퍼플렉서티 측정 기준으로 모든 평가 지표에서 n-그램 보상보다 뛰어난 성능을 보이며, 더 낮은 퍼플렉서티로 더 높은 시퀀스 품질을 나타낸다.
  • BERT-그램 보상으로 훈련된 정책은 더 높은 다양성을 보이며, 고유한 시퀀스 비율(ρ), 2-그램 비율(ρ2), 4-그램 비율(ρ4)이 n-그램 기준선보다 높게 나타났다.
  • BERT-그램 보상은 n-그램 보상보다 더 효과적인 학습 신호를 제공하며, 보상 증가 폭이 더 급격하고 지속적으로 유지되는 것으로 나타났다. 반면 n-그램 보상은 초기에 포화 상태에 이르렀다.
  • 성능 향상에도 불구하고, 두 보상 함수 모두 정책 붕괴 현상을 보였으며, BERT-그램 보상 기반에서는 95%의 생성 시퀀스가 직접어조를 사용했고, n-그램 기반에서는 99%로, 강한 모드 편향이 존재함을 시사한다.
  • 강력한 군집화 조건에서도 BERT 임베딩의 표현력이 유지되어, 대규모 참조 코퍼스에 대한 강건성과 확장성을 입증했다.
  • 연구 결과, 더 표현력 있는 보상 함수를 사용하더라도 기반 REINFORCE 훈련 방법이 조건부가 아닌 생성 환경에서 여전히 모드 붕괴 문제를 악화시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.