Skip to main content
QUICK REVIEW

[논문 리뷰] POINTER: Constrained Progressive Text Generation via Insertion-based Generative Pre-training

Yizhe Zhang, Guoyin Wang|arXiv (Cornell University)|2020. 05. 01.
Topic Modeling참고 문헌 56인용 수 10
한 줄 요약

Pointer는 하드 텍스트 제약 조건을 갖는 텍스트 생성을 위한 새로운 비자기적, 삽입 기반의 트랜스포머 모델을 제안한다. 이 모델은 거친 계층에서 세밀한 계층으로 향하는 방식으로 기존 토큰들 사이에 점진적으로 새로운 토큰을 삽입한다. 12GB의 위키백과 데이터로 사전 훈련하고, 하류 작업에 대해 미세 조정한 결과, 경험적으로 로그 형태의 추론 시간 복잡도를 확보하여 효율적이고 해석 가능하며 제약 조건을 정확히 준수하는 텍스트 생성을 가능하게 한다.

ABSTRACT

Large-scale pre-trained language models, such as BERT and GPT-2, have achieved excellent performance in language representation learning and free-form text generation. However, these models cannot be directly employed to generate text under specified lexical constraints. To address this challenge, we present POINTER (PrOgressive INsertion-based TransformER), a simple yet novel insertion-based approach for hard-constrained text generation. The proposed method operates by progressively inserting new tokens between existing tokens in a parallel manner. This procedure is recursively applied until a sequence is completed. The resulting coarse-to-fine hierarchy makes the generation process intuitive and interpretable. We pre-train our model with the proposed progressive insertion-based objective on a 12GB Wikipedia dataset, and fine-tune it on downstream hard-constrained generation tasks. Non-autoregressive decoding yields an empirically logarithmic time complexity during inference time. Experimental results on both News and Yelp datasets demonstrate that POINTER achieves state-of-the-art performance on constrained text generation. We released the pre-trained models and the source code to facilitate future research (https://github.com/dreasysnail/POINTER).

연구 동기 및 목표

  • 모든 지정된 키워드가 출력에 포함되어야 하는 유창하고 제약 조건이 있는 텍스트를 생성하는 데 도전하는 것.
  • 유창성과 제약 조건 준수를 유지하면서 추론 시간 복잡도를 O(n)에서 O(log n)으로 감소시키는 비자기적 생성 방법을 설계하는 것.
  • 고수준 의미 토큰을 낮은 수준의 기능 어휘 이전에 점진적으로 삽입함으로써 직관적이고 해석 가능한 생성을 가능하게 하는 것.
  • 다양한 제약 조건이 있는 생성 작업에 대해 제로샷 및 피처샷 미세 조정을 지원할 수 있도록 대규모 코퍼스에서 강력한 기초 모델을 사전 훈련하는 것.
  • 삽입 기반 생성 프로세스에 맞게 맞춤형으로 설계된 비트 서치 알고리즘을 개발하여 디코딩 효율성과 정확도를 향상시키는 것.

제안 방법

  • 모델은 병렬적이고 점진적인 방식으로 기존 토큰들 사이에 새로운 토큰을 반복적으로 삽입하여 거친 계층에서 세밀한 계층으로 향하는 계층을 형성한다.
  • 생성은 단계별로 진행되며, 먼저 고수준의 내용 어휘(예: 명사, 동사)가 삽입되고, 이후 단계에서 기능 어휘(예: 전치사, 冠형사)가 삽입된다.
  • 사전 훈련 기간 동안 BERT 스타일의 초기화와 효과적인 사전 훈련을 가능하게 하는 막힌 언어 모델링(MLM)을 기반으로 한 목표 함수를 사용한다. 이는 12GB의 위키백과 데이터셋에서 수행된다.
  • 어휘 제약 조건을 준수하면서 삽입 위치와 순서를 효율적으로 탐색할 수 있도록 새로운 비트 서치 알고리즘을 설계하였다.
  • 자기적 생성을 피하기 위해 삽입 위치에 특정 토큰을 삽입하는 방식으로 구현된 시퀀스 투 시퀀스 아키텍처를 사용한다.
  • 뉴스 요약 및 야심 리뷰 생성과 같은 하류 제약 조건이 있는 생성 작업에서 훈련을 수행하며, 제약 키워드를 입력으로 사용한다.

실험 결과

연구 질문

  • RQ1비자기적, 삽입 기반의 생성 모델이 추론 시간 복잡도를 낮추면서도 하드 제약 조건 텍스트 생성에서 최고 성능을 달성할 수 있는가?
  • RQ2자기적 또는 샘플링 기반 방법과 비교해 볼 때, 점진적이고 거친 계층에서 세밀한 계층으로 향하는 삽입 전략이 생성 과정의 해석 가능성과 제어력을 향상시키는가?
  • RQ3위키백과와 같은 일반 코퍼스에서 대규모 사전 훈련을 통해 제로샷 및 피처샷 성능이 하류 제약 조건 생성 작업에서 향상되는가?
  • RQ4제안된 비트 서치 알고리즘이 제약 조건 준수 및 유창성 측면에서 표준 디코딩 전략과 비교해 어떻게 성능을 내는가?
  • RQ5정보성 높은 내용 어휘를 기능 어휘 이전에 삽입함으로써 표준의 왼쪽에서 오른쪽으로의 생성 순서를 어겨도 모델이 여전히 자연스럽고 일관된 텍스트를 생성할 수 있는가?

주요 결과

  • Pointer는 뉴스 및 야심 데이터셋 모두에서 하드 제약 조건 텍스트 생성에서 최고 성능을 기록하였으며, 자동 평가 및 인간 평가 지표에서 기존 방법들을 능가하였다.
  • 비자기적이고 병렬적인 토큰 삽입 덕분에 추론 시간 복잡도가 경험적으로 로그 형태인 O(log n)으로 감소하였다.
  • 12GB의 위키백과 데이터로 사전 훈련한 결과, 하류 제약 조건 생성 작업에서 피처샷 및 제로샷 일반화 능력이 크게 향상되었다.
  • 점진적 삽입 메커니즘 덕분에 고수준 의미적 내용이 문법적 기능 어휘 이전에 생성되는 직관적이고 해석 가능한 생성이 가능해졌다.
  • 인간 평가 결과, 요구된 모든 키워드를 정확히 포함하면서도 자연스럽고 일관성 있는 출력이 생성되었으며, 복잡한 제약 조건 세트에서도 성능이 유지되었다.
  • 제안된 비트 서치 알고리즘은 제약 조건 준수와 유창성 사이의 균형을 효과적으로 확보하여, 제약 조건이 있는 환경에서 표준 디코딩 기반 모델보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.