[논문 리뷰] Enabling Language Models to Fill in the Blanks
이 논문은 마스킹된 텍스트와 그 참값 완성문을 연결하여 훈련하는 방식으로, 사전 훈련된 언어 모델이 문서의 어떤 위치에나 변동 길이의 텍스트 스펙트럼을 효과적으로 예측할 수 있도록 해주는 단순하고 모델에 종속되지 않는 프레임워크인 Infilling by Language Modeling (ILM)을 소개한다. 이 방법은 인간이 감지할 수 없는 수준의 텍스트 보완을 단편 소설에서 달성하며, 인간 평가에서 BERT, 전용 모델, 표준 언어 모델을 모두 능가한다.
We present a simple approach for text infilling, the task of predicting missing spans of text at any position in a document. While infilling could enable rich functionality especially for writing assistance tools, more attention has been devoted to language modeling---a special case of infilling where text is predicted at the end of a document. In this paper, we aim to extend the capabilities of language models (LMs) to the more general task of infilling. To this end, we train (or fine-tune) off-the-shelf LMs on sequences containing the concatenation of artificially-masked text and the text which was masked. We show that this approach, which we call infilling by language modeling, can enable LMs to infill entire sentences effectively on three different domains: short stories, scientific abstracts, and lyrics. Furthermore, we show that humans have difficulty identifying sentences infilled by our approach as machine-generated in the domain of short stories.
연구 동기 및 목표
- 사전 훈련된 언어 모델이 문서의 어떤 위치에나 변동 길이의 텍스트 스펙트럼을 보완할 수 있도록 하는 것, 특히 문장의 끝부분 뿐만 아니라.
- 고정 길이의 스펙트럼만 보완할 수 있거나 전용 아키텍처가 필요한 기존 모델의 한계를 해결하는 것.
- 표준 언어 모델의 장점을 유지하면서 이중적 맥락 사용이 가능하도록, 일반적이고 유연하며 단순한 프레임워크를 개발하는 것—예를 들어 높은 품질의 생성 및 효율적인 샘플링.
- 이 방법을 통해 사전 제작된 언어 모델을 미세 조정하면 실제 글쓰기 작업에서 인간이 작성한 텍스트와 구분되지 않는 보완문을 생성할 수 있음을 입증하는 것.
- 다중 스펙트럼, 변동 길이의 보완을 지원함으로써 글쓰기 보조, 문서 복원, 아이디어 연결 등의 실용적 응용을 가능하게 하는 것.
제안 방법
- 빈칸을 [blank] 토큰으로 대체함으로써 보완 작업을 전체 시퀀스를 예측하는 것이 아니라, 오직 누락된 스펙트럼(y)만 예측하는 것으로 재정의한다.
- 불완전한 입력(여기서 [blank] 토큰이 포함됨)과 참값 완성문(y)을 [answer] 토큰으로 분리하여 훈련 예제를 구성한다.
- 이러한 연결된 시퀀스에서 표준 단방향 언어 모델을 미세 조정하여 p(y | x̃)를 학습한다. 여기서 x̃은 불완전한 입력이다.
- 추론 과정에서, 미세 조정된 언어 모델을 사용해 각 [blank]에 대해 텍스트를 생성한 후, 결정적으로 [blank] 토큰을 예측된 스펙트럼으로 대체하여 완성된 텍스트를 생성한다.
- 각 예제에 대해 단일 순방향 전파를 사용하여 입력 시퀀스를 반복적으로 재처리하는 것을 방지함으로써, 효율적인 다중 스펙트럼 보완을 가능하게 한다.
- 대규모 사전 훈련된 언어 모델을 초기화로 사용하여 성능을 향상시키며, 특히 데이터가 적은 환경에서 유의미한 성능 향상을 이룬다.
실험 결과
연구 질문
- RQ1표준 언어 모델이 간단하고 일반화 가능한 방법을 통해 문서의 임의의 위치에 변동 길이의 스펙트럼을 효과적으로 보완할 수 있는가?
- RQ2제안된 ILM 프레임워크가 기존 방법보다 더 잘 어울리고 맥락적으로 일관된 보완문을 생성할 수 있는가?
- RQ3ILM가 생성한 보완문은 인간 평가에서 특히 서사적 맥락에서 인간이 작성한 텍스트와 구분되지 않는가?
- RQ4인간 감지 가능성과 유창성 측면에서 ILM의 성능은 BERT나 전용 아키텍처(예: SA)와 비교해 어떻게 되는가?
- RQ5대규모 사전 훈련된 언어 모델에서 초기화하면 ILM 프레임워크에서 보완 성능이 향상되는가?
주요 결과
- ILM 모델은 인간 평가에서 45%의 점수를 기록하여 인간 평가자들이 45%의 단편 소설에서 기계가 생성한 문장을 식별하지 못했으며, 이는 BERT(20%), SA(29%), 표준 언어 모델(41%)보다 유의미하게 높은 수준이다.
- 좌우 방향 맥락만 사용하고도 표준 언어 모델이 BERT와 전용 SA 모델을 능가하는 결과를 보였으며, 이는 맥락 길이와 아키텍처가 품질의 유일한 결정 요소가 아님을 시사한다.
- ILM 프레임워크는 단편 소설, 과학 초록, 노래 가사 등 다양한 분야에서 효과적인 보완을 가능하게 하여 광범위한 적용 가능성을 입증한다.
- 대규모 사전 훈련된 언어 모델에서 미세 조정하면 보완 성능이 유의미하게 향상되며, 이는 ILM 프레임워크가 사전 지식을 효과적으로 활용함을 시사한다.
- 정성적 분석 결과, ILM가 생성한 문장은 앞서 온 맥락과 이후 텍스트를 모두 고려하여 맥락적으로 일관된 반면, BERT와 SA 출력은 종종 주제에서 벗어나 있거나 무관한 경우가 많다.
- 이 방법은 모델에 종속되지 않으며 아키텍처 수정이 필요 없어, 사전 훈련된 언어 모델에 최소한의 변경으로 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.