Skip to main content
QUICK REVIEW

[논문 리뷰] Deleter: Leveraging BERT to Perform Unsupervised Successive Text Compression

Tong Niu, Caiming Xiong|arXiv (Cornell University)|2019. 09. 07.
Natural Language Processing Techniques참고 문헌 19인용 수 8
한 줄 요약

Deleter는 병렬 데이터나 작업 전용 아키텍처가 필요 없는 완전히 비지도 학습 기반 텍스트 압축 모델로, BERT를 활용해 문장의 토큰을 점진적이고 탐욕적인 방식으로 삭제하여 점차적으로 압축된 문장을 생성한다. 이 모델은 추출형 문장 압축에서 지도 학습 기반 최신 모델들과 경쟁 가능한 성능을 달성하며, 정보성과 독해성 측면에서 인간 평가에서도 슈퍼바이즈드 모델들을 능가한다. 병렬 데이터가 필요하지 않다.

ABSTRACT

Text compression has diverse applications such as Summarization, Reading Comprehension and Text Editing. However, almost all existing approaches require either hand-crafted features, syntactic labels or parallel data. Even for one that achieves this task in an unsupervised setting, its architecture necessitates a task-specific autoencoder. Moreover, these models only generate one compressed sentence for each source input, so that adapting to different style requirements (e.g. length) for the final output usually implies retraining the model from scratch. In this work, we propose a fully unsupervised model, Deleter, that is able to discover an "optimal deletion path" for an arbitrary sentence, where each intermediate sequence along the path is a coherent subsequence of the previous one. This approach relies exclusively on a pretrained bidirectional language model (BERT) to score each candidate deletion based on the average Perplexity of the resulting sentence and performs progressive greedy lookahead search to select the best deletion for each step. We apply Deleter to the task of extractive Sentence Compression, and found that our model is competitive with state-of-the-art supervised models trained on 1.02 million in-domain examples with similar compression ratio. Qualitative analysis, as well as automatic and human evaluations both verify that our model produces high-quality compression.

연구 동기 및 목표

  • 병렬 데이터, 수작업으로 만든 특징, 문법 레이블이 필요 없는 완전히 비지도 학습 기반 텍스트 압축 방법을 개발하는 것.
  • 압축 비율 제어 및 핵심 단어 유지 기능을 가능하게 하기 위해 전체 삭제 경로를 노출함으로써 유연한 압축을 가능하게 하는 것.
  • 작업 전용 미세조정이나 오토인코더 없이 사전 학습된 언어 모델(BERT)만을 사용해 고성능 압축을 달성하는 것.
  • 동적 데이터 증강 및 적대적 예제 생성을 지원할 수 있는 제어 가능하고 해석 가능한 압축 과정을 제공하는 것.

제안 방법

  • Deleter는 방향성 비순환 그래프 내에서 최적의 삭제 경로를 찾는 방식으로 문장 압축을 정의하며, 각 노드는 원본 문장의 부분 시퀀스이다.
  • 모델은 BERT를 사용해 각 후보 삭제를 평가하며, 결과 문장의 평균 퍼플렉서티(AvgPPL)를 계산하고, 희귀어에 대한 편향을 방지하기 위해 길이 보정 항목을 추가한다.
  • 모델은 점진적 탐욕적 후보 검색을 통해 삭제 경로 상의 모든 중간 문장의 평균 AvgPPL을 최소화하는 삭제를 반복적으로 선택한다.
  • 각 삭제 단계에서는 한 번에 여러 토큰을 동시에 삭제할 수 있으며, 이 과정에서 모든 중간 문장이 문법적으로 타당한 상태를 유지한다.
  • 모델은 사전 학습된 언어 모델(BERT)의 언어 모델링 능력 외에 미세조정이나 보조 감독 신호에 의존하지 않는다.
  • 삭제 경로는 여러 개의 유효한 압축 출력을 제공하여 압축 비율 제어 및 핵심 단어 유지에 대한 제어 기능을 가능하게 한다.

실험 결과

연구 질문

  • RQ1병렬 데이터나 문법 레이블을 사용하지 않는 완전히 비지도 학습 모델이 문장 압축에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2BERT 기반 모델이 반복적인 삭제를 통해 문법적으로 타당한 점진적 압축 문장을 발견할 수 있는가?
  • RQ3단일 출력 모델 대비 전체 삭제 경로를 노출함으로써 해석 가능성과 제어 가능성에서 향상된 성능를 달성할 수 있는가?
  • RQ4퍼플렉서티 스코어 기반 비지도 모델의 추출형 문장 압축 성능가 지도 학습 기반 최신 모델과 비교해 어떻게 되는가?
  • RQ5삭제 경로는 데이터 증강이나 적대적 예제 생성과 같은 후속 응용 분야에서 활용될 수 있는가?

주요 결과

  • Gigaword 데이터셋에서 Deleter는 F1 점수로 54.0(평가자 #1)과 62.6(평가자 #2)를 기록했으며, 이는 병렬 데이터 없이도 Seq2seq with attention 및 LSTMs와 같은 지도 학습 모델들을 능가하는 성능이다.
  • 인간 평가 결과 Deleter의 압축 문장은 독해성(2.88)이 평가자 #1(3.01)과 유사하고, 정보성(2.95)도 평가자 #1(3.21)과 유사했으며, 평가자 #2(3.56)와의 격차만 뚜렷했다.
  • Google Compression 데이터셋에서는 F1 점수가 50.0을 기록했으며, 이는 지도 학습 모델보다 낮지만, 지도 학습이 없고 인간이 편집한 압축이 어려운 데이터셋을 감안할 때 여전히 경쟁 가능한 성능이다.
  • 모델이 전체 삭제 경로를 공개함으로써 압축 비율 제어 및 핵심 단어 유지에 대한 세밀한 제어가 가능해지며, 이는 단일 출력 모델에서는 달성할 수 없는 기능이다.
  • 삭제로 인한 의미적 이질성(예: 부정어의 변화)에 대해 강건함을 보이며, 향후 의미 일致성 검사 기능과의 통합이 필요함을 시사한다.
  • 삭제 경로의 중간 문장을 샘플링함으로써 데이터 증강 및 적대적 예제 생성에 강력한 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.