Skip to main content
QUICK REVIEW

[논문 리뷰] Two-Level Transformer and Auxiliary Coherence Modeling for Improved Text Segmentation

Goran Glavašš, Swapna Somasundaran|arXiv (Cornell University)|2020. 01. 03.
Topic Modeling참고 문헌 42인용 수 7
한 줄 요약

이 논문은 다중 작업 학습 설정을 통해 일관성(코herency)을 명시적으로 모델링하는 두 수준의 트랜스포머 기반 모델인 CATS를 제안한다. 문장 수준의 분할과 원본 문장 순서와 뒤섞인 순서를 구분하는 것을 동시에 최적화함으로써, 기준 데이터셋에서 최신 기술 수준의 성능을 달성하고, 다국어 임베딩을 활용한 효과적인 제로샷 다국어 전이를 가능하게 한다.

ABSTRACT

Breaking down the structure of long texts into semantically coherent segments makes the texts more readable and supports downstream applications like summarization and retrieval. Starting from an apparent link between text coherence and segmentation, we introduce a novel supervised model for text segmentation with simple but explicit coherence modeling. Our model -- a neural architecture consisting of two hierarchically connected Transformer networks -- is a multi-task learning model that couples the sentence-level segmentation objective with the coherence objective that differentiates correct sequences of sentences from corrupt ones. The proposed model, dubbed Coherence-Aware Text Segmentation (CATS), yields state-of-the-art segmentation performance on a collection of benchmark datasets. Furthermore, by coupling CATS with cross-lingual word embeddings, we demonstrate its effectiveness in zero-shot language transfer: it can successfully segment texts in languages unseen in training.

연구 동기 및 목표

  • 기존의 텍스트 분할 모델이 어휘적 또는 의미적 유사성에 의해 일관성을 암묵적으로 포착하는 데에 한계가 있다는 점을 해결하기 위해, 일관성을 명시적으로 모델링하는 것.
  • 원본 문장 순서와 손상된(뒤섞인) 순서를 구분하는 보조 일관성 목표를 도입하여 분할 성능을 향상시키기 위해.
  • 영어 데이터로만 훈련된 모델을 활용하여 다국어 단어 임베딩을 통해 영어 외 언어에서의 제로샷 언어 전이를 가능하게 하기 위해.
  • 명시적인 일관성 모델링이 다양한 도메인과 언어 간의 분할 정확도와 강건성 향상에 기여한다는 것을 입증하기 위해.

제안 방법

  • 모델은 두 수준의 트랜스포머 아키텍처를 사용한다: 토큰 수준의 트랜스포머는 개별 문장을 인코딩하고, 문장 수준의 트랜스포머는 문장 표현의 순서를 인코딩한다.
  • 모델은 문장 수준에서 문맥화된 문장 표현에 기반한 피드포워드 분류기를 사용하여 이진 분할 예측을 수행한다.
  • 보조 일관성 회귀 모델은 전체 스크립트에 대해 일관성 점수를 예측하며, 원본 문장 순서에 대해 더 높은 점수를 부여하도록 훈련된다.
  • 모델은 다중 작업 학습을 통해 동시에 주된 분할 목표와 보조 일관성 목표를 최적화한다.
  • 아키텍처는 사전 훈련된 단어 임베딩과 위치 임베딩을 결합하며, 문장 표현은 토큰 수준의 트랜스포머에서 [CLS]-유사 토큰 표현에서 유도된다.
  • 제로샷 전이를 위해 모델은 다국어 단어 임베딩과 결합되며, 미세조정 없이도 새로운 언어에서의 분할을 가능하게 한다.

실험 결과

연구 질문

  • RQ1명시적인 일관성 모델링이 암묵적인 일관성 신호를 넘어서 텍스트 분할 성능을 향상시킬 수 있는가?
  • RQ2분할과 일관성 예측을 조합한 다중 작업 학습 설정이 더 나은 일반화와 강건성을 이끌어낼 수 있는가?
  • RQ3영어 데이터로만 훈련된 모델이 다국어 단어 임베딩을 활용하여 저자원 언어나 새로운 언어에서의 분할을 수행할 수 있는가?
  • RQ4여러 기준 데이터셋에서 최신 기술 수준의 지도 및 비지도 분할 방법과 비교해 볼 때 모델의 성능은 어떻게 되는가?

주요 결과

  • CATS는 다양한 기준 텍스트 분할 데이터셋에서 최신 기술 수준의 성능을 달성하며, 이전의 지도 학습 모델들을 능가한다.
  • 보조 일관성 목표는 추론 시 일관성 목표를 사용하지 않더라도 기반 모델인 Two-Level Transformer (TLT-TS)보다 분할 성능을 크게 향상시킨다.
  • TLT-TS 모델 자체만으로도 최신 기술 수준의 결과를 달성하며, 이는 두 수준의 트랜스포머 아키텍처의 효과성을 입증한다.
  • CATS는 효과적인 제로샷 다국어 분할을 가능하게 한다: 다국어 임베딩과 결합했을 때, 새로운 언어에서 가장 우수한 비지도 모델을 능가한다.
  • 모델은 도메인 전이에서도 뛰어난 강건성을 보이며, 다양한 텍스트 유형과 도메인 간에 높은 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.