Skip to main content
QUICK REVIEW

[논문 리뷰] Discourse Probing of Pretrained Language Models

Fajri Koto, Jey Han Lau|arXiv (Cornell University)|2021. 04. 13.
Topic Modeling참고 문헌 27인용 수 4
한 줄 요약

이 논문은 7개의 모델과 4개의 언어를 대상으로 문서 수준의 논리적 연결 탐색을 통해 사전 훈련된 언어 모델의 문서 수준의 논리적 연결을 포괄하는 능력을 평가한다. BART의 인코더가 전반적으로 가장 뛰어난 성능을 보이며, BERT는 더 단순한 사전 훈련 목표에도 불구하고 놀랍게 높은 성능을 보이며, 각 레이어와 모델 간 성능에 큰 차이가 있다.

ABSTRACT

Existing work on probing of pretrained language models (LMs) has predominantly focused on sentence-level syntactic tasks. In this paper, we introduce document-level discourse probing to evaluate the ability of pretrained LMs to capture document-level relations. We experiment with 7 pretrained LMs, 4 languages, and 7 discourse probing tasks, and find BART to be overall the best model at capturing discourse -- but only in its encoder, with BERT performing surprisingly well as the baseline model. Across the different models, there are substantial differences in which layers best capture discourse information, and large disparities between models.

연구 동기 및 목표

  • 사전 훈련된 언어 모델이 문장 수준의 문법을 넘어서 문서 수준의 논리적 연결을 얼마나 잘 포괄하는지 평가하는 것.
  • BERT의 연구 결과가 아키텍처, 사전 훈련 목표, 언어가 다른 다른 모델으로 일반화되는지 조사하는 것.
  • 각 모델 내에서 논리적 정보를 가장 잘 포괄하는 레이어를 특정하고, 모델과 언어 간 성능 변화를 분석하는 것.
  • 논리적 구조 이론(Rhetorical Structure Theory, RST)에 기반한 일곱 가지 탐색 작업을 체계적으로 사용하여 논리적 연결을 분석하는 것.

제안 방법

  • 논리적 구조 이론(Rhetorical Structure Theory, RST)에 기반한 일곱 가지 논리적 연결 탐색 작업을 설계하였으며, 핵심성(nuclearity), 논리적 관계(discourse relations), EDU 분할(EDU segmentation), 스토리 클로즈(story cloze) 포함.
  • 영어, 중국어, 독일어, 스페인어 4개 언어에서 7개의 사전 훈련된 모델(BERT, RoBERTa, ALBERT, ELECTRA, GPT-2, BART, T5)을 평가.
  • 모든 트랜스포머 레이어에서 표현 품질을 평가하기 위해 레이어별 탐색을 수행하였으며, 분류 헤드는 풀링된 표현(예: [CLS] 또는 평균 풀링)에 적용.
  • 각 작업에 대해 표준화된 데이터셋을 사용하여 모델을 훈련하고 평가하였으며, RST-DT, CDTB, Potsdam Commentary, XSum 등의 데이터셋 사용.
  • 모든 작업과 모델에 대한 성능을 보고하였으며, 결과는 세 개의 랜덤 시드 평균값으로 요약하고 표준편차를 함께 보고.
  • [CLS] 토큰과 평균 풀링을 BERT에서 비교하였으며, 고정된(frozen) 및 미세조정된(fine-tuned) BERT 레이어를 평가하여 표현 안정성 평가.

실험 결과

연구 질문

  • RQ1다양한 언어에서 다양한 사전 훈련된 언어 모델이 문서 수준의 논리적 연결을 얼마나 잘 포괄하는가?
  • RQ2각 모델 내에서 논리적 정보를 가장 잘 포괄하는 레이어는 어디이며, 이는 모델 간에 어떻게 다를까?
  • RQ3BERT의 문장 수준 작업에서의 뛰어난 성능이 다양한 언어에서 문서 수준의 논리적 연결 탐색으로 일반화되는가?
  • RQ4다른 사전 훈련 목표(MLM, DAE, LM 등)를 가진 모델들이 논리적 연결을 포괄하는 데 얼마나 효과적인가?
  • RQ5영어에서의 결과가 중국어, 독일어, 스페인어와 같은 자원이 적은 언어로 일반화되는 정도는 어느 정도인가?

주요 결과

  • BART의 인코더는 모든 논리적 연결 탐색 작업에서 평균적으로 가장 높은 성능를 보이며, 문서 수준의 논리적 연결을 포괄하는 데서 다른 모델들을 압도한다.
  • BERT는 더 단순한 사전 훈련 목표(MLM + NSP)에도 불구하고 모든 언어에서 놀랍게 뛰어난 성능을 보이며, 특히 핵심성과 관계 분류에서 뛰어난 성능를 보인다.
  • 레이어 간 성능에 큰 차이가 있다: BERT의 경우 최고 성능는 중간에서 상단 레이어(예: 레이어 10–12)에서 나타나며, BART의 인코더는 레이어 7–12에서 최고 성능를 보인다.
  • GPT-2는 디코더 전용 모델이므로 대부분의 논리적 연결 작업에서 빈약한 성능를 보이며, 특히 핵심성과 관계 분류에서 제한된 논리적 이해를 보인다.
  • T5는 일관되지만 중간 수준의 성능를 보이며, 핵심성과 관계 작업에서 낮은 점수를 기록하여 계층적 논리적 연결 구조를 제한적으로 포괄함을 시사한다.
  • 대부분의 작업에서 [CLS] 토큰 표현은 평균 풀링보다 성능이 뛰어나며, 특히 후반 레이어에서 두드러진다. 그러나 깊은 레이어에서는 이 차이가 줄어든다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.