Skip to main content
QUICK REVIEW

[논문 리뷰] Perturbed Masking: Parameter-free Probing for Analyzing and Interpreting BERT

Zhiyong Wu, Yun Chen|arXiv (Cornell University)|2020. 04. 30.
Topic Modeling참고 문헌 48인용 수 7
한 줄 요약

이 논문은 BERT의 언어적 표현을 마스크된 토큰 예측에 대한 단어 변형의 영향을 측정하여 분석하는 파rameter-free 탐색 방법인 Perturbed Masking을 제안한다. 두 단계의 마스킹과 거리 측도를 통해 상호 단어 영향력을 계산함으로써, 기존 기준보다 우수하고 심지어 인간이 설계한 체계를 초월하는 문법적 의존성 트리를 복원한다. 이는 추가적인 파라미터 없이 BERT의 내재된 문법 지식을 드러내며, 파라미터가 없는 방식으로 성능을 발휘한다.

ABSTRACT

By introducing a small set of additional parameters, a probe learns to solve specific linguistic tasks (e.g., dependency parsing) in a supervised manner using feature representations (e.g., contextualized embeddings). The effectiveness of such probing tasks is taken as evidence that the pre-trained model encodes linguistic knowledge. However, this approach of evaluating a language model is undermined by the uncertainty of the amount of knowledge that is learned by the probe itself. Complementary to those works, we propose a parameter-free probing technique for analyzing pre-trained language models (e.g., BERT). Our method does not require direct supervision from the probing tasks, nor do we introduce additional parameters to the probing process. Our experiments on BERT show that syntactic trees recovered from BERT using our method are significantly better than linguistically-uninformed baselines. We further feed the empirically induced dependency structures into a downstream sentiment classification task and find its improvement compatible with or even superior to a human-designed dependency schema.

연구 동기 및 목표

  • 추가 모델 파라미터에 의존하는 탐색 방법에서의 모호함을 해결하기 위해, 이는 사전 학습된 모델 표현이 아닌 작업에 특화된 지식을 캐내기 때문이다.
  • 추가 파라미터나 지도 학습 레이블을 도입하지 않고도 BERT의 내부 표현을 직접 탐색할 수 있는 파라미터가 없는 방법을 개발하기 위해이다.
  • 단지 모델의 마스크된 언어 모델링 동작을 사용하여 전반적인 언어적 구조—특히 의존성 트리—를 추출하기 위해이다.
  • 유도된 문법적 구조가 하류 NLP 작업에서 성능 향상에 기여하는지 평가하기 위해, 이를 기준 기준 및 인간이 설계한 체계와 비교하기 위해이다.
  • 추가 파라미터를 도입한 지도 학습 분류기 기반의 이전 탐색 연구를 보완하는 비지도 검증을 제공하기 위해이다.

제안 방법

  • 이 방법은 두 단계 마스킹을 수행한다: 먼저 타겟 토큰 $x_i$ 를 [MASK] 로 마스킹한 후, 동일한 문장 내의 맥락 단어 $x_j$ 를 마스킹하여 $x_i$ 의 표현 변화를 관찰한다.
  • 단어 $x_j$ 가 $x_i$ 에 미치는 영향은 거리 함수 $f(x_i, x_j) = d(H_{\theta}(\mathbf{x}\setminus\{x_i\})_i, H_{\theta}(\mathbf{x}\setminus\{x_i,x_j\})_i)$ 를 통해 정량화되며, 여기서 $d$ 는 유클리드 거리 또는 토큰 예측 확률의 차이일 수 있다.
  • 두 가지 거리 측도를 평가한다: Dist (은닉 표현 간 유클리드 거리) 와 Prob (예측 확률의 차이).
  • 유도된 영향 행렬은 강력한 영향 관계를 선택하는 근사 알고리즘을 통해 의존성 트리를 유추하는 데 사용된다.
  • 이 방법은 문법적 파싱 및 논의적 의존성 파싱에 적용되며, 언어학적으로 무지한 기준 기준 및 인간이 설계한 체계와 결과를 비교한다.
  • 유도된 의존성 구조는 하류 감성 분류 작업에서 평가되어 실용적 유용성을 점검한다.

실험 결과

연구 질문

  • RQ1추가적인 모델 파라미터나 지도 학습 레이블 없이도 파라미터가 없는 탐색 방법이 BERT에서 의미 있는 문법적 구조를 추출할 수 있는가?
  • RQ2Perturbed Masking가 유도한 의존성 트리는 단순한 기준 기준과 비교해 언어학적으로 정의된 문법적 구조와 얼마나 잘 일치하는가?
  • RQ3Perturbed Masking를 통해 학습된 문법적 구조가 인간이 설계한 의존성 체계와 비교해 하류 NLP 작업에서 성능 향상에 기여하는가?
  • RQ4마스크된 언어 모델링에서 도출된 영향 행렬이 BERT에 내재된 진정한 문법적 의존성 구조를 얼마나 잘 반영하는가?
  • RQ5이 방법은 논의 수준의 구조를 드러내며, BERT가 문장 수준의 문법을 넘어서 장거리 시퀀스 모델링 능력을 지녔음을 시사하는가?

주요 결과

  • Perturbed Masking를 사용해 복원한 문법 트리는 오른쪽 분기 및 왼쪽 분기 기반의 언어학적으로 무지한 기준 기준보다 의존성 파싱에서 유의미하게 뛰어난 성능을 보였다.
  • 하류 감성 분류 작업에서 유도된 의존성 구조는 인간이 설계한 의존성 체계와 동등하거나 그 이상의 성능을 달성했다.
  • 이 방법은 BERT가 파라미터가 없는 비지도 방식으로 풍부한 문법 지식을 내재하고 있음을 입증하며, 그 문법 능력의 하한선 추정치를 제공한다.
  • 두 단계 마스킹에서 도출된 영향 행렬은 중간 표현이 아닌 모델 출력에서 유도된 바, 어텐션 메커니즘과 유사한 상호 단어 상관관계를 효과적으로 포착한다.
  • 이 방법은 BERT의 자기지도 사전 학습 과정이 문법적 구조를 내재적으로 형성하며, 이는 전적으로 문법을 위한 지도 학습이 아니더라도 실용적으로 유용하다는 것을 시사한다.
  • 이 방법은 문장 수준의 문법을 넘어서 장거리 의존성 모델링 능력을 지닌 BERT가 논의 수준의 의존성 파싱에도 성공적으로 일반화됨을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.