Skip to main content
QUICK REVIEW

[논문 리뷰] A Critical Analysis of Biased Parsers in Unsupervised Parsing

Chris Dyer, Gábor Melis|arXiv (Cornell University)|2019. 09. 20.
Natural Language Processing Techniques참고 문헌 21인용 수 22
한 줄 요약

이 논문은 $ύbar{\textrm{COO}}$ 파서, 즉 문장 모델 표현에서 구조적 트리를 탐색적으로 상향식으로 분할하는 방식으로 추론하는 광범위하게 사용되는 비지도 파싱 방법을 철저히 분석한다. 저자들은 전통적인 LSTMs가 특수 설계된 아키텍처와 유사한 파싱 성능을 내지만, 파서가 완전하지 않으며 오른쪽 분지 구조에 강한 편향을 보임을 입증한다. 이는 영어와 유사한 언어에서 성능이 과도하게 높아지며, 언어 모델의 구조적 능력에 대한 주장이 훼손됨을 의미한다.

ABSTRACT

A series of recent papers has used a parsing algorithm due to Shen et al. (2018) to recover phrase-structure trees based on proxies for "syntactic depth." These proxy depths are obtained from the representations learned by recurrent language models augmented with mechanisms that encourage the (unsupervised) discovery of hierarchical structure latent in natural language sentences. Using the same parser, we show that proxies derived from a conventional LSTM language model produce trees comparably well to the specialized architectures used in previous work. However, we also provide a detailed analysis of the parsing algorithm, showing (1) that it is incomplete---that is, it can recover only a fraction of possible trees---and (2) that it has a marked bias for right-branching structures which results in inflated performance in right-branching languages like English. Our analysis shows that evaluating with biased parsing algorithms can inflate the apparent structural competence of language models.

연구 동기 및 목표

  • 기존의 LSTMs가 비지도 파싱에서 ON-LSTM과 같은 특수 아키텍처와 유사한 파싱 성능을 달성할 수 있는지 평가하는 것.
  • $ύbar{\textrm{COO}}$ 파싱 알고리즘의 구조적 한계를 조사하는 것, 특히 모든 유효한 이진 트리를 복원하지 못하는 점에 초점한다.
  • 최댓값 점수 위치 기반의 탐욕적 분할 규칙으로 인해 $ύbar{\textrm{COO}}$ 파서가 오른쪽 분지 구조에 내재된 편향을 보이는 이유를 분석하는 것.
  • 특히 영어와 같은 오른쪽 분지 언어에서, 편향된 알고리즘을 사용할 경우 높은 F1 점수를 과도하게 해석하지 말 것을 연구자들에게 경고하는 것.
  • 일관된 분지 방향성을 가진 언어에 유리하지 않은 언어에 관계없이 적용 가능한 비어 있는 파싱 평가 방법을 제안하는 것.

제안 방법

  • $ύbar{\textrm{COO}}$ 파서는 문장 $[i,j]$를 벡터 $\mathbf{s} \in \mathbb{R}^n$ 내에서 최댓값 점수 위치를 기반으로 상향식으로 반복적으로 분할하여 작동한다. 여기서 $s_i$는 단어 $i$에서의 문법적 깊이의 대체 지표로 사용된다.
  • 파서는 네 가지 추론 규칙을 적용한다: 이진 분할(단일 단어 구간에 대해), 왼쪽 분할(최댓값 점수가 왼쪽 끝에 있을 경우), 오른쪽 분할(최댓값 점수가 오른쪽 끝에 있을 경우), 중간 분할(최댓값 점수가 구간 내부에 있을 경우).
  • 저자들은 표준 LSTMs의 모든 레이어에서의 忽略 게이트 값의 합을 문법적 깊이의 대체 지표로 사용하여, 특수 설계된 ON-LSTM 메커니즘을 대체함으로써 공정한 비교를 확보한다.
  • 파서의 완전성은 분할 규칙에 따라 생성 가능한 이진 트리의 범위를 분석함으로써 평가되며, 최댓값 점수의 위치가 구간 경계에 의존하기 때문에 많은 유효한 트리가 도달 불가능한 것으로 드러났다.
  • 저자들은 파서의 L-버전과 R-버전을 비교하여, 분할 점이 왼쪽 자식 또는 오른쪽 자식에 배치되는 방식으로 결정 규칙이 구조적 편향에 미치는 영향을 분리 분석한다.
  • 형식적 증명을 통해 파서가 최댓값 점수가 끝점에 있지 않은 비단말 분할이 필요한 트리, 특히 비단말 분할이 필요한 트리는 생성할 수 없음을 입증한다.

실험 결과

연구 질문

  • RQ1기존의 LSTMs가 동일한 $ύbar{\textrm{COO}}$ 파싱 알고리즘을 사용할 때 ON-LSTM과 같은 특수 아키텍처와 유사한 파싱 성능을 낼 수 있는가?
  • RQ2$ύbar{\textrm{COO}}$ 파서는 가능한 모든 이진 구조적 트리를 복원할 수 있는가?
  • RQ3최댓값 점수 위치 기반의 탐욕적 분할 규칙이 오른쪽 분지 트리에 어떤 방식으로 구조적 편향을 유도하는가?
  • RQ4이러한 구조적 편향은 영어와 같은 오른쪽 분지 언어에서 언어 모델의 문법적 능력 평가에 어떤 영향을 미치는가?
  • RQ5알고리즘적 편향으로 인한 과대평가를 방지하기 위해 파싱 평가를 어떻게 더 언어에 관계없이 만들 수 있는가?

주요 결과

  • 기존의 LSTMs가 동일한 $ύbar{\textrm{COO}}$ 파싱 알고리즘을 사용할 경우, 특수 설계된 ON-LSTM 아키텍처와 유사한 파싱 성능을 내는 것으로 나타났다.
  • $ύbar{\textrm{COO}}$ 파서는 완전하지 않다: 최댓값 점수 위치에 의존하는 분할 규칙으로 인해 일부 유효한 트리가 도달 불가능하며, 이는 특정한 구조적 구성이 생성 불가능함을 의미한다.
  • 파서는 최댓값 점수가 항상 자식 구간 중 하나에 유지되기 때문에 오른쪽 분지 구조에 강한 편향을 보이며, 최댓값 점수를 오른쪽 끝에 두는 분할 방식을 선호한다.
  • 이러한 구조적 편향은 오른쪽 분지 언어인 영어와 같은 언어에서 F1 점수를 과대평가하게 하며, 이는 기반 언어 모델의 실제 구조적 능력보다 높게 평가되는 결과를 초래한다.
  • 파서가 모든 유효한 트리를 생성하지 못함으로써, 신경망 기반 언어 모델의 문법적 구조 탐색 능력 평가를 위한 신뢰할 수 있는 진단 도구로서의 활용이 훼손된다.
  • 단어 간 전이를 평가하거나 개별 단어가 아닌 구간을 평가하는 등의 대체 점수 체계는 편향을 완화할 수 있지만, 이를 신경망 활성도와 연결하기 위한 새로운 연결 가설이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.