Skip to main content
QUICK REVIEW

[논문 리뷰] Formal Language Theory Meets Modern NLP

William Merrill|arXiv (Cornell University)|2021. 02. 19.
Natural Language Processing Techniques참고 문헌 53인용 수 6
한 줄 요약

이 논문은 자동화이어 이론과 현대 NLP를 연결하여, 특히 트랜스포머 아키텍처를 자동화이어 이론과 콜름스키 계층의 관점에서 분석한다. 포화된 트랜스포머는 정규언어와 문맥자유언어를 인식할 수 있으며, 반면 유한한 주의력(attention)을 가진 변형들은 그렇지 못하다는 것을 입증하고, 이론적 보장을 가진 스케일러블한 표준 자기주의(self-attention)의 대안으로 무작위 특징 주의(random feature attention)를 제안한다.

ABSTRACT

NLP is deeply intertwined with the formal study of language, both conceptually and historically. Arguably, this connection goes all the way back to Chomsky's Syntactic Structures in 1957. It also still holds true today, with a strand of recent works building formal analysis of modern neural networks methods in terms of formal languages. In this document, I aim to explain background about formal languages as they relate to this recent work. I will by necessity ignore large parts of the rich history of this field, instead focusing on concepts connecting to modern deep learning-based NLP.

연구 동기 및 목표

  • 고전적 형식 언어 이론과 현대 딥러닝 기반 NLP 아키텍처를 연결하기 위해.
  • 자동화이어 이론적 프레임워크를 활용해 트랜스포머와 같은 신경망의 표현 능력을 조사하기 위해.
  • 주의 메커니즘의 한계를 분석하여 복잡한 언어 패턴, 예를 들어 딜크 언어나 파리티 언어를 인식하는 데에 어떤 제약이 있는지 밝히기 위해.
  • 이론적 근거를 가진 스케일러블한 자기주의의 대안, 예를 들어 무작위 특징 주의(random feature attention)를 제안하기 위해.
  • 형식 언어 이론을 활용해 향후 NLP 모델의 해석 가능성, 인덕티브 바이어스, 내구성에 대한 연구를 이끌기 위해.

제안 방법

  • 정규언어 및 문맥민감언어 인식을 모델링하기 위해 유한상태자동화이어와 가중 유한상태자동화이어(WFAs)를 사용한다.
  • Hankel 행렬 이론을 적용하여 문자열 샘플로부터 WFAs의 학습 가능성과 식별 가능성 분석을 수행한다.
  • 포화된 트랜스포머를 메모리가 유한한 유한자동화이어로 모델링하여, 이들이 문맥자유언어를 인식할 수 있음을 보여준다.
  • 회로 복잡도 분석을 통해 하드-어텐션 트랜스포머가 파리티 언어나 딜크 언어를 인식할 수 없음을 증명한다.
  • 무작위 특징 근사법(Rahimi & Recht, 2008)을 활용해 무작위 특징 주의(RFA)를 유도하여, 어텐션 복잡도를 O(MN)에서 O(M+N)으로 감소시킨다.
  • 위치 인코딩의 이론적 분석을 통해 트랜스포머가 상대적 위치 의존성을 감지하기 위해 필수적임을 보여준다.

실험 결과

연구 질문

  • RQ1트랜스포머 네트워크의 형식 언어 능력은 무엇인가? 특히 문맥자유언어나 비문맥자유언어를 인식하는 데에 어떤 능력을 갖는가?
  • RQ2제한된 수신장( receptive field)을 가진 어텐션 메커니즘은 모델이 학습할 수 있는 언어 패턴에 어떤 제약을 끼치는가?
  • RQ3무작위 특징 주의(RFA)는 자기주의의 표현 능력을 유지하면서도 선형 시간 추론을 가능하게 할 수 있는가?
  • RQ4형식 언어 이론은 NLP 모델에서 강건한 언어 일반화와 데이터셋 아티팩트를 얼마나 잘 구분하는 데에 기여할 수 있는가?
  • RQ5Chomsky 계층을 초월하여 유한 길이의 문자열을 고려할 때, 비트리비얼한 복잡도 이론을 언어 패턴에 대해 개발할 수 있는가?

주요 결과

  • 포화된 트랜스포머는 무한한 메모리와 대칭적 어텐션 패턴 덕분에 모든 정규언어와 일부 문맥자유언어, 예를 들어 딜크 언어까지도 인식할 수 있다.
  • 제한된 수신장을 가진 하드-어텐션 트랜스포머는 회로 복잡도 분석을 통해 파리티 언어나 딜크 언어를 인식할 수 없다.
  • 무작위 특징 주의(RFA)는 자기주의 메커니즘을 이론적 보장 하에 근사하며, 내적 곱이 RBF 커널을 근사함으로써 O(M+N)의 계산 시간을 가능하게 한다.
  • 위치 인코딩은 트랜스포머가 상대적 위치 의존성을 감지하는 데 필수적이다. 이를 생략할 경우 단순한 정규언어인 a*b조차도 인식할 수 없다.
  • 가중 유한상태자동화이어(WFAs)는 Hankel 행렬 방법을 통해 문자열 샘플로부터 학습 가능하며, 이는 잠재된 언어적 구조를 학습하는 데 이론적 기반을 제공한다.
  • 이론적 분석을 통해 표준 트랜스포머가 특정 언어 클래스에 강한 인덕티브 바이어스를 지닌다는 것이 드러났으며, 이는 형식 언어 이론이 아키텍처 설계와 해석 가능성에 영향을 줄 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.