[논문 리뷰] Distance and Equivalence between Finite State Machines and Recurrent Neural Networks: Computational results
이 논문은 유한 상태 기계(FSM)로 순환 신경망 언어 모델(RNN-LM)을 근사하는 데 있어 계산 복잡도를 조사하며, ReLU 활성화 함수를 가진 일반적인 RNN-LM과 가중치가 부여된 FSM(PFA/WFA) 간의 동치성과 거리 계산이 결정 불가능하다는 것을 증명한다. 일관된 RNN-LM의 경우, 체비세프 거리 근사가 결정 가능하지만, 유한 지지역에서 NP-난이도를 가지며, 이는 LSTMs, GRUs 및 유한 정밀도 RNNs에 대한 영향을 미친다.
The need of interpreting Deep Learning (DL) models has led, during the past years, to a proliferation of works concerned by this issue. Among strategies which aim at shedding some light on how information is represented internally in DL models, one consists in extracting symbolic rule-based machines from connectionist models that are supposed to approximate well their behaviour. In order to better understand how reasonable these approximation strategies are, we need to know the computational complexity of measuring the quality of approximation. In this article, we will prove some computational results related to the problem of extracting Finite State Machine (FSM) based models from trained RNN Language models. More precisely, we'll show the following: (a) For general weighted RNN-LMs with a single hidden layer and a ReLu activation: - The equivalence problem of a PDFA/PFA/WFA and a weighted first-order RNN-LM is undecidable; - As a corollary, the distance problem between languages generated by PDFA/PFA/WFA and that of a weighted RNN-LM is not recursive; -The intersection between a DFA and the cut language of a weighted RNN-LM is undecidable; - The equivalence of a PDFA/PFA/WFA and weighted RNN-LM in a finite support is EXP-Hard; (b) For consistent weight RNN-LMs with any computable activation function: - The Tcheybechev distance approximation is decidable; - The Tcheybechev distance approximation in a finite support is NP-Hard. Moreover, our reduction technique from 3-SAT makes this latter fact easily generalizable to other RNN architectures (e.g. LSTMs/RNNs), and RNNs with finite precision.
연구 동기 및 목표
- 훈련된 RNN 언어 모델을 유한 상태 기계(FSM)로 근사하는 데 있어 계산 복잡도를 분석하는 것, 특히 동치성과 거리 측도 측면에서.
- 후행적 추출을 통한 기계적이고 해석 가능한 FSM을 훈련된 RNN에서 추출하는 것이 가능한지 평가하는 것, 이는 해석 가능한 AI의 핵심 과제이다.
- 확률적/가중치가 부여된 유한 오토마타(PFA/WFA)와 RNN-LM 간의 거리 및 동치성 문제의 결정 가능성 또는 계산적으로 비가능한지 여부를 규명하는 것.
- LSTM, GRU 및 유한 정밀도 RNN을 포함한 더 넓은 아키텍처로 RNN의 해석 가능성에 대한 결과를 확장하는 것.
- 안전 기반 응용 분야에서 필수적인, RNN의 기계적 근사 품질 평가를 위한 이론적 기초를 제공하는 것.
제안 방법
- 3-SAT 만족 가능성 문제에서의 축소를 통해, ReLU 활성화 함수를 가진 일반적인 RNN-LM과 PFA/WFA 간의 동치성 및 거리 계산의 결정 불가능성을 증명하는 데 사용한다.
- 입력 문자열에 대해 PFA의 동작을 시뮬레이션하기 위해 단일 은닉층과 ReLU 활성화 함수를 가진 기억이 없는 1차 RNN을 구성한다.
- RNN의 출력을 임계값으로 설정하여 언어를 정의하는 컷포인트 언어 구축을 통해 DFA 및 PFA 언어와의 비교를 가능하게 한다.
- 유한 길이의 문자열에 대해 RNN과 PFA의 출력 분포 간 체비세프(L∞) 거리를 정의하여 근사 품질을 측정한다.
- 3-SAT에서의 축소를 통해, 유리수 매개변수와 유한 정밀도를 사용하여, 유한 지지에서 체비세프 거리 근사의 NP-난이도를 증명한다.
- 기본 구조가 내부 순환 동역학에 의존하지 않고 출력 바이어스에만 의존하므로, NP-난이도 결과를 LSTMs, GRUs 및 유한 정밀도 RNNs로 일반화한다.
실험 결과
연구 질문
- RQ1ReLU 활성화 함수를 가진 일반적인 가중치가 부여된 1차 RNN-LM과 PFA/WFA 간의 동치성 문제는 결정 가능한가?
- RQ2PFA/WFA와 가중치가 부여된 RNN-LM이 생성하는 언어 간의 거리는 계산 가능하며, 재귀적인가?
- RQ3DFA와 가중치가 부여된 RNN-LM의 컷포인트 언어 간의 교차는 결정 가능한가?
- RQ4입력 문자열의 유한 지지에 제한된 경우, PFA/WFA와 가중치가 부여된 RNN-LM 간의 동치성은 결정 가능한가?
- RQ5일관된 RNN-LM과 PFA 간의 체비세프 거리 근사는 결정 가능한가? 그리고 이는 유한 지지에서 계산 복잡도가 어떻게 되는가?
주요 결과
- ReLU 활성화 함수를 가진 일반적인 가중치가 부여된 1차 RNN-LM과 PFA/WFA 간의 동치성 문제는 결정 불가능하다.
- 결론적으로, PFA/WFA와 가중치가 부여된 RNN-LM이 생성하는 언어 간의 거리는 재귀적이지 않다.
- DFA와 가중치가 부여된 RNN-LM의 컷포인트 언어 간의 교차는 결정 불가능하다.
- 유한 지지에서 PFA/WFA와 가중치가 부여된 RNN-LM 간의 동치성은 EXP-하드이다.
- 어떤 계산 가능한 활성화 함수를 가진 일관된 RNN-LM의 경우, 체비세프 거리 근사는 결정 가능하다.
- 유한 지지에서 일관된 RNN-LM과 PFA 간의 체비세프 거리 근사는 NP-하드이며, 이 결과는 LSTMs, GRUs 및 유한 정밀도 RNNs로 일반화된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.