Skip to main content
QUICK REVIEW

[논문 리뷰] Learning with Interpretable Structure from Gated RNN

Bojian Hou, Zhi‐Hua Zhou|arXiv (Cornell University)|2018. 10. 25.
Machine Learning and Algorithms참고 문헌 47인용 수 6
한 줄 요약

이 논문은 해석 가능한 유한 상태 기계(FSA)를 클러스터링 기반 방법을 사용해 게이팅 RNN에서 학습함으로써 모델의 투명성을 향상시키는 것을 제안한다. MGU, GRU, LSTM 모델에서 유한 상태 기계 구조를 추출함으로써, 저자들은 결과적으로 FSA가 RNN의 성능을 재현하면서도 인간이 시뮬레이션할 수 있는 결정 경로를 제공함을 보여주었으며, 텍스트 분류에서 의미적 패턴을 드러내고 게이팅 수가 적을수록 RNN 성능이 향상됨을 시사한다.

ABSTRACT

The interpretability of deep learning models has raised extended attention these years. It will be beneficial if we can learn an interpretable structure from deep learning models. In this paper, we focus on Recurrent Neural Networks~(RNNs) especially gated RNNs whose inner mechanism is still not clearly understood. We find that Finite State Automaton~(FSA) that processes sequential data has more interpretable inner mechanism according to the definition of interpretability and can be learned from RNNs as the interpretable structure. We propose two methods to learn FSA from RNN based on two different clustering methods. With the learned FSA and via experiments on artificial and real datasets, we find that FSA is more trustable than the RNN from which it learned, which gives FSA a chance to substitute RNNs in applications involving humans' lives or dangerous facilities. Besides, we analyze how the number of gates affects the performance of RNN. Our result suggests that gate in RNN is important but the less the better, which could be a guidance to design other RNNs. Finally, we observe that the FSA learned from RNN gives semantic aggregated states and its transition graph shows us a very interesting vision of how RNNs intrinsically handle text classification tasks.

연구 동기 및 목표

  • 비록 광범위하게 사용되고 있지만 여전히 투명성이 떨어지는 게이팅 RNN의 해석 가능성을 향상시키기 위해.
  • 유한 상태 기계(FSA)가 인간이 시뮬레이션할 수 있는 행동을 보인다는 점을 감안할 때, FSA가 게이팅 RNN의 은닉 상태에서 학습되어 해석 가능한 대체 모델이 될 수 있는지 조사하기 위해.
  • RNN의 게이팅 수가 성능에 미치는 영향를 분석하고, 단순한 아키텍처(예: 하나의 게이팅을 가진 MGU)가 더 효과적인지 여부를 조사하기 위해.
  • FSA 전이 그래프와 상태 의미를 시각화하여 RNN의 내재된 의미적 구조를 드러내기 위해.
  • 안전 중심 영역에서 복잡한 딥러닝 모델을 대체하거나 설명하는 데 해석 가능한 모델(예: FSA)의 실현 가능성을 탐색하기 위해.

제안 방법

  • 게이팅 RNN의 은닉 상태를 클러스터링(키-민스 및 스펙트럴 클러스터링)을 적용하여 이산 상태로 그룹화함으로써 FSA 구조를 형성한다.
  • 학습 시퀀스에 대한 추론 중 관찰된 상태 전이를 기반으로 FSA 전이 규칙을 구성한다.
  • 동일한 RNN에서 학습된 여러 FSA 모델 간의 다수결 투표를 통해 정확성과 강건성을 향상시킨다.
  • 감성 분류 작업에서 FSA를 훈련 및 평가하여 원본 RNN과의 성능를 비교한다.
  • 특히 상태 0에서 상태 1으로의 전이를 유도하는 단어를 식별함으로써 FSA 전이의 의미적 해석을 분석한다.
  • MGU, GRU, LSTM, SRN 등 다양한 RNN 유형 간의 FSA 성능를 비교하여 일반화 능력과 게이팅 영향을 평가한다.

실험 결과

연구 질문

  • RQ1게이팅 RNN의 은닉 상태에서 효과적으로 해석 가능한 유한 상태 기계(FSA)를 학습할 수 있는가?
  • RQ2학습된 FSA는 원본 RNN의 분류 성능을 얼마나 잘 재현하는가?
  • RQ3FSA 상태와 전이의 의미적 해석은 무엇인가, 특히 긍정 및 부정 감성어의 관점에서 어떻게 해석할 수 있는가?
  • RQ4RNN의 게이팅 수가 성능 및 학습된 FSA의 품질에 어떤 영향을 미치는가?
  • RQ5FSA는 안전 중심 응용 분야에서 신뢰할 수 있고 인간이 시뮬레이션할 수 있는 RNN의 대체 수 Mittel로 활용될 수 있는가?

주요 결과

  • MGU에서 유도된 FSA는 경쟁적인 성능를 기록했으며, 특히 LISOR-x 설정에서 다른 RNN 기반 FSA를 능가했다.
  • 여러 FSA를 조합한 앙상블 방법은 단일 FSA보다 성능을 향상시켰으며, LISOR-x에서는 다양한 RNN 유형에서 일관된 성능 향상을 보였다.
  • MGU에서 유도된 FSA에서 상태 0에서 상태 1으로의 전이는 긍정 감성어(예: 'wonderful', 'spectacular')에 의해 유도되는 것으로 밝혀졌다.
  • 부정 감성어(예: 'dullest', 'confusing')는 거부 상태로의 전이와 연관되어 있어 FSA 내에서 의미적 군집화가 이루어졌음을 시사한다.
  • 여러 FSA는 상호 보완적인 의미적 커버리지를 보였으며, 개별 FSA는 부분적인 감성 어휘만을 포괄했지만 앙상블은 더 넓은 의미를 포괄했다.
  • 연구 결과, RNN의 게이팅 수가 핵심적임을 확인했으며, 게이팅 수가 적을수록(예: 하나의 게이팅을 가진 MGU) 성능이 향상됨을 시사하여 최소한의 게이팅 설계가 바람직하다는 결론을 내렸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.