Skip to main content
QUICK REVIEW

[논문 리뷰] Which Learning Algorithms Can Generalize Identity-Based Rules to Novel Inputs?

Paul Tupper, Bobak Shahriari|arXiv (Cornell University)|2016. 05. 12.
Neural Networks and Applications인용 수 6
한 줄 요약

이 논문은 학습 알고리즘이 새로운 입력에 대해 신규로 도출된 정규식 기반 규칙—예를 들어 단어 내 동일한 요소 두 개가 필요로 하는 규칙—을 일반화하지 못하는 경우를 결정하기 위한 형식적 프레임워크를 제안한다. 이는 대칭성에 대한 불변성을 가지는 알고리즘, 특히 로컬리스트 및 분산 표현 방식을 사용하는 다층 피드포워드 신경망과 같은 알고리즘들이 거의 모든 가능한 입력에 대해 훈련되지 않는 한 그러한 규칙을 학습할 수 없음을 증명함으로써, 심층 학습 모델이 구조적 깊이를 지니고 있음에도 불구하고 대수적 일반화에 어려움을 겪는 이유를 설명한다.

ABSTRACT

We propose a novel framework for the analysis of learning algorithms that allows us to say when such algorithms can and cannot generalize certain patterns from training data to test data. In particular we focus on situations where the rule that must be learned concerns two components of a stimulus being identical. We call such a basis for discrimination an identity-based rule. Identity-based rules have proven to be difficult or impossible for certain types of learning algorithms to acquire from limited datasets. This is in contrast to human behaviour on similar tasks. Here we provide a framework for rigorously establishing which learning algorithms will fail at generalizing identity-based rules to novel stimuli. We use this framework to show that such algorithms are unable to generalize identity-based rules to novel inputs unless trained on virtually all possible inputs. We demonstrate these results computationally with a multilayer feedforward neural network.

연구 동기 및 목표

  • 학습 알고리즘이 새로운 입력에 대해 정규식 기반 규칙을 일반화하지 못할 조건을 형식적으로 기준화하는 것.
  • 표준 신경망과 같은 알고리즘이 그러한 규칙을 학습하지 못하는 데 핵심적인 구조적 제약 조건인 대칭성 불변성을 규명하는 것.
  • 새로운 세그먼트가 등장할 경우 심층 피드포워드 네트워크조차도 정규식 기반 문법을 일반화하지 못함을 보여주는 것.
  • 알고리즘적 제약 조건과 인간과 유사한 일반화 방식을 대조하여, 일부 실험 참가자들이 제한된 훈련 데이터에서 정규식 규칙을 쉽게 유추할 수 있음을 보여주는 것.
  • 이전에 비형식적으로 제기된 '변수 인스턴스화'와 '훈련 공간 외부 일반화'에 대한 주장에 엄밀한 형식적 기반을 제공하는 것.

제안 방법

  • 저자는 학습 알고리즘을 훈련 데이터에서 모델 파라미터로 매핑하는 함수로 정의한 후, 새로운 입력에 대한 출력 점수를 계산한다.
  • 대칭성 불변성 개념을 도입한다: 알고리즘이 특정 변환에 대해 불변이라면, 입력이 그 변환을 거쳐도 출력이 동일하게 유지된다.
  • 핵심 이론적 결과는 알고리즘과 훈련 데이터가 모두 어떤 대칭성에 대해 불변이라면, 그 대칭성을 깨는 문법을 학습할 수 없다는 것이다.
  • 논문은 이 프레임워크를 정규식 기반 규칙에 적용하여, 그러한 규칙이 존중하지 않는 특정 대칭성(동일한 세그먼트의 순서 뒤바꿈)을 규명한다.
  • 프레임워크는 로컬리스트 및 분산 표현 방식을 사용하는 다층 피드포워드 신경망을 사용하여 계산적으로 검증되며, 이는 이중 문자 단어 작업에 적용된다 (k=26).
  • 실험은 L-BFGS 최적화를 사용하며, 1~3개의 은닉층(256~1024개 유닛)을 사용하고, YY, ZZ, YZ, ZY와 같은 새로운 입력에 대한 점수를 평가한다.

실험 결과

연구 질문

  • RQ1학습 알고리즘이 새로운 입력에 대해 정규식 기반 규칙을 일반화하지 못할 조건는 무엇인가?
  • RQ2심층 아키텍처를 지닌 표준 연결주의 모델과 피드포워드 신경망이 정규식 기반 규칙을 학습하지 못하는 이유는 무엇인가?
  • RQ3정규식 기반 규칙을 일반화할 수 있는지 여부를 구분할 수 있는 형식적 기준은 무엇인가?
  • RQ4알고리즘의 대칭성 불변성이 광범위한 훈련을 거친 후에도 비불변 문법을 학습하지 못하게 하는 이유는 무엇인가?
  • RQ5분산 표현 방식이나 가중치 공유가 신경망의 이러한 근본적 제약 조건을 극복할 수 있는가?

주요 결과

  • 로컬리스트 표현 방식을 사용하는 신경망은 YY와 같은 문법적 단어와 YZ와 같은 비문법적 단어 모두에게 유사한 점수(~0.3–0.5)를 부여하여 정규식 기반 규칙을 구분하지 못한다.
  • 분산 표현 방식을 사용하더라도 네트워크는 YY와 YZ 모두에게 높은 점수(>0.5)를 제공하여 새로운 입력에서 문법적과 비문법적 요소를 구분하지 못한다.
  • 은닉층을 더 추가함(최대 3개)해도 일반화 능력 향상이 없으며, YY, ZZ, YZ, ZY에 대한 점수는 통계적으로 구분되지 않는다.
  • 실패 원인은 입력 표현 방식 때문만은 아니며, 로컬리스트 및 분산 표현 방식 모두에서 동일한 열악한 성능이 유지된다.
  • 이론적 분석은 세그먼트 순서 뒤바꿈 대칭성에 대해 불변인 모든 알고리즘이, 그 대칭성을 깨는 훈련 데이터가 없는 한 정규식 기반 규칙을 학습할 수 없다는 것을 확인한다.
  • 심층 학습 아키텍처는 능력이 크지만, 대수적 규칙 일반화의 이론적 근본적 제약 조건인 대칭성 기반 제약 조건을 극복하지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.