[논문 리뷰] To go deep or wide in learning?
이 논문은 단일 무한 폭의 층을 사용하여 지도 학습에서 높은 성능을 달성하기 위해 공분산 아크余현 함수 커널을 사용하는 넓은 학습을 제안한다. 이는 깊은 신경망의 미세조정이 필요 없도록 한다. 제한된 버틀만 막대기(RBM)에서 공분산 행렬을 학습함으로써, MNIST 및 기울인 MNIST와 같은 벤치마크 데이터셋에서 얕은 모델과 깊은 유한 폭 모델을 모두 능가한다. 무작위 배경이 있는 MNIST에서 0.95%의 테스트 오차를 달성한다.
To achieve acceptable performance for AI tasks, one can either use sophisticated feature extraction methods as the first layer in a two-layered supervised learning model, or learn the features directly using a deep (multi-layered) model. While the first approach is very problem-specific, the second approach has computational overheads in learning multiple layers and fine-tuning of the model. In this paper, we propose an approach called wide learning based on arc-cosine kernels, that learns a single layer of infinite width. We propose exact and inexact learning strategies for wide learning and show that wide learning with single layer outperforms single layer as well as deep architectures of finite width for some benchmark datasets.
연구 동기 및 목표
- 깊은 신경망의 한계, 즉 높은 계산 비용과 하이퍼파ram터 조정 의존도를 해결하기 위해, 대체 학습 철학을 제안하는 것.
- 깊은 아키텍처에서의 미세조정이 필요 없도록, 단일 넓은 층에서 직접 특징을 학습하는 것.
- 아크余현 함수 커널을 사용한 단일 무한 폭 층이 얕은 모델과 깊은 유한 폭 모델을 모두 능가할 수 있음을 보여주는 것.
- 아크余현 함수 커널에 RBM에서 유도된 공분산 행렬을 통한 특징 학습이 불변성과 변동 요인의 분리에 효과적으로 기여하는지 보여주는 것.
제안 방법
- 단일 은닉 층의 무한 폭을 근사하는 커널 방법을 모델링하기 위해 아크余현 함수 커널 기반의 넓은 학습을 제안한다.
- 가중치 행렬을 학습하기 위해 제한된 버틀만 막대기(RBM)를 사용하며, 이로부터 공분산 행렬을 추출하여 커널에 적용한다.
- 복잡한 특징 표현을 포착하는 비모수적 커널 함수로 공분산 아크余현 함수 커널을 적용한다.
- 계산 비용을 줄이면서 성능을 유지하기 위해 정확한 및 비정확한 학습 전략을 도입한다.
- 최종 분류를 위해 넓은 층의 출력에 커널 방법(SVM 등)을 적용함으로써, 역전파 및 미세조정이 필요 없도록 한다.
- 층을 쌓을 경우 아크余현 함수 커널의 다중 조합과 동치임을 보여주지만, 오직 첫 번째 층만 학습된다.
실험 결과
연구 질문
- RQ1아크余현 함수 커널을 사용한 단일 무한 폭 층이 지도 학습 과제에서 얕은 모델과 깊은 유한 폭 모델을 모두 능가할 수 있는가?
- RQ2아크余현 함수 커널에 RBM에서 유도된 공분산 행렬을 적용하면, 표준 특징 추출 또는 깊은 신경망보다 더 나은 특징 표현이 가능한가?
- RQ3넓은 학습이 깊은 아키텍처에서 역전파 기반의 미세조정이 필요 없도록 할 수 있는가?
- RQ4벤치마크 데이터셋에서 DBN과 스택드 오토인코더와 같은 최신 기술 수준의 방법과 비교해 넓은 학습의 성능은 어떠한가?
주요 결과
- 공분산 아크余현 함수 커널은 무작위 배경이 있는 MNIST에서 0.95%의 테스트 오차를 기록하여 표 1에 나열된 모든 다른 방법보다 뛰어난 성능을 보였다.
- 기울인 MNIST에서 이 방법은 8.11%의 오차를 기록했으며, DBN의 12.30% 및 스택드 오토인코더의 11.43%보다 뚜렷이 우수했다.
- 볼록/오목 집합 데이터셋에서 이 방법은 17.02%의 오차를 기록했으며, 표에서 기록된 최고 성능과 동일했고, 표준 SVM 및 신경망보다 뛰어났다.
- 원본 MNIST에서 단일 넓은 층 모델은 단지 2개의 학습 에포크 후에 98.9%의 정확도를 달성하여 빠른 수렴을 보였다.
- 다중 층을 쌓아도 성능 향상이 없었으며, 이는 데이터의 불변성을 포착하기 위해 단일 넓은 층으로도 충분함을 시사한다.
- 튜닝이 필요한 하이퍼파ram터의 수를 줄여, 깊은 학습에서 흔히 발생하는 비용이 많이 드는 그리드 서치가 필요 없어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.