Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchically Compositional Tasks and Deep Convolutional Networks

Arturo Deza, Qianli Liao|arXiv (Cornell University)|2020. 06. 24.
Domain Adaptation and Few-Shot Learning참고 문헌 89인용 수 4
한 줄 요약

이 논문은 깊이 있는 합성곱 신경망(DCNs)이 특정 시각 작업에서 완전 연결 신경망보다 뛰어나게 성능을 내는 이유를 분석하기 위해 기능의 계층적 조합 구조의 역할을 조사한다. 국소적 이미지 구조를 파괴하기 위해 결정론적 스캐러빙을 적용한 결과, DCNs는 계층적 국소성이 있는 작업, 예를 들어 물체 인식에서 뛰어난 성능을 보였지만, 전역 색상 추정과 같은 비조합적 작업에서는 얕은 완전 연결 신경망이 더 뛰어나게 되었으며, 이는 아키텍처의 인덕티브 바이어스가 작업의 기능적 구조와 일치해야 한다는 것을 보여준다.

ABSTRACT

The main success stories of deep learning, starting with ImageNet, depend on deep convolutional networks, which on certain tasks perform significantly better than traditional shallow classifiers, such as support vector machines, and also better than deep fully connected networks; but what is so special about deep convolutional networks? Recent results in approximation theory proved an exponential advantage of deep convolutional networks with or without shared weights in approximating functions with hierarchical locality in their compositional structure. More recently, the hierarchical structure was proved to be hard to learn from data, suggesting that it is a powerful prior embedded in the architecture of the network. These mathematical results, however, do not say which real-life tasks correspond to input-output functions with hierarchical locality. To evaluate this, we consider a set of visual tasks where we disrupt the local organization of images via "deterministic scrambling" to later perform a visual task on these images structurally-altered in the same way for training and testing. For object recognition we find, as expected, that scrambling does not affect the performance of shallow or deep fully connected networks contrary to the out-performance of convolutional networks. Not all tasks involving images are however affected. Texture perception and global color estimation are much less sensitive to deterministic scrambling showing that the underlying functions corresponding to these tasks are not hierarchically local; and also counter-intuitively showing that these tasks are better approximated by networks that are not deep (texture) nor convolutional (color). Altogether, these results shed light into the importance of matching a network architecture with its embedded prior of the task to be learned.

연구 동기 및 목표

  • 실제 시각 작업 중에서 계층적 국소성이라는 핵심 구조적 특성을 가지는 함수와 관련된 작업을 특정하기 위해, 깊이 있는 합성곱 신경망의 지수적 근사 우월성의 근거가 되는 성질을 규명한다.
  • 물체 인식에서 깊이 있는 합성곱 신경망의 성공이 계층적 조합성에 대한 아키텍처의 인덕티브 바이어스 때문인지 평가한다.
  • 계층적 구조가 없는 작업, 예를 들어 전역 색상 추정이나 질감 인식과 같은 작업은 비합성곱 또는 얕은 아키텍처에 의해 더 잘 근사될 수 있다는 가설을 시험한다.
  • 결정론적 스캐러빙을 통해 이미지 구조를 파괴하고 다양한 아키텍처 간의 성능 변화를 측정함으로써 깊이 있는 합성곱 신경망의 한계를 조사한다.
  • 이론적 결과에 대한 경험적 검증을 제공하여, DCNs가 항상 우월한 것은 아니며, 작업에 따라 기능적 구조에 따라 달라진다는 것을 보여준다.

제안 방법

  • 이미지의 국소적 공간 조직을 파괴하면서도 구조적 일관성을 유지하기 위해 결정론적 스캐러빙을 적용하여 학습 및 테스트에 사용한다.
  • 동일한 작업에 대해 세 가지 아키텍처를 학습하고 평가: 깊이 있는 합성곱 신경망(예: ThreeConvNet, VGG11), 얕은 완전 연결 신경망(SFCN), 넓은 완전 연결 신경망(Wide-Net), 깊은 완전 연결 신경망(Deep-Net).
  • 전역 색상 추정 작업에서 평균 제곱오차(MSE) 손실을 사용하여 학습하고, 다양한 스캐러빙 수준에서의 근사 오차를 측정한다.
  • 이미지 스캐러빙 정도에 따라 아키텍처 간 성능를 비교하여 국소 구조 상실에 대한 민감도를 평가한다.
  • 특히 계층적 국소 함수에 대해 깊이 있는 합성곱 신경망의 지수적 파rameter 효율성에 기반한 이론적 결과를 실험 설계의 프레임워크로 활용한다.
  • CIFAR-100 데이터셋을 사용하여 물체 인식 및 색상 추정 작업을 수행하며, 원본 이미지와 스캐러빙된 이미지를 학습 및 테스트에 모두 사용한다.

실험 결과

연구 질문

  • RQ1어느 시각 작업이 본질적으로 계층적 조합적이며, 따라서 깊이 있는 합성곱 신경망의 인덕티브 바이어스에서 유의미한 이점을 얻을 수 있는가?
  • RQ2이미지 구조의 결정론적 스캐러빙이 다양한 시각 작업에서 깊이 있는 합성곱 신경망과 완전 연결 신경망의 성능에 어떤 영향을 미치는가?
  • RQ3계층적 국소성이 없는 작업, 예를 들어 전역 색상 추정이나 질감 인식은 비합성곱 또는 얕은 아키텍처에 의해 더 잘 수행되는가?
  • RQ4네트워크의 아키텍처 인덕티브 바이어스가 목표 작업의 기능적 구조와 얼마나 잘 일치하는가?
  • RQ5통제된 이미지 조작을 통해 깊이 있는 합성곱 신경망이 계층적 국소 함수를 근사하는 데 가지는 이론적 우월성이 경험적으로 검증될 수 있는가?

주요 결과

  • 결정론적 스캐러빙 이후에도 깊이 있는 합성곱 신경망은 얕은 완전 연결 신경망보다 물체 인식 작업에서 뚜렷한 성능 우월성을 보이며, 이는 계층적 국소성에 의존한다는 것을 확인한다.
  • 얕은 완전 연결 신경망은 깊이 있는 합성곱 신경망보다 전역 색상 추정에서 더 낮은 평균 제곱오차를 기록하여, 색상 추정 작업이 계층적으로 구성되어 있지 않으며 단순한 아키텍처에 의해 유리하게 근사된다는 것을 시사한다.
  • 넓은 완전 연결 신경망은 깊은 완전 연결 신경망과 깊이 있는 합성곱 신경망 모두를 능가하여 색상 추정에서 뛰어난 성능을 보이며, 이는 비합성곱 아키텍처에서의 능력 증가가 전역적이고 비조합적 기능을 더 잘 근사할 수 있음을 시사한다.
  • 이미지 스캐러빙으로 국소 구조가 파괴됨에 따라 깊이 있는 합성곱 신경망의 성능가 얕은 완전 연결 신경망의 성능에 점점 수렴함을 보여주며, 이는 DCNs가 국소성을 조차도 파악하려는 경향이 있음을 시사한다.
  • ThreeConvNet은 질감 인식에서는 높은 성능를 보였지만, 색상 추정에서는 완전 연결 신경망에 비해 성능이 열 劣하여, 합성곱 인덕티브 바이어스가 전역적이고 국소적이지 않은 작업에는 최적화되어 있지 않다는 것을 확인한다.
  • 결과적으로 이론적 주장, 즉 깊이 있는 합성곱 신경망이 계층적 국소 함수에 대해서만 지수적 근사 우월성을 가진다는 것을 경험적으로 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.