Skip to main content
QUICK REVIEW

[논문 리뷰] From Discrete to Continuous Convolution Layers

Assaf Shocher, Ben Feinstein|arXiv (Cornell University)|2020. 06. 19.
Advanced Image Processing Techniques참고 문헌 16인용 수 10
한 줄 요약

이 논문은 서브픽셀 좌표 상에서 필터를 연속 함수로 모델링하는, 표준 이산 컨볼루션의 미분 가능 일반화인 연속 컨볼루션(CC) 레이어를 소개한다. 기존 레이어가 정수 스트라이드와 고정된 스케일 요소에 제한되는 것과 달리, CC 레이어는 임의의 공간 크기—비정수 스케일과 축 별로 다른 스케일을 포함—로 특징 맵의 학습 가능한 동적 크기 조정을 가능하게 하여 이동 등변성과 스케일 간 일반화를 향상시킨다.

ABSTRACT

A basic operation in Convolutional Neural Networks (CNNs) is spatial resizing of feature maps. This is done either by strided convolution (donwscaling) or transposed convolution (upscaling). Such operations are limited to a fixed filter moving at predetermined integer steps (strides). Spatial sizes of consecutive layers are related by integer scale factors, predetermined at architectural design, and remain fixed throughout training and inference time. We propose a generalization of the common Conv-layer, from a discrete layer to a Continuous Convolution (CC) Layer. CC Layers naturally extend Conv-layers by representing the filter as a learned continuous function over sub-pixel coordinates. This allows learnable and principled resizing of feature maps, to any size, dynamically and consistently across scales. Once trained, the CC layer can be used to output any scale/size chosen at inference time. The scale can be non-integer and differ between the axes. CC gives rise to new freedoms for architectural design, such as dynamic layer shapes at inference time, or gradual architectures where the size changes by a small factor at each layer. This gives rise to many desired CNN properties, new architectural design capabilities, and useful applications. We further show that current Conv-layers suffer from inherent misalignments, which are ameliorated by CC layers.

연구 동기 및 목표

  • 표준 컨볼루션 레이어의 공간 크기 조정 한계를 해결하기 위해, 정수 스케일 요소와 고정된 스트라이드에 제한되는 것을 방지한다.
  • 스트라이드 컨볼루션에서 발생하는 본질적인 비일치성과 앨리어싱 효과로 인한 이동 등변성 저하 문제를 해결한다.
  • 추론 시점에 학습 가능한 동적 크기 조정을 가능하게 하여, 비정수 스케일 및 축 별로 다른 스케일 요소를 포함한 특징 맵의 크기 조정을 실현한다.
  • 기존의 비정규격 포인트 클라우드에 대한 연속 컨볼루션 방법을 정규격 격자로 일반화하여, 원칙적인, 엔드 투 엔드 학습 가능한 크기 조정을 가능하게 한다.
  • CC 레이어가 점진적 아키텍처나 동적 스케일 앙상블과 같은 새로운 아키텍처 설계를 지원할 수 있음을 보여준다.

제안 방법

  • 서브픽셀 좌표 상에서 학습 가능한 연속 함수로 필터를 표현하여, 비정수 위치 간의 보간 기반 필터링을 가능하게 한다.
  • 연속 필터를 이산 입력에 적용하여 연속적인 중간 특징 표현을 생성한다.
  • 다른 스케일의 크기를 갖는 임의의 크기의 이산 출력 특징 맵을 생성하기 위해, 미분 가능한 재샘플링 격자를 사용해 연속 표현을 재샘플링한다.
  • 출력 크기를 추론 시점에 재샘플링 격자를 통해 지정함으로써, 연속 필터를 경량 경량 경사 하강법을 통해 엔드 투 엔드로 학습한다.
  • 재샘플링에 cubic 보간을 사용하고, 연속 필터 및 재샘플링 과정 전파에 대해 역전파를 수행한다.
  • 동적 스케일 앙상블을 도입하기 위해, 동일한 학습된 CC 네트워크에 대해 추론 시 다양한 스케일 순서를 적용하고, 예측값을 평균 내어 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1특징 맵의 임의의 공간 크기(비정수 스케일 요소 포함)로 가능한, 미분 가능한 학습 가능한 크기 조정을 허용하는 컨볼루션 레이어를 일반화할 수 있는가?
  • RQ2서브픽셀 좌표 상에서 컨볼루션을 연속 함수로 모델링할 경우, 기존의 스트라이드 컨볼루션 대비 이동 등변성이 향상되는가?
  • RQ3단일 CC 레이어가 추론 시에 하나의 스케일로만 학습되었더라도, 여러 스케일 요소로 일반화 가능한가?
  • RQ4표준 컨볼루션에서 존재하는 본질적인 입력-출력 비일치 현상은 CC 레이어로 얼마나 감소되는가?
  • RQ5CC 레이어가 점진적 스케일링이나 동적 스케일 앙상블과 같은 새로운 아키텍처 패러다임을 가능하게 할 수 있는가?

주요 결과

  • CC 레이어는 표준 컨볼루션보다 유의미하게 높은 이동 등변성을 달성한다: CIFAR-10 이미지에서 ±4 픽셀 이동에 대해, 이동된 특징 맵과 정렬된 특징 맵 간 코사인 유사도가 기준값 0.78에서 0.85로 상승했다.
  • 단일 스케일(1/2)에서 학습된 CC 네트워크는 다른 스케일로 일반화하는 데에 매우 열악했으며, 100개의 미사용 스케일에서 테스트 오차가 100배 높아, 일반화를 위해서는 명시적인 스케일에 강건한 학습이 필요하다는 것을 시사했다.
  • 비정수 내부 스케일 요소를 사용해 학습된 CC 네트워크는 추론 시 동적 스케일 앙상블을 가능하게 하여, 2개 모델로 +1.7%의 CIFAR-10 정확도 향상과 3개 모델로 +2.4% 향상을 달성했다.
  • 첫 번째 실험에서 학습된 연속 필터는 기준값 커널과 밀도적으로 유사했지만, 두 번째 실험(단일 스케일에서 학습)에서는 왜곡된 커널을 생성했으며, 이는 스케일에 강건한 학습의 필요성을 확인했다.
  • CC 레이어는 이산 스트라이드로 인한 앨리어싱을 피함으로써 표준 컨볼루션의 본질적 비일치를 해결하여 진정한 이동 등변성을 가능하게 한다.
  • CC 기반 슈퍼리졸루션 네트워크는 단일 학습 모델로도 임의의 스케일 요소(비정수 및 축 별로 다를 수 있음)를 지원할 수 있어, 각 스케일마다 별도의 모델이 필요 없게 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.