Skip to main content
QUICK REVIEW

[논문 리뷰] Relaxing Equivariance Constraints with Non-stationary Continuous Filters

Tycho F. A. van der Ouderaa, David W. Romero|arXiv (Cornell University)|2022. 04. 14.
Machine Learning in Materials Science인용 수 6
한 줄 요약

이 논문은 절대 군 원소에 의존하는 비정적 연속 필터를 사용하여 신경망 내의 군 동치성의 매개변수 효율적이고 미분 가능한 이완을 제안한다. 이는 비동치성, 엄격한 동치성, 엄격한 불변성 맵핑 사이의 부드러운 보간을 가능하게 하며, 기울기 기반 학습을 통해 동치성 정도를 학습할 수 있도록 한다. 이로 인해 CIFAR-10 및 CIFAR-100에서 최신 기준 성능을 달성하며, 엄격한 동치성 및 부분 동치성 기반 모델보다 뛰어난 성능을 보인다.

ABSTRACT

Equivariances provide useful inductive biases in neural network modeling, with the translation equivariance of convolutional neural networks being a canonical example. Equivariances can be embedded in architectures through weight-sharing and place symmetry constraints on the functions a neural network can represent. The type of symmetry is typically fixed and has to be chosen in advance. Although some tasks are inherently equivariant, many tasks do not strictly follow such symmetries. In such cases, equivariance constraints can be overly restrictive. In this work, we propose a parameter-efficient relaxation of equivariance that can effectively interpolate between a (i) non-equivariant linear product, (ii) a strict-equivariant convolution, and (iii) a strictly-invariant mapping. The proposed parameterisation can be thought of as a building block to allow adjustable symmetry structure in neural networks. In addition, we demonstrate that the amount of equivariance can be learned from the training data using backpropagation. Gradient-based learning of equivariance achieves similar or improved performance compared to the best value found by cross-validation and outperforms baselines with partial or strict equivariance on CIFAR-10 and CIFAR-100 image classification tasks.

연구 동기 및 목표

  • 데이터가 가정된 대칭성을 엄격히 따르지 않을 경우 과도하게 제약적인 고정된 하드 대칭 제약 조건의 한계를 해결하기 위해.
  • 동치성 제약 조건을 손실 없이 부드럽게 이완할 수 있는 매개변수 효율적인 방법을 개발하기 위해.
  • 수동적인 초모수 조정을 위한 교차 검증을 피하기 위해, 데이터로부터 기울기 기반으로 동치성 정도를 종합적으로 학습하기 위해.
  • 학습된 동치성 이완이 CIFAR-10 및 CIFAR-100과 같은 이미지 분류 벤치마크에서 일반화와 성능 향상에 기여하는지 입증하기 위해.
  • 딥 러닝 모델 내에서 조정 가능한 대칭 구조를 위한 일반화 가능한 빌딩 블록을 제공하기 위해.

제안 방법

  • 표준 군 컨볼루션을 일반화하여 상대 군 원소와 군 내 절대 위치에 모두 의존하는 비정적 연속 필터를 도입함으로써 엄격한 동치성을 깨뜨림.
  • 군 원소의 푸리에 특징 매핑을 사용해 커널을 매개변수화함으로써, 공간적으로 변화하는 동시에 미분 가능하고 매개변수 효율적인 필터를 유지함.
  • 학습 중 백프로파게이션를 통해 학습 가능한 주파수 벡터 $\bm{\omega}'$ 가 동치성 정도를 제어하며, 이는 기울기 기반 최적화로 학습됨.
  • 증강된 데이터를 기반으로 한 정규화 항을 사용하여 대칭을 장려함. 이는 Augerino [4]와 유사하게 학습 안정성과 일반화 성능 향상에 기여함.
  • 비동치성(완전 연결형 유사), 엄격한 동치성(표준 군 컨볼루션), 엄격한 불변성 맵핑의 세 가지 영역 사이의 보간을 지원함.
  • 이산 커널에 비해 높은 매개변수 수를 피하는 연속 커널 공식화로 인해, 접근 가능하고 확장 가능한 접근이 가능함.

실험 결과

연구 질문

  • RQ1학습 가능한 동치성 제약 조건을 부드럽게 이완하면서도 대칭의 인덕티브 바이어스를 유지할 수 있는 신경망 레이어를 설계할 수 있는가?
  • RQ2기울기 기반 최적화를 통해 데이터로부터 동치성 정도를 효과적으로 학습할 수 있는가?
  • RQ3엄격한 대칭성이 잘못 지정된 경우, 동치성 이완이 이미지 분류 작업 성능 향상에 기여하는가?
  • RQ4고정 또는 부분 동치성 기반 모델과 비교해 본다면, 제안된 방법은 정확도 및 데이터 효율성 측면에서 어떤가?
  • RQ5제안된 비정적 필터는 딥 러닝 모델 내에서 조정 가능한 대칭을 위한 일반 목적의 빌딩 블록으로 사용될 수 있는가?

주요 결과

  • 제안된 방법은 동치성에 대한 최적의 교차 검증 초모수 선택보다 뛰어난 성능을 보이며, CIFAR-10 및 CIFAR-100에서 더 높은 테스트 정확도를 달성함.
  • CIFAR-100에서 학습된 이완 방법은 엄격한 동치성 모델보다 최대 10%p 높은 테스트 정확도를 기록함.
  • 학습된 $\bm{\omega}'$ 를 가진 모델은 강력한 증강 조건 하에서 CIFAR-10에서 89.69%의 정확도와 CIFAR-100에서 62.22%의 정확도를 달성하며, 부분 또는 엄격한 동치성 기반 모델을 모두 초월함.
  • 대칭 매개변수 $\bm{\omega}'$ 의 기울기 기반 학습은 교차 검증을 통한 초모수 조정과 비교해 성능이 유사하거나 뛰어남.
  • 비정적 연속 커널 공식화로 인해 이산 커널 매개변수화의 계산 비용이 과도한 문제를 피할 수 있었으며, 효율적인 학습이 가능함.
  • 비동치성, 엄격한 동치성, 엄격한 불변성 맵핑 사이의 성공적인 보간을 통해 대칭 제어의 유연성을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.