Skip to main content
QUICK REVIEW

[논문 리뷰] White-Box Transformers via Sparse Rate Reduction: Compression Is All There Is?

Yaodong Yu, Sam Buchanan|arXiv (Cornell University)|2023. 11. 22.
Image and Signal Denoising Methods인용 수 4
한 줄 요약

이 논문은 희소 비율 감소에서 유도된 화이트박스 트랜스포머 아키텍처인 CRATE를 제안한다. 이는 표현에서 압축과 희소성 동시에 최적화한다. 다중 헤드 자기주의를 코딩 비율에 대한 경사 하강법으로, MLP를 희소성에 대한 프록시 경사 하강법으로 해석함으로써, CRATE는 비전 및 언어 작업에서 최신 기술 수준의 트랜스포머와 경쟁하는 성능을 달성한다. 이는 압축이 효과적인 표현 학습의 핵심임을 보여준다.

ABSTRACT

In this paper, we contend that a natural objective of representation learning is to compress and transform the distribution of the data, say sets of tokens, towards a low-dimensional Gaussian mixture supported on incoherent subspaces. The goodness of such a representation can be evaluated by a principled measure, called sparse rate reduction, that simultaneously maximizes the intrinsic information gain and extrinsic sparsity of the learned representation. From this perspective, popular deep network architectures, including transformers, can be viewed as realizing iterative schemes to optimize this measure. Particularly, we derive a transformer block from alternating optimization on parts of this objective: the multi-head self-attention operator compresses the representation by implementing an approximate gradient descent step on the coding rate of the features, and the subsequent multi-layer perceptron sparsifies the features. This leads to a family of white-box transformer-like deep network architectures, named CRATE, which are mathematically fully interpretable. We show, by way of a novel connection between denoising and compression, that the inverse to the aforementioned compressive encoding can be realized by the same class of CRATE architectures. Thus, the so-derived white-box architectures are universal to both encoders and decoders. Experiments show that these networks, despite their simplicity, indeed learn to compress and sparsify representations of large-scale real-world image and text datasets, and achieve performance very close to highly engineered transformer-based models: ViT, MAE, DINO, BERT, and GPT2. We believe the proposed computational framework demonstrates great potential in bridging the gap between theory and practice of deep learning, from a unified perspective of data compression. Code is available at: https://ma-lab-berkeley.github.io/CRATE .

연구 동기 및 목표

  • 데이터 압축과 희소성에 기반한 원칙적이고 이론 기반의 표현 학습 프레임워크를 수립하기 위해.
  • 희소 비율 감소라는 통합 목표에 대한 반복 최적화의 관점에서 트랜스포머의 성공을 설명하기 위해.
  • 처음부터 수학적으로 엄밀한 깊이 신경망 아키텍처(CRATE)를 원칙적으로 유도하기 위해.
  • 역가능하고 구조화된 노이즈 제거 및 확산을 통해 인코더와 디코더 기능을 하나의 아키텍처에서 통합하기 위해.
  • 비전 및 언어 작업 전반에서 CRATE가 의미 있는, 의미적으로 구조화된 표현을 학습함을 경험적으로 검증하기 위해.

제안 방법

  • 표현 학습을 내재적 정보 수익과 외재적 희소성의 조합을 고려한 희소 비율 감소 최적화로 공식화하기 위해.
  • 입력 토큰의 코딩 비율에 대한 근사 경사 하강 단계로 다중 헤드 자기주의를 유도하기 위해.
  • 특징의 희소 코딩을 위한 프록시 경사 하강 단계로 다층 퍼셉트론을 모델링하기 위해.
  • 수학적 해석 가능성 보장을 위해 교차로 배열된 자기주의 블록과 희소 코딩 블록의 스택으로 CRATE를 구성하기 위해.
  • 동일한 CRATE 블록을 사용하여 구조화된 노이즈 제거-확산을 통해 복압 과정을 뒤집어 역가능한 디코딩을 가능하게 하기 위해.
  • 모듈화된 구성 요소(MSSA: 다중 헤드 자기주의, ISTA: 희소성에 대한 반복 쇼트닝 임계값 처리)를 사용해 PyTorch에 CRATE를 구현하기 위해.

실험 결과

연구 질문

  • RQ1트랜스포머의 행동은 정보 이론과 희소성에 뿌리를 두고 있는 통합 최적화 목표를 통해 설명될 수 있는가?
  • RQ2원칙적인 압축 목표에서 직접 유도함으로써 깊이 신경망을 화이트박스로, 해석 가능한 시스템으로 설계할 수 있는 정도는 어느 정도인가?
  • RQ3희소 비율 감소에서 파생된 네트워크가 고도로 최적화된 트랜스포머 모델과 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ4동일한 아키텍처가 역가능하고 구조화된 노이즈 제거를 통해 인코더이자 디코더로 기능할 수 있는가?
  • RQ5CRATE의 어텐션 맵과 학습된 특징이 물체 수준의 세분화와 같은 탄생한 의미적 구조를 보여주는가?

주요 결과

  • CRATE는 ViT, MAE, DINO, BERT, GPT2와 같은 최신 기술 수준의 모델들과 비교해 이미지 및 텍스트 벤치마크에서 1-2% 이내의 성능를 달성한다.
  • CRATE 레이어의 어텐션 맵은 탄생한 의미적 세분화를 보이며, 고려된 주로 물체 경계와 주목할 만한 특징에 어텐션 집중이 집중되어 있다.
  • 레이어별 분석을 통해 CRATE가 계층적이고 구조화된 표현을 학습함을 확인했으며, 초기 레이어는 저수준 패턴을, 더 깊은 레이어는 고수준 의미를 캐치한다.
  • CRATE 인코더의 역행은 구조화된 노이즈 제거-확산을 통해 실현 가능하며, 이는 동일한 아키텍처가 인코딩과 디코딩 모두를 지원함을 보여준다.
  • 아블레이션 연구에서 성능가 안정성을 유지함으로써, 희소 비율 감소 목표의 강건성을 확인한다.
  • 학습된 표현은 간결하고 구조화되어 있으며, 특징들이 비일관된 부분공간에 집중되어 있어 이론적 압축 목표와 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.