Skip to main content
QUICK REVIEW

[논문 리뷰] ALOFT: A Lightweight MLP-like Architecture with Dynamic Low-frequency Transform for Domain Generalization

Jintao Guo, Na Wang|arXiv (Cornell University)|2023. 03. 21.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 도메인 일반화를 위한 경량적인 MLP 유사 아키텍처인 ALOFT를 제안한다. ALOFT는 도메인 특화된 텍스처 특징을 억제하면서도 전반적인 구조적 표현을 유지함으로써 모델의 강건성을 향상시킨다. 주파수 영역 필터링과 학습 가능한 저주파 스펙트럼 편향 메커니즘을 활용하여, 이전의 CNN 기반 방법보다 훨씬 적은 파라미터로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Domain generalization (DG) aims to learn a model that generalizes well to unseen target domains utilizing multiple source domains without re-training. Most existing DG works are based on convolutional neural networks (CNNs). However, the local operation of the convolution kernel makes the model focus too much on local representations (e.g., texture), which inherently causes the model more prone to overfit to the source domains and hampers its generalization ability. Recently, several MLP-based methods have achieved promising results in supervised learning tasks by learning global interactions among different patches of the image. Inspired by this, in this paper, we first analyze the difference between CNN and MLP methods in DG and find that MLP methods exhibit a better generalization ability because they can better capture the global representations (e.g., structure) than CNN methods. Then, based on a recent lightweight MLP method, we obtain a strong baseline that outperforms most state-of-the-art CNN-based methods. The baseline can learn global structure representations with a filter to suppress structure irrelevant information in the frequency space. Moreover, we propose a dynAmic LOw-Frequency spectrum Transform (ALOFT) that can perturb local texture features while preserving global structure features, thus enabling the filter to remove structure-irrelevant information sufficiently. Extensive experiments on four benchmarks have demonstrated that our method can achieve great performance improvement with a small number of parameters compared to SOTA CNN-based DG methods. Our code is available at https://github.com/lingeringlight/ALOFT/.

연구 동기 및 목표

  • MLP와 CNN 아키텍처가 도메인 일반화 작업에서 성능 격차를 보이는 이유를 조사하는 것.
  • CNN의 본질적 텍스처 편향이 새로운 도메인으로의 일반화를 제한하는 이유를 해결하는 것.
  • 전반적인 구조 표현을 강화하면서 도메인 특화된 텍스처 특징을 억제하는 경량적이고 파라미터 효율적인 아키텍처를 개발하는 것.
  • 학습 중 다양한 도메인 시프트를 시뮬레이션하기 위해 동적 저주파 스펙트럼 변환을 설계하는 것.
  • 작고 효율적인 모델로 도메인 일반화 분야에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • 패치 간 자기주의 유사 메커니즘을 통해 전반적인 이미지 표현을 학습하는 경량적인 MLP 기반 백본(GFNet)을 기반으로 한다.
  • 전체적인 구조와 관련이 없는 도메인 특화 텍스처 정보를 억제하기 위해 주파수 도메인에 학습 가능한 필터를 도입한다.
  • 새로운 도메인 시프트를 시뮬레이션하기 위해 추정된 분포에서 재표본화하는 방식으로 저주파 성분을 변형하는 새로운 동적 저주파 스펙트럼 변환(ALOFT)을 제안한다.
  • 저주파 성분은 정규 분포를 사용하여 전반적인 구조를 유지하면서 다양한 현실적인 편향을 생성한다.
  • 학습 중 주파수 도메인 필터링과 동적 스펙트럼 증강을 적용하여 도메인 불변 특징 학습을 향상시킨다.
  • 표준 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 학습하며, 데이터 증강에 마스크 비율 0.5를 사용한다.

실험 결과

연구 질문

  • RQ1MLP 기반 아키텍처는 새로운 도메인으로의 일반화 능력에서 CNN과 어떻게 다를까?
  • RQ2왜 MLP 기반 모델은 CNN보다 도메인 일반화 작업에서 더 우수한 일반화 성능를 보이는가?
  • RQ3주파수 도메인 필터링이 도메인 특화된 텍스처 특징을 효과적으로 억제하면서도 전반적인 구조를 유지할 수 있는가?
  • RQ4동적 저주파 스펙트럼 편향이 도메인 시프트에 대한 강건성을 어떻게 향상시키는가?
  • RQ5경량적인 MLP 기반 모델이 더 적은 파라미터로 최신 기술 수준의 CNN 기반 도메인 일반화 방법을 초월할 수 있는가?

주요 결과

  • GFNet 백본을 사용하여 PACS 벤치마크에서 평균 정확도 91.58%를 기록하며, 기존의 SOTA CNN 기반 방법을 능가한다.
  • 예술, 만화, 스케치, 실세계 도메인 전반에서 일관된 성능 향상을 보이며, 특히 스케치와 예술 도메인에서 두드러진 성과를 기록한다.
  • 저주파 스펙트럼 노이즈 생성에 정규 분포를 사용할 경우, 균일 분포 및 무작위 노이즈 분포보다 더 우수한 성능을 기록한다.
  • 이미지 수준의 증강(Mixup, CutMix) 및 특징 수준의 증강(MixStyle, DSU) 방법과 비교해 동적 저주파 변환(ALOFT)이 모델의 일반화 능력을 크게 향상시킨다.
  • 작은 마스크 비율(0.5)에서도 강력한 성능 유지를 보이며, 과적합 없이 효과적인 데이터 증강이 가능함을 시사한다.
  • 주파수 분석 결과, MLP 기반 모델이 전반적인 구조를 더 잘 포착함을 확인하였으며, 이는 도메인 일반화 작업에서 뛰어난 일반화 성능의 핵심 요인임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.