Skip to main content
QUICK REVIEW

[논문 리뷰] Local-to-Global Self-Attention in Vision Transformers

Jinpeng Li, Yichao Yan|arXiv (Cornell University)|2021. 07. 10.
Infrared Target Detection Methodologies참고 문헌 59인용 수 22
한 줄 요약

이 논문은 각 스테이지 내에서 다중 스케일에서 국소에서 전역으로의 특징 추론을 가능하게 하는 다중 경로 자기주의 메커니즘인 LG-Transformer를 제안한다. 원본 해상도의 1/8(국소), 1/16(중간 수준), 1/32(전역)로 다운스케일된 특징 맵에 창 기반 다중 헤드 자기주의(W-MSA)를 적용함으로써, 모델은 국소 세부 정보와 전역 맥락을 효율적으로 포착한다. 이로 인해 FLOP 증가가 최소한이지만 ImageNet에서 Top-1 정확도가 0.9% 향상되고, ADE20K에서 mIoU가 0.8% 향상된다.

ABSTRACT

Transformers have demonstrated great potential in computer vision tasks. To avoid dense computations of self-attentions in high-resolution visual data, some recent Transformer models adopt a hierarchical design, where self-attentions are only computed within local windows. This design significantly improves the efficiency but lacks global feature reasoning in early stages. In this work, we design a multi-path structure of the Transformer, which enables local-to-global reasoning at multiple granularities in each stage. The proposed framework is computationally efficient and highly effective. With a marginal increasement in computational overhead, our model achieves notable improvements in both image classification and semantic segmentation. Code is available at https://github.com/ljpadam/LG-Transformer

연구 동기 및 목표

  • 국소 자기주의로 인해 초기 스테이지에서 전역 추론 능력이 부족한 계층적 Vision Transformers의 한계를 해결하기 위해.
  • 한 개의 효율적인 아키텍처 안에서 CNN의 국소 인덕티브 바이어스와 Transformer의 전역 모델링 능력을 통합하기 위해.
  • 계산 비용을 크게 증가시키지 않고 이미지 분류 및 세그멘테이션 성능을 향상시키기 위해.
  • 다양한 스케일에서의 다중 해상도 자기주의 경로가 특징 표현을 향상시키는 데 효과적인지 검증하기 위해.

제안 방법

  • 원본 해상도의 1/8, 1/16, 1/32로 다운샘플된 특징 맵을 다중 스케일로 사용하는 다중 경로 자기주의 모듈을 설계한다.
  • 각 스케일에 대해 독립적으로 창 기반 다중 헤드 자기주의(W-MSA)를 적용하여 국소 및 전역 의존성을 모델링한다.
  • 각 스테이지에서 모든 경로의 특징을 융합하여 더 구분력 있는 표현을 형성한다.
  • Swin Transformer를 영감으로 삼은 계층적 Transformer 아키텍처를 사용하지만, 각 블록에 다중 자기주의 경로를 확장한다.
  • 전역 자기주의를 가장 작은 스케일(1/32)에만 제한함으로써 계산 효율성을 유지한다. 이는 전역 계산 비용을 감소시킨다.
  • 새로운 연산을 도입하지 않아서 호환성과 통합 용이성을 확보한다.

실험 결과

연구 질문

  • RQ1다양한 해상도에서 국소-전역 특징 추론이 높은 계산 비용 없이 Vision Transformers의 성능 향상에 기여할 수 있는가?
  • RQ2단일 경로 국소 자기주의와 비교할 때 다중 경로 자기주의는 수렴성과 정확도 측면에서 어떻게 다른가?
  • RQ3국소 및 전역 자기주의 경로를 결합하면 이미지 분류 및 세그멘테이션에서 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ4성능 향상에 기여하기 위해 다중 경로 블록을 스테이지에 어떻게 배치하는 것이 최적인가?
  • RQ5모델의 추론 속도는 표준 단일 경로 Transformer와 비교해 어떻게 되는가?

주요 결과

  • LG-Transformer는 FLOPs 증가가 미미한 상태에서 ImageNet-1K 분류에서 Swin-Transformer보다 Top-1 정확도가 0.9% 높다.
  • ADE20K 세그멘테이션 벤치마크에서 LG-Transformer는 Swin-T*보다 mIoU를 0.8% 향상시켜 유사한 파라미터 수와 FLOP 예산에서도 경쟁적인 성능을 달성한다.
  • 기본 모델보다 빠른 수렴 속도를 보이며, 더 낮은 훈련 손실과 더 높은 검증 정확도를 달성함으로써 최적화 안정성이 향상됨을 시사한다.
  • 정성적 분석 결과, 국소 자기주의 맵(1/8 및 1/16 스케일)에는 명확한 불연속성이 나타나지만, 전역 자기주의(1/32 스케일)는 통합된 전체 이미지 맥락을 잘 포착한다.
  • 더 많은 스테이지에 LG-Attention 블록을 추가할수록 검증 성능과 훈련 수렴성이 일관되게 향상되며, 다중 경로 설계의 유용성을 입증한다.
  • 정확도 향상에도 불구하고 다중 경로 구조로 인해 추론 속도가 단일 경로 대비 느리므로, 정확도와 속도 사이의 상충 관계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.