[논문 리뷰] Less is More: Focus Attention for Efficient DETR
Focus-DETR는 다중 스케일, 상향식 스코어링 전략을 사용하여 배경 및 세밀한 물체 토큰에 대해 선택적으로 집중하는 이중 주의 메커니즘을 제안한다. 이로 인해 COCO에서 30% 적은 쿼리로 50.4 AP를 달성하며, 최신의 희소 DETR 모델과 유사한 계산 비용을 유지하면서 효율성과 정확도의 상호 균형을 크게 향상시킨다.
DETR-like models have significantly boosted the performance of detectors and even outperformed classical convolutional models. However, all tokens are treated equally without discrimination brings a redundant computational burden in the traditional encoder structure. The recent sparsification strategies exploit a subset of informative tokens to reduce attention complexity maintaining performance through the sparse encoder. But these methods tend to rely on unreliable model statistics. Moreover, simply reducing the token population hinders the detection performance to a large extent, limiting the application of these sparse models. We propose Focus-DETR, which focuses attention on more informative tokens for a better trade-off between computation efficiency and model accuracy. Specifically, we reconstruct the encoder with dual attention, which includes a token scoring mechanism that considers both localization and category semantic information of the objects from multi-scale feature maps. We efficiently abandon the background queries and enhance the semantic interaction of the fine-grained object queries based on the scores. Compared with the state-of-the-art sparse DETR-like detectors under the same setting, our Focus-DETR gets comparable complexity while achieving 50.4AP (+2.2) on COCO. The code is available at https://github.com/huawei-noah/noah-research/tree/master/Focus-DETR and https://gitee.com/mindspore/models/tree/master/research/cv/Focus-DETR.
연구 동기 및 목표
- 표준 DETR 인코더의 높은 계산 비용 문제를 해결하기 위해, 모든 토큰을 동일하게 취급하는 기존 방식을 개선하고자 한다.
- 기존의 희소 DETR 방법들이 토큰 선택에 신뢰할 수 없는 주의 맵에 의존하는 한계를 극복하고자 한다.
- 세부 물체 쿼리에 대한 선택적 강화를 통해 정확도를 향상시키고, 배경 토큰 처리를 줄이고자 한다.
- 강력한 다수준 토큰 스코어링 메커니즘을 통해 모델의 효율성과 정확도의 균형을 개선하고자 한다.
- 최소한의 계산 오버헤드로 특징 정제를 향상시키는 캐스케이드형 이중 주의 인코더를 설계하고자 한다.
제안 방법
- 지오메트릭 위치와 카테고리 의미를 기반으로 토큰을 스코어링하는 데 사용할 수 있는 학습 가능한 레이블과 다중 스케일 특징 맵을 사용하는 배경 토큰 선택기(FTS)를 도입한다.
- 상향식 스코어 조절 기법을 적용하여 고수준 특징 스코어가 저수준의 배경 확률 예측을 정밀하게 보정함으로써 선택의 신뢰성을 향상시킨다.
- 다중 카테고리 스코어 예측기 설계를 통해 동시에 전경 가능성과 의미적 특이성을 평가하여 세밀한 토큰 선택을 가능하게 한다.
- 이중 주의를 사용하여 인코더를 재구성한다: 하나는 배경이 제거된 전경 토큰을 위한 것이고, 다른 하나는 향상된 세밀한 쿼리 토큰을 위한 것으로, 장거리 특징 상호작용을 향상시킨다.
- 인코더 레이어 전반에 걸쳐 캐스케이드 구조를 적용하여 전경 토큰 수를 점진적으로 감소시키면서도 오류 내성과 성능 유지에 기여한다.
- 디코더에서의 교차 주의 맵을 약한 감독 신호로만 사용하며, 토큰 선택에 의존하는 기존 방식을 더 견고한 다중 스케일 의미 스코어링 메커니즘으로 대체한다.
실험 결과
연구 질문
- RQ1다중 스케일, 상향식 스코어링 메커니즘이 희소 DETR 모델에서 토큰 선택의 신뢰성을 향상시킬 수 있는가?
- RQ2의미 인식 스코어링을 통해 세밀한 물체 토큰에 집중함으로써 계산 비용을 증가시키지 않고도 정확도를 향상시킬 수 있는가?
- RQ3선택적 토큰 처리와 결합된 인코더 내 이중 주의가 특징 표현을 어떻게 향상시키는가?
- RQ4캐스케이드형 토큰 프루닝 전략은 활성 토큰 수를 점진적으로 감소시키면서도 성능을 유지할 수 있는가?
- RQ5제안된 방법은 최신의 희소 DETR 모델과 정확도, 계산 비용, 견고성 측면에서 어떻게 비교되는가?
주요 결과
- Focus-DETR는 원래 쿼리 수의 30%만으로 COCO에서 50.4 AP를 달성하였으며, 기준 모델인 Deformable DETR 대비 +2.2 AP 향상되었다.
- 128 GFLOPs에서 Focus-DETR는 Sparse DETR보다 +2.7 AP, DINO에 Sparse DETR 전략을 적용한 경우보다 +1.4 AP를 기록하여 유사한 계산 예산에서도 슈퍼리오어 성능을 보였다.
- 이중 주의 메커니즘이 +0.8 AP 기여를 하여, 향상된 세밀한 토큰 상호작용이 탐지 성능 향상에 크게 기여한다는 것을 입증했다.
- 상향식 스코어 조절 전략은 하향식 조절 대비 0.2 AP 향상을 이끌어내어 고수준 의미 지침이 저수준 선택에 효과적임을 입증했다.
- 인코더 내 캐스케이드 구조는 오류 내성을 향상시키며 +0.5 AP의 성능 향상을 이끌어내어 점진적 정제의 유용성을 보여주었다.
- Focus-DETR는 128 GFLOPs에서 23.7 FPS의 높은 추론 속도를 유지하면서도 최신 기준의 정확도를 확보하여 효율성과 확장성의 우수성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.