[논문 리뷰] Boosting Salient Object Detection with Transformer-based Asymmetric Bilateral U-Net
이 논문은 시각 트랜스포머를 활용한 전역적 맥락 모델링과 경량 CNN를 활용한 국소적 세부 정보 학습을 동시에 고려하는 트랜스포머 기반 이방향 비대칭 U-Net인 ABiU-Net을 제안한다. 이중 인코더 및 디코더 경로를 통해 상호 작용하는 특징을 융합함으로써 ABiU-Net은 여러 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 전역-국소 표현 학습의 상호 보완성을 통해 이전 방법들을 능가한다.
Existing salient object detection (SOD) methods mainly rely on U-shaped convolution neural networks (CNNs) with skip connections to combine the global contexts and local spatial details that are crucial for locating salient objects and refining object details, respectively. Despite great successes, the ability of CNNs in learning global contexts is limited. Recently, the vision transformer has achieved revolutionary progress in computer vision owing to its powerful modeling of global dependencies. However, directly applying the transformer to SOD is suboptimal because the transformer lacks the ability to learn local spatial representations. To this end, this paper explores the combination of transformers and CNNs to learn both global and local representations for SOD. We propose a transformer-based Asymmetric Bilateral U-Net (ABiU-Net). The asymmetric bilateral encoder has a transformer path and a lightweight CNN path, where the two paths communicate at each encoder stage to learn complementary global contexts and local spatial details, respectively. The asymmetric bilateral decoder also consists of two paths to process features from the transformer and CNN encoder paths, with communication at each decoder stage for decoding coarse salient object locations and fine-grained object details, respectively. Such communication between the two encoder/decoder paths enables AbiU-Net to learn complementary global and local representations, taking advantage of the natural merits of transformers and CNNs, respectively. Hence, ABiU-Net provides a new perspective for transformer-based SOD. Extensive experiments demonstrate that ABiU-Net performs favorably against previous state-of-the-art SOD methods. The code is available at https://github.com/yuqiuyuqiu/ABiU-Net.
연구 동기 및 목표
- 장거리 전역 의존성을 모델링하는 데에 한계가 있는 CNN 기반 초점 대상 검출 방법의 문제를 해결한다.
- 순수한 트랜스포머 기반 SOD 접근 방식에서의 국소 표현 학습 부족 문제를 해결한다.
- 시각 트랜스포머와 CNN의 강점을 상호보완적으로 융합하여 향상된 초점성 검출을 위한 통합 아키텍처를 개발한다.
- 효과적인 상호 경로 특징 통신을 가능하게 하는 이중 경로 인코더-디코더 구조를 설계하여 보완적 특징 학습을 실현한다.
- 경량이며 종단 간 훈련 가능한 아키텍처를 통해 표준 SOD 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 전역 맥락 모델링을 위한 시각 트랜스포머 경로(TEncPath)와 국소 공간 세부 정보 학습을 위한 경량 CNN 경로(HEncPath)를 갖는 이방향 이중 인코더를 제안한다.
- 각 인코더 단계에서 양 경로의 특징을 연결하고 처리하여 보완적 표현 학습을 향상시키는 상호 경로 특징 상호작용을 도입한다.
- 거친 초점성 맵과 세밀한 세부 정보를 각각 별도의 트랜스포머 및 CNN 경로(TDecPath 및 HDecPath)를 갖는 이방향 이중 디코더를 설계한다.
- 특징의 구분 능력을 향상시키기 위해 트랜스포머 경로의 최종 디코더 단계에 깊은 감독을 구현한다. 이는 과적합을 유발하지 않으면서도 효과적이다.
- 양 경로의 계층적 특징을 통합하기 위해 디코더에서 다중 척도 특징 융합 전략을 사용하여 정확한 초점성 예측을 수행한다.
- 경계 인식 손실과 이진 교차 엔트로피 손실을 포함하는 복합 손실 함수를 사용하여 종단 간 훈련을 수행함으로써 가장자리 정렬 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1이중 경로 인코더-디코더 아키텍처는 초점 대상 검출에서 시각 트랜스포머의 전역 모델링 능력과 CNN의 국소 특징 학습 능력을 효과적으로 융합할 수 있는가?
- RQ2인코더 및 디코더 단계에서의 상호 경로 특징 통신은 단일 경로 모델 대비 특징 표현을 어떻게 향상시키는가?
- RQ3딥 서포트가 트랜스포머 디코더 경로의 최종 단계에 적용되었을 때, 계산 비용 증가 없이 특징의 구분 능력을 향상시키는 데 어떤 영향을 미치는가?
- RQ4ImageNet 미사전 훈련 없이도 경량 CNN 경로는 어떤 성능을 보이며, 여전히 검출 정확도에 의미 있는 기여를 하는가?
- RQ5제안된 ABiU-Net의 실패 사례는 객체 크기, 초점성 모호성 또는 배경의 복잡성과 어떤 관련이 있는가?
주요 결과
- ABiU-Net은 DUT-OMRON, DUTS-TE, ECSSD, PASCAL-S, HKU-IS의 다섯 가지 주요 SOD 벤치마크에서 새로운 최신 기술 수준의 성능을 달성하였으며, 평균 F-측정치는 각각 0.891, 0.857, 0.913, 0.824, 0.876을 기록하였다.
- 절단 실험을 통해 이방향 이중 경로 설계가 단일 경로 모델들(TED+DS 또는 HED+DS)보다 유의미하게 뛰어난 성능을 보이며, 전역 및 국소 학습의 보완적 이점이 입증되었다.
- 모델은 하이퍼파rameter 변화에 뛰어난 내성성을 보이며, 다양한 채널 설정에서도 성능 변동이 미미하여 강력한 일반화 능력을 지닌 것으로 나타났다.
- 트랜스포머 디코더 경로의 최종 단계에 깊은 감독을 적용할 경우 최고의 성능을 기록하였으며, 이는 특징 학습 향상에 효과적임을 입증한다.
- 실패 사례 분석을 통해 미세하거나 뚜렷하지 않은 객체 검출에 한계가 있으며, 유사한 의미적 내용을 가진 복잡한 배경 처리나 애매한 진짜값 애너테이션 처리에 어려움을 겪는 것으로 확인되었다.
- 경량 CNN 경로는 ImageNet 미사전 훈련 없이도 양호한 성능을 보이며, 제한된 사전 훈련 데이터 조건에서도 아키텍처의 효과성이 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.