[논문 리뷰] MTTrans: Cross-Domain Object Detection with Mean-Teacher Transformer
MTTrans는 변형 가능 DETR에서 다중 수준 특징 정렬과 평균 교사 학습 프레임워크를 기반으로 한 엔드 투 엔드의 교차 도메인 객체 검출 프레임워크를 제안한다. 비라벨링된 타겟 데이터로부터 고품질의 가짜 라벨을 생성하고 전역, 인스턴스, 국소 수준에서 도메인 간 특징을 정렬함으로써 MTTrans는 상태의 기술(SOTA) 성능을 달성하였으며, 특히 Sim10k에서 Cityscapes로의 벤치마크에서 mAP를 52.6에서 57.9로 향상시켰다.
Recently, DEtection TRansformer (DETR), an end-to-end object detection pipeline, has achieved promising performance. However, it requires large-scale labeled data and suffers from domain shift, especially when no labeled data is available in the target domain. To solve this problem, we propose an end-to-end cross-domain detection Transformer based on the mean teacher framework, MTTrans, which can fully exploit unlabeled target domain data in object detection training and transfer knowledge between domains via pseudo labels. We further propose the comprehensive multi-level feature alignment to improve the pseudo labels generated by the mean teacher framework taking advantage of the cross-scale self-attention mechanism in Deformable DETR. Image and object features are aligned at the local, global, and instance levels with domain query-based feature alignment (DQFA), bi-level graph-based prototype alignment (BGPA), and token-wise image feature alignment (TIFA). On the other hand, the unlabeled target domain data pseudo-labeled and available for the object detection training by the mean teacher framework can lead to better feature extraction and alignment. Thus, the mean teacher framework and the comprehensive multi-level feature alignment can be optimized iteratively and mutually based on the architecture of Transformers. Extensive experiments demonstrate that our proposed method achieves state-of-the-art performance in three domain adaptation scenarios, especially the result of Sim10k to Cityscapes scenario is remarkably improved from 52.6 mAP to 57.9 mAP. Code will be released.
연구 동기 및 목표
- 라벨이 있는 소스 도메인에서 라벨이 없는 타겟 도메인으로 전이할 때 도메인 이동 문제를 해결한다.
- 라벨이 없는 타겟 데이터를 효율적으로 활용하지 못하는 기존 비지도 도메인 적응 방법의 한계를 극복한다.
- 도메인 이동 상황에서 평균 교사 프레임워크가 생성하는 가짜 라벨의 품질을 향상시킨다.
- Transformer 기반 검출기에서 도메인 불변 표현 학습을 향상시키기 위한 종합적인 다중 수준 특징 정렬 전략을 개발한다.
- 가짜 라벨 생성과 특징 정렬 간 반복적이고 상호적 최적화를 엔드 투 엔드 방식으로 가능하게 한다.
제안 방법
- 평균 교사 프레임워크를 객체 검출에서 비지도 도메인 적응(UDA)에 적응시키며, 교사-학생 모델 설정과 함께 교사 네트워크의 지수 이동 평균(EMA)을 사용한다.
- 도메인 쿼리 기반 특징 정렬(DQFA)을 도입하여 크로스 스케일 자기주의를 이용해 전역 이미지 및 객체 제안 특징을 도메인 간에 정렬한다.
- 이중 수준 그래프 기반 프로토타입 정렬(BGPA)을 제안하여 객체 특징에서 생성된 프로토타입을 통해 인스턴스 수준 특징을 모델링하고 정렬한다.
- 토큰 수준 이미지 특징 정렬(TIFA)을 구현하여 이미지 특징 맵의 토큰 수준에서 국소 수준 특징을 정렬한다.
- 평균 교사 프레임워크와 다중 수준 특징 정렬을 통합하여 가짜 라벨 품질과 특징 정렬을 동시에 최적화하는 엔드 투 엔드 방식을 구현한다.
- 학습 중에 가짜 라벨 타겟 도메인 데이터를 사용하여 특징 추출과 모델 일반화를 향상시켜 비라벨 데이터를 완전히 활용한다.
실험 결과
연구 질문
- RQ1소스 도메인과 타겟 도메인이 상당한 분포 이동을 보일 때, 평균 교사 프레임워크가 비지도 도메인 적응에서 객체 검출에 효과적으로 적용될 수 있는가?
- RQ2특히 교사 모델이 도메인 불변이 아닌 상황에서, 평균 교사가 생성하는 가짜 라벨의 품질을 어떻게 향상시킬 수 있는가?
- RQ3Transformer 기반 객체 검출기에서 도메인 불변 표현 학습을 향상시키기 위해 가장 효과적인 다중 수준 특징 정렬 전략은 무엇인가?
- RQ4가짜 라벨 생성과 특징 정렬 간의 공동 최적화가 교차 도메인 환경에서 검출 성능 향상에 얼마나 기여하는가?
- RQ5제안된 프레임워크의 개별 구성 요소(예: DQFA, BGPA, TIFA)가 도메인 적응에서 전체 성능 향상에 기여하는 방식은 무엇인가?
주요 결과
- MTTrans는 Sim10k에서 Cityscapes로의 벤치마크에서 새로운 SOTA mAP 57.9를 달성하였으며, 이는 이전 SOTA인 mAP 52.6보다 상당한 향상이다.
- 제거 실험 결과, 디코더 전용 DQFA 구성 요소를 제거하면 성능 저하가 가장 심각하며 (-0.451 mAP) 전역 특징 정렬에서의 핵심적 역할을 확인할 수 있다.
- 디코더에서 BGPA를 TIFA로 교체하거나 인코더에서 TIFA를 BGPA로 교체하면 각각 -0.460 mAP 및 -0.345 mAP의 성능 저하가 발생하여 구성 요소 특화 설계의 중요성을 입증한다.
- 교사 및 학생 모델 간 공유 객체 쿼리를 제거하면 성능 저하가 가장 심각하며 (-0.616 mAP) 일관된 쿼리 학습의 필요성을 확인한다.
- 가짜 라벨 시각화 결과, MTTrans는 MT-DefDETR보다 더 높은 품질의 가짜 라벨을 생성하며, 교사 모델의 예측이 학생 모델보다 더 정확하여 효과적인 지식 정착이 가능하다.
- Foggy Cityscapes에 대한 정성적 결과에서는 Deformable DETR 및 SFA 대비 MTTrans가 더 먼 거리에 있는 물체와 안개에 가려진 물체를 더 잘 탐지하며, 참 긍정에 대해 더 높은 신뢰도 점수를 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.