Skip to main content
QUICK REVIEW

[논문 리뷰] DATR: Domain-adaptive transformer for multi-domain landmark detection

Heqin Zhu, Qingsong Yao|arXiv (Cornell University)|2022. 03. 12.
Medical Imaging and Analysis인용 수 5
한 줄 요약

이 논문은 머리, 손, 그리고 흉부 X-ray에서 유니버설 다중 도메인 해부학적 랜드마크 검출을 위한 첫 번째 도메인 적응형 트랜스포머 모델인 DATR를 제안한다. 스위니 트랜스포머 인코더와 함께 도메인 적응형 자기주의 및 경량 가이던스 네트워크를 통합함으로써 DATR는 혼합 데이터셋에서 평균 정렬 오차를 1.47px로 줄여 최신 기술 수준의 성능을 달성하였으며, 이는 이전의 CNN 기반 모델보다 뚜렷한 성능 향상을 보였다.

ABSTRACT

Accurate anatomical landmark detection plays an increasingly vital role in medical image analysis. Although existing methods achieve satisfying performance, they are mostly based on CNN and specialized for a single domain say associated with a particular anatomical region. In this work, we propose a universal model for multi-domain landmark detection by taking advantage of transformer for modeling long dependencies and develop a domain-adaptive transformer model, named as DATR, which is trained on multiple mixed datasets from different anatomies and capable of detecting landmarks of any image from those anatomies. The proposed DATR exhibits three primary features: (i) It is the first universal model which introduces transformer as an encoder for multi-anatomy landmark detection; (ii) We design a domain-adaptive transformer for anatomy-aware landmark detection, which can be effectively extended to any other transformer network; (iii) Following previous studies, we employ a light-weighted guidance network, which encourages the transformer network to detect more accurate landmarks. We carry out experiments on three widely used X-ray datasets for landmark detection, which have 1,588 images and 62 landmarks in total, including three different anatomies (head, hand, and chest). Experimental results demonstrate that our proposed DATR achieves state-of-the-art performances by most metrics and behaves much better than any previous convolution-based models. The code will be released publicly.

연구 동기 및 목표

  • 도메인 특화 재학습 없이도 다양한 해부학적 도메인(예: 머리, 손, 흉부)에서 해부학적 랜드마크를 검출할 수 있는 유니버설 모델을 개발하는 것.
  • 단일 도메인 CNN 기반 모델의 한계를 극복하기 위해 트랜스포머를 활용해 다중 도메인 랜드마크 검출에서 장거리 문맥 모델링을 수행하는 것.
  • 다양한 해부학적 영역 간 공유 및 도메인 특화 특징 학습을 가능하게 하는 도메인 적응형 트랜스포머 블록을 설계하는 것.
  • 거시적이지만 모호하지 않은 랜드마크 감독을 제공하는 경량 가이던스 네트워크를 통해 검출 정확도를 향상시키는 것.
  • 새로운 도메인인 골반과 같은 도메인에 대해 제로샷 전이가 가능한 다중 도메인 프리트레인의 효과를 검증하는 것.

제안 방법

  • 모델은 스위니 트랜스포머 블록 기반의 트랜스포머 인코더를 사용하며, 도메인 간 관계를 모델링하기 위해 도메인 적응형 자기주의(MSA_Q^d)로 강화된다.
  • 도메인 공유 및 도메인 특화 파rameter를 통합하는 도메인 적응형 트랜스포머 블록(DAT)은 공유 지식 추출과 도메인 특화 적응을 가능하게 한다.
  • 디코더는 표준 컨볼루션 대신 채널별 및 포인트와이즈 연산을 사용하는 도메인 적응형 컨볼루션(DAC)을 사용하여 다수의 도메인을 지원한다.
  • 다섯 개의 확장 컨볼루션과 1×1 컨볼루션을 갖춘 가이던스 네트워크는 거시적 히트맵을 생성하여 주 트랜스포머 네트워크가 더 정확한 랜드마크 예측을 향해 유도하도록 한다.
  • 모델은 머리, 손, 흉부 X-ray의 혼합 데이터셋에서 엔드 투 엔드로 훈련되며, 새로운 도메인에서 추론 시 도메인 특화 파라미터가 미세조정된다.
  • 전이 학습 평가를 위해 도메인 공유 파라미터를 고정하고 새로운 도메인 특화 레이어를 골반 데이터셋에 추가한다.

실험 결과

연구 질문

  • RQ1기존의 CNN 기반 모델에 비해 트랜스포머 기반 아키텍처가 여러 해부학적 도메인에서 랜드마크 검출 성능을 향상시킬 수 있는가?
  • RQ2트랜스포머 인코더에서 도메인 적응형 자기주의가 다중 도메인 랜드마크 검출을 위한 특징 학습을 향상시키는가?
  • RQ3혼합 데이터셋에서 훈련된 단일 유니버설 모델이 골반과 같은 새로운 해부학적 도메인으로 일반화되는가?
  • RQ4다중 도메인 프리트레인은 단일 도메인 훈련에 비해 개별 도메인에서의 성능에 어떤 영향을 미치는가?
  • RQ5강력한 감독 없이도 가이던스 네트워크가 검출 정확도 향상에 어느 정도 기여하는가?

주요 결과

  • DATR는 머리+손+흉부 데이터셋에서 평균 정렬 오차(MRE)를 1.47px로 줄여 기준 트랜스포머의 2.62px보다 뚜렷한 향상을 보였다.
  • 머리 데이터셋에서 DATR는 SDR<3px가 78.07%를 기록하여 단일 도메인 기준 모델을 초월하며 강력한 일반화 능력을 입증하였다.
  • 새로운 골반 데이터셋에서 미세조정한 결과, 도메인 적응형 트랜스포머의 MRE는 기준 모델의 5.64px에서 4.12px로 감소하여 효과적인 도메인 적응을 보였다.
  • 다중 도메인 훈련은 모든 도메인에서 일관되게 성능 향상을 이끌었으며, 세 도메인 모델이 모든 테스트 세트에서 최고의 MRE 및 SDR 점수를 기록하였다.
  • 제거 실험 결과 도메인 적응형 자기주의와 대각행렬 적응(D^d) 모두 성능 향상에 기여하며, 전체 모델이 모든 변형보다 뛰어난 성능을 보였다.
  • 시각화 결과 예측 랜드마크(빨간색)가 특히 손과 흉부와 같은 복잡한 구조에서 앙카레이티드 랜드마크(초록색)와 밀도 높게 일치하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.