[논문 리뷰] COTR: Convolution in Transformer Network for End to End Polyp Detection
이 논문은 전이기반 인코더 블록 내부에 컨볼루션 레이어를 통합하여 수렴 속도를 향상시키고 특징 재구성을 개선하는 새로운 엔드 투 엔드 폴립 검출 모델인 COTR를 제안한다. ETIS-LARIB 및 CVC-ColonDB에서 평가한 결과, ETIS-LARIB에서는 91.49% 정밀도, 82.69% 민감도, 86.87% F1 점수를 기록했으며, CVC-ColonDB에서는 91.67% 정밀도, 93.54% 민감도, 92.60% F1 점수를 기록하여 수동으로 조정된 전처리 또는 후처리 단계 없이도 최신 기술 수준의 성능을 입증하였다.
Purpose: Colorectal cancer (CRC) is the second most common cause of cancer mortality worldwide. Colonoscopy is a widely used technique for colon screening and polyp lesions diagnosis. Nevertheless, manual screening using colonoscopy suffers from a substantial miss rate of polyps and is an overwhelming burden for endoscopists. Computer-aided diagnosis (CAD) for polyp detection has the potential to reduce human error and human burden. However, current polyp detection methods based on object detection framework need many handcrafted pre-processing and post-processing operations or user guidance that require domain-specific knowledge. Methods: In this paper, we propose a convolution in transformer (COTR) network for end-to-end polyp detection. Motivated by the detection transformer (DETR), COTR is constituted by a CNN for feature extraction, transformer encoder layers interleaved with convolutional layers for feature encoding and recalibration, transformer decoder layers for object querying, and a feed-forward network for detection prediction. Considering the slow convergence of DETR, COTR embeds convolution layers into transformer encoder for feature reconstruction and convergence acceleration. Results: Experimental results on two public polyp datasets show that COTR achieved 91.49\% precision, 82.69% sensitivity, and 86.87% F1-score on the ETIS-LARIB, and 91.67% precision, 93.54% sensitivity, and 92.60% F1-score on the CVC-ColonDB. Conclusion: This study proposed an end to end detection method based on detection transformer for colorectal polyp detection. Experimental results on ETIS-LARIB and CVC-ColonDB dataset demonstrated that the proposed model achieved comparable performance against state-of-the-art methods.
연구 동기 및 목표
- 내시경 검사에서 높은 빈도의 누락률과 높은 작업 부담 문제를 해결하기 위해 엔드 투 엔드 컴퓨터 지원 진단(CAD) 시스템을 개발함으로써 폴립 검출을 수행하고자 한다.
- 제한된 양의 복잡한 폴립 데이터셋을 고려할 때, 기존 트랜스포머 모델이 폴립 검출에 적용될 경우 느린 수렴 속도와 열악한 특징 정렬 문제를 해결하고자 한다.
- 기존 객체 검출 프레임워크에서 요구되는 앵커 생성 및 비최대 억제(Non-Maximum Suppression)와 같은 수작업 기반 전처리 및 후처리 작업에 의존하지 않도록 하고자 한다.
- 다양한 질감, 형태, 배경 조직에 비해 낮은 대비를 보이는 폴립에 대해서도 검출의 강건성을 향상시키고자 한다.
제안 방법
- COTR는 복강경 영상에서 초기 특징 추출을 위해 CNN 백본을 사용한다.
- 컨볼루션 레이어와 트랜스포머 인코더 레이어를 번갈아 배치하여 고수준 영상 특징을 재구성하고 학습 동역학을 안정화시킨다.
- 학습 가능한 객체 쿼리를 사용하는 트랜스포머 디코더를 통해 바운딩 박스와 클래스 점수를 직접 예측한다.
- 피드포워드 네트워크는 디코더 출력에서 최종 검출 예측을 생성한다.
- 트랜스포머 인코더에 컨볼루션을 통합함으로써 공간적 구조를 유지하고 표준 DETR보다 수렴 속도를 빠르게 할 수 있다.
- 일반화 성능 향상을 위해 데이터 증강을 적용하고, AdamW 옵timizer를 사용하여 총 300 에포크 동안 엔드 투 엔드로 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1수작업 기반 구성 요소에 의존하지 않고도 트랜스포머 기반 객체 검출기가 엔드 투 엔드 폴립 검출에서 경쟁 가능한 성능을 달성할 수 있는가?
- RQ2트랜스포머 인코더에 컨볼루션 레이어를 삽입할 경우, 폴립 검출에서 수렴 속도와 특징 표현에 어떤 영향을 미치는가?
- RQ3제안된 COTR 모델이 공개 폴립 검출 벤치마크에서 기존 최신 기술 수준의 방법들을 초월하는가?
- RQ4낮은 대비와 비정상적인 형태로 인해 검출이 어려운 소형 또는 평판형 폴립을 효과적으로 탐지할 수 있는가?
주요 결과
- ETIS-LARIB 데이터셋에서 COTR는 91.49% 정밀도, 82.69% 민감도, 86.87% F1 점수를 기록하여 대부분의 기존 방법보다 정밀도와 F1 점수에서 뛰어난 성능을 보였다.
- CVC-ColonDB 데이터셋에서 COTR는 91.67% 정밀도, 93.54% 민감도, 92.60% F1 점수를 기록하여 이 벤치마크에서 새로운 최신 기술 수준의 성능을 수립하였다.
- DETR 대비 COTR의 학습 손실가 더 빠르게 수렴함을 확인하여, 인코더에 컨볼루션 레이어를 통합함으로써 공간적 특징 구조를 유지함으로써 수렴 속도 향상이 가능함을 입증하였다.
- COTR는 다양한 질감, 형태, 색상의 폴립, 특히 소형 폴립에 대해서도 강건한 검출 성능를 보였지만, 일부 평판형 폴립은 낮은 신뢰도 예측로 인해 어려움을 겪는 경우가 있었다.
- 잔류 액체나 저대비 배경이 있는 다양한 복강경 조건에서도 모델의 성능가 안정적이었다.
- 제거 실험을 통해 트랜스포머 인코더에 컨볼루션을 통합하는 것이 수렴 가속화와 검출 정확도 향상에 핵심적인 역할을 한다는 점을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.