[논문 리뷰] Comparison of different CNNs for breast tumor classification from ultrasound images
이 연구는 초음파 영상에서 유방 종양을 분류하기 위해 사전 훈련된 VGG-16 및 Inception V3 모델을 사용하여 피닝 투닝과 특징 추출을 평가한다. 피닝 투닝 방식으로 VGG-16를 적용한 결과, 정확도 91.9%와 AUC 0.934를 기록하여 다른 설정들을 모두 능가하였으며, 이는 제한된 데이터에서 이 작업에 대해 피닝 투닝 전략이 우월하다는 것을 시사한다.
Breast cancer is one of the deadliest cancer worldwide. Timely detection could reduce mortality rates. In the clinical routine, classifying benign and malignant tumors from ultrasound (US) imaging is a crucial but challenging task. An automated method, which can deal with the variability of data is therefore needed. In this paper, we compared different Convolutional Neural Networks (CNNs) and transfer learning methods for the task of automated breast tumor classification. The architectures investigated in this study were VGG-16 and Inception V3. Two different training strategies were investigated: the first one was using pretrained models as feature extractors and the second one was to fine-tune the pre-trained models. A total of 947 images were used, 587 corresponded to US images of benign tumors and 360 with malignant tumors. 678 images were used for the training and validation process, while 269 images were used for testing the models. Accuracy and Area Under the receiver operating characteristic Curve (AUC) were used as performance metrics. The best performance was obtained by fine tuning VGG-16, with an accuracy of 0.919 and an AUC of 0.934. The obtained results open the opportunity to further investigation with a view of improving cancer detection.
연구 동기 및 목표
- 초음파 영상에서 유방 종양 분류를 위한 전이 학습 전략—특징 추출 및 피닝 투닝—의 효과를 평가하기 위해.
- 제한된 데이터셋에서 널리 사용되는 두 가지 아키텍처인 VGG-16과 Inception V3의 성능을 다양한 훈련 전략 하에서 비교하기 위해.
- 자동화된 유방 종양 진단에서 분류 정확도와 AUC를 최대화하기 위한 최적의 모델 아키텍처와 훈련 방법 조합을 규명하기 위해.
- 소규모 의료 영상 데이터셋에서 훈련된 모델의 과적합 경향성을 조사하고 정규화 기법의 필요성을 평가하기 위해.
제안 방법
- 전이 학습을 위해 사전 훈련된 VGG-16 및 Inception V3 모델을 기반 네트워크로 사용하였다.
- 두 가지 훈련 전략을 적용하였다: (1) 기반 레이어를 모두 동결하고 네트워크를 단순히 특징 추출기로 사용하는 방식, (2) 사전 훈련된 모델의 최상위 몇 층을 피닝 투닝하는 방식.
- 분류를 위해 특징 추출기 위에 1024개(비교적 VGG-16) 또는 512개(비교적 Inception V3) 뉴런을 가진 완전 연결(Fully Connected, FC) 레이어를 추가하였다.
- 훈련는 기준 학습률 0.001, 배치 크기 50, Adam 옵timizer를 사용하였으며, NVIDIA GTX 1660 GPU에서 Keras와 텐서플로우 백엔드를 사용하여 수행되었다.
- 데이터 증강은 명시적으로 적용되지 않았지만, 과적합을 완화하기 위해 드롭아웃 및 L2 정규화와 같은 정규화 기법을 고려하였다.
- 성능 평가는 정확도와 수확률 곡선 아래 면적(AUC)을 사용하였으며, 훈련/검증용으로 678장의 이미지, 테스트용으로 269장의 이미지를 사용하였다.
실험 결과
연구 질문
- RQ1초음파 영상에서 유방 종양 분류에 대해 특징 추출과 피닝 투닝 중 어떤 전이 학습 전략이 더 높은 성능을 낼 수 있는가?
- RQ2제한된 데이터셋에서 사전 훈련된 CNN 아키텍처 선택(비교적 VGG-16 대비 Inception V3)이 분류 성능에 유의미한 영향을 미치는가?
- RQ3훈련 및 테스트 동안 성능 지표(정확도 및 AUC)는 어떻게 변화하며, 이는 과적합에 대한 시사점을 무엇을 제공하는가?
- RQ4피닝 투닝된 VGG-16는 소규모이고 변동성이 큰 유방 초음파 영상 데이터셋에서 효과적으로 일반화될 수 있는가?
주요 결과
- 피닝 투닝된 VGG-16가 가장 높은 테스트 정확도 0.919와 AUC 0.934를 기록하여 다른 모든 설정을 능가하였다.
- 특징 추출 전략은 유의미하게 낮은 성능을 보였으며, VGG-16는 정확도 0.862와 AUC 0.791에 머물렀다.
- Inception V3는 피닝 투닝 시 일반화 능력이 열악하여 정확도 0.756과 AUC 0.783를 기록하였으며, 훈련 중에는 0.93 이상의 정확도를 달성했지만 테스트 성능은 낮아 과적합이 발생한 것으로 나타났다.
- 피닝 투닝과 특징 추출 간의 성능 격차는 정확도(0.046)보다 AUC(0.16)에서 더 크게 나타나, 피닝 투닝 방식이 더 뛰어난 분류 능력을 가짐을 시사한다.
- Inception V3의 훈련 과정에서 과적합 현상이 관찰되었으며, 높은 훈련 정확도(0.93 초과)에도 불구하고 테스트 성능은 낮아 정규화 기법의 필요성을 강조하였다.
- 예측 결과의 시각적 분석을 통해 영상의 변동성이 특히 양성 종양가 악성으로 잘못 분류되는 데 영향을 미치며, 이는 모델의 일반화 능력에 영향을 준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.