Skip to main content
QUICK REVIEW

[논문 리뷰] Deep-Learning Ensembles for Skin-Lesion Segmentation, Analysis, Classification: RECOD Titans at ISIC Challenge 2018

Alceu Bissoto, Fábio Perez|arXiv (Cornell University)|2018. 08. 25.
Cutaneous Melanoma Detection and Management인용 수 20
한 줄 요약

이 논문은 ISIC 챌린지 2018에서 피부 병변 분할, 특성 검출, 메라노마 분류 성능을 향상시키기 위해 전이 학습, 합성 병변 생성 및 고급 데이터 증강 기법을 활용한 딥러닝 앙상블 방법을 제시한다. 이 방법은 테스트 세트에서 정규화된 다중 클래스 정확도 0.803을 달성하여 분류 과제에서 총 141개의 제출 중 9위를 기록하였다.

ABSTRACT

This extended abstract describes the participation of RECOD Titans in parts 1 to 3 of the ISIC Challenge 2018 "Skin Lesion Analysis Towards Melanoma Detection" (MICCAI 2018). Although our team has a long experience with melanoma classification and moderate experience with lesion segmentation, the ISIC Challenge 2018 was the very first time we worked on lesion attribute detection. For each task we submitted 3 different ensemble approaches, varying combinations of models and datasets. Our best results on the official testing set, regarding the official metric of each task, were: 0.728 (segmentation), 0.344 (attribute detection) and 0.803 (classification). Those submissions reached, respectively, the 56th, 14th and 9th places.

연구 동기 및 목표

  • 피부 병변 분석에서 제한적이고 불균형한 피부 내시경 데이터셋 문제를 외부 데이터 소스 및 합성 데이터 생성을 통해 해결하고자 한다.
  • 전이 학습을 활용한 딥러닝 앙상블를 통해 피부 병변 분할, 특성 검출 및 메라노마 분류 성능을 향상시키고자 한다.
  • 데이터 증강, 모델 앙상블, 합성 병변 생성이 모델 일반화 및 내성에 미치는 영향을 조사하고자 한다.
  • 복잡성과 성능 향상 간의 균형을 고려하여 확장 가능하고 재현 가능한 피부 병변 분석 파이프라인을 개발하고자 한다.
  • 희귀 병변 유형의 데이터 부족 문제를 완화하기 위해 GAN을 활용한 현실적인 합성 피부 내시경 영상 생성 신규 방법을 기여하고자 한다.

제안 방법

  • ISIC 2018, ISIC 아카이브 및 추가 자료를 조합하여 총 30,726장의 피부 내시경 영상으로 구성된 종합적 데이터셋을 구축하였으며, 부족한 클래스에 해당하는 631장의 추가 이미지를 포함하였다.
  • 모델 훈련 중 클래스 불균형 문제를 완화하기 위해 빈도 기반 클래스 가중치를 적용한 클래스 가중 교차 엔트로피 손실을 적용하였다.
  • 무작위 자르기, 반전, 회전, 기울임, 스케일링 및 색상 왜곡(포화도, 밝기, 대비, 색상)을 포함한 광범위한 온라인 데이터 증강을 시행하였다.
  • 테스트 시간 증강을 통해 각 이미지당 128개의 복제본을 생성하고 예측값을 평균화하여 정확도와 일반화 능력을 향상시켰다.
  • 세 부분으로 구성된 제출 전략을 구현하였다: (1) 43개 모델의 XGBoost 앙상블, (2) 합성 데이터로 훈련된 8개 최상위 성능 모델의 평균, (3) 챌린지 데이터로만 훈련된 15개 모델의 평균.
  • 이중 단계 훈련 파이프라인을 활용하였다: 먼저 검증 세트에서 모델 선택을 수행하고, 이후 검증 지표를 활용한 메타학습을 통해 최종 앙상블를 정밀 조정하였다.

실험 결과

연구 질문

  • RQ1외부 및 합성 데이터의 포함 여부가 심각한 클래스 불균형 상황에서 피부 병변 분할 및 분류 성능에 어떤 영향을 미치는가?
  • RQ2고급 데이터 증강 및 테스트 시간 증강이 모델 일반화 및 내성에 미치는 영향은 무엇인가?
  • RQ3다양한 딥러닝 아키텍처를 활용한 앙상블 학습이 다중 작업 피부 병변 분석에서 개별 모델보다 우월한 성능을 낼 수 있는가?
  • RQ4GAN을 활용한 합성 병변 생성이 희귀 피부질환에 대한 훈련에 얼마나 기여할 수 있는가?
  • RQ5다양한 모델 아키텍처와 훈련 전략이 분할, 특성 검출 및 분류 과제 전반에 걸쳐 성능에 어떤 영향을 미치는가?

주요 결과

  • 43개의 딥러닝 모델을 활용한 앙상블 모델은 정규화된 다중 클래스 정확도 0.732를 달성하여 분류 과제에서 총 141개의 제출 중 32위를 기록하였다.
  • 합성 데이터로 훈련된 8개 최상위 성능 모델의 평균은 0.725의 정규화 정확도를 기록하여 39위를 기록하였으며, 이는 데이터 증강의 유용성은 확인되었지만 성능 향상 폭은 제한적이었다는 점을 시사한다.
  • 챌린지 데이터로만 훈련된 15개 모델의 평균은 최고의 성능을 기록하여 정규화된 정확도 0.803을 달성하였으며, 총 141개 중 9위를 확보하였다.
  • 합성 병변의 사용으로 Basal Cell Carcinoma (BCC), Dermatofibroma (DF), Vascular lesions (VASC)와 같은 희귀 클래스의 표현이 향상되어 훈련 세트 내 비율이 증가하였다.
  • 128개의 복제본을 활용한 테스트 시간 증강은 노이즈가 많거나 모호한 레이블이 존재하는 경우에도 모델의 내성 향상에 크게 기여하였다.
  • 팀의 접근 방식은 단순성과 성능 향상 간의 균형이 중요하며, 복잡성 증가는 항상 지표 향상에 비례하지는 않는다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.