Skip to main content
QUICK REVIEW

[논문 리뷰] Low-cost and high-performance data augmentation for deep-learning-based skin lesion classification

Shuwei Shen, Mengjuan Xu|arXiv (Cornell University)|2021. 01. 07.
Cutaneous Melanoma Detection and Management참고 문헌 50인용 수 8
한 줄 요약

이 논문은 HAM10000 데이터셋에서 성능을 최적화하기 위해 자동 증강 검색과 신경망 아키텍처 검색을 결합한 저비용·고성능 데이터 증강 전략을 제안한다. 검색 공간을 60개로 축소하고 EfficientNet을 기준 모델로 사용함으로써 외부 데이터셋 없이도 균형 정확도 0.853을 달성하여 자원이 제한된 환경에서 모바일 장치에 효율적으로 구현할 수 있다.

ABSTRACT

Although deep convolutional neural networks (DCNNs) have achieved significant accuracy in skin lesion classification comparable or even superior to those of dermatologists, practical implementation of these models for skin cancer screening in low resource settings is hindered by their limitations in computational cost and training dataset. To overcome these limitations, we propose a low-cost and high-performance data augmentation strategy that includes two consecutive stages of augmentation search and network search. At the augmentation search stage, the augmentation strategy is optimized in the search space of Low-Cost-Augment (LCA) under the criteria of balanced accuracy (BACC) with 5-fold cross validation. At the network search stage, the DCNNs are fine-tuned with the full training set in order to select the model with the highest BACC. The efficiency of the proposed data augmentation strategy is verified on the HAM10000 dataset using EfficientNets as a baseline. With the proposed strategy, we are able to reduce the search space to 60 and achieve a high BACC of 0.853 by using a single DCNN model without external database, suitable to be implemented in mobile devices for DCNN-based skin lesion detection in low resource settings.

연구 동기 및 목표

  • 저비용 환경에서 피부암 스크리닝을 위한 딥러닝 모델을 구현할 때 발생하는 높은 계산 비용과 제한된 학습 데이터 문제를 해결하기 위해.
  • 외부 데이터셋이나 고비용 계산에 의존하지 않고도 모델의 일반화 성능을 향상시키는 데이터 증강 전략을 개발하기 위해.
  • 검색 기반 방법을 통해 데이터 증강과 신경망 아키텍처를 동시에 최적화하기 위해.
  • 경량 모델을 사용하여 모바일 장치에 적합한 효율적이고 고정확도의 피부병변 분류를 가능하게 하기 위해.
  • 원본 학습 데이터와 단일 DCNN 모델만을 사용하여 HAM10000 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 이 방법은 증강 검색과 네트워크 검색을 순차적으로 수행하는 이단계 검색 프레임워크를 사용한다.
  • 증강 검색 단계에서 검색 공간은 저비용 증강(Low-Cost-Augment, LCA)으로 정의되며, 이는 mixup, cutout, auto-augment와 같은 계산적으로 효율적인 증강 기법들로 구성된다.
  • 증강 전략은 균형 정확도(BACC)를 평가 지표로 사용하여 5겹 교차 검증을 통해 최적화된다.
  • 네트워크 검색 단계에서는 전체 학습 세트에 대해 미세조정된 EfficientNet 변종들 중 가장 성능이 뛰어난 모델이 선택된다.
  • 검색 과정은 자동화되어 있어 효과적인 검색 공간을 단지 60개의 고유한 구성으로 줄였다.
  • 최종 모델은 전체 데이터셋을 사용해 엔드 투 엔드로 훈련되고, HAM10000 벤치마크에서만 평가된다.

실험 결과

연구 질문

  • RQ1외부 데이터셋 없이도 저비용 데이터 증강 전략이 피부병변 분류 정확도를 크게 향상시킬 수 있는가?
  • RQ2높은 성능를 유지하면서도 데이터 증강의 검색 공간을 효과적으로 줄일 수 있는가?
  • RQ3데이터 증강과 네트워크 아키텍처를 동시에 최적화하는 것이 순차적 또는 수동 설계보다 더 나은 성능을 낼 수 있는가?
  • RQ4원본 학습 데이터와 자동 검색만을 사용하여 단일 DCNN 모델이 HAM10000에서 높은 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ5제안된 방법은 자원이 제한된 임상 환경에서 모바일 장치에 배포하기에 적합한가?

주요 결과

  • 제안된 방법은 HAM10000 데이터셋에서 외부 데이터 없이도 균형 정확도 0.853을 달성하여 기준 모델보다 뛰어난 성능을 보였다.
  • 검색 공간이 단지 60개의 구성으로 축소되어 표준 검색 방법에 비해 계산 비용을 크게 낮췄다.
  • 단일 DCNN 모델을 사용하여 고성능 피부병변 분류를 가능하게 하여 앙상블 모델이나 외부 데이터셋이 필요 없어졌다.
  • 최종 모델는 낮은 계산 부하와 높은 효율성 덕분에 모바일 장치에 배포하기에 적합하다.
  • 증강 검색 이후 네트워크 검색을 수행하는 이단계 검색 프레임워크는 데이터와 모델에 최적의 구성 요소를 효과적으로 식별하는 데 성공했다.
  • 자동화된 저비용 증강 전략이 더 복잡하고 자원을 많이 소비하는 접근 방식과 동등하거나 이를 초월하는 성능을 낼 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.