Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Joint Mining of Deep Features and Image Labels for Large-scale Radiology Image Categorization and Scene Recognition

Xiaosong Wang, Le Lü|arXiv (Cornell University)|2017. 01. 23.
Advanced Neural Network Applications참고 문헌 53인용 수 7
한 줄 요약

이 논문은 대규모 영상진단 및 시점 인식 작업에서 비지도 학습을 통한 깊이 특징과 이미지 레이블의 공동 채굴을 위한 루프형 딥 가짜태스크 최적화(LDPO) 프레임워크를 제안한다. 군집화된 특징에서 가짜 레이블을 반복적으로 개선하고 CNN을 미세조정함으로써, LDPO는 MIT-67에서 비지도 학습 시점 인식 정확도 75.3%를 달성하여 지도 학습 방법의 81.0%에 가까워지며, 인간의 레이블링 없이도 의료 영상 분류 성능을 크게 향상시킨다.

ABSTRACT

The recent rapid and tremendous success of deep convolutional neural networks (CNN) on many challenging computer vision tasks largely derives from the accessibility of the well-annotated ImageNet and PASCAL VOC datasets. Nevertheless, unsupervised image categorization (i.e., without the ground-truth labeling) is much less investigated, yet critically important and difficult when annotations are extremely hard to obtain in the conventional way of "Google Search" and crowd sourcing. We address this problem by presenting a looped deep pseudo-task optimization (LDPO) framework for joint mining of deep CNN features and image labels. Our method is conceptually simple and rests upon the hypothesized "convergence" of better labels leading to better trained CNN models which in turn feed more discriminative image representations to facilitate more meaningful clusters/labels. Our proposed method is validated in tackling two important applications: 1) Large-scale medical image annotation has always been a prohibitively expensive and easily-biased task even for well-trained radiologists. Significantly better image categorization results are achieved via our proposed approach compared to the previous state-of-the-art method. 2) Unsupervised scene recognition on representative and publicly available datasets with our proposed technique is examined. The LDPO achieves excellent quantitative scene classification results. On the MIT indoor scene dataset, it attains a clustering accuracy of 75.3%, compared to the state-of-the-art supervised classification accuracy of 81.0% (when both are based on the VGG-VD model).

연구 동기 및 목표

  • ImageNet과 유사한 대규모, 잘 레이블링된 데이터셋이 부족하여 조합된 레이블링이 비용이 많이 들고 심지어 영상진단 전문의에게도 편향을 초래하는 대규모 의료 영상 레이블링 문제를 해결한다.
  • 의료 영상 검색 엔진이 존재하지 않으며 비전문가가 임상 레이블링을 수행하기 어려운 점을 감안해 기존의 이미지 레이블링 방법(예: Google 검색 또는 커뮤니티 기반 레이블링)의 한계를 극복한다.
  • 지상 진실 레이블이 필요 없이 반복적인 개선을 통해 깊이 컨볼루션 신경망(CNN) 특징과 이미지 레이블을 공동 최적화하는 자기지도 학습 프레임워크를 개발한다.
  • LDPO의 효과성을 비지도 의료 영상 분류 및 시점 인식에서 입증하여 지도 학습 기반 기준에 근접한 성능을 달성한다.
  • 루프형 최적화 프로세스를 통해 의미 있는 군집과 분류 가능한 특징으로 수렴하는 방식으로, 대규모 의료 영상 데이터베이스에서 의미 있는 분류 항목을 스케일러블하고 자동으로 탐색할 수 있도록 한다.

제안 방법

  • 이미지 패치 또는 전체 이미지에서 깊이 특징을 추출하기 위해 사전 학습된 CNN(예: AlexNet 또는 VGG-VD)을 사용해 LDPO 프레임워크를 시작한다.
  • CNN 임bedded 특징에 대해 군집화(예: k-means)를 수행하여 각 이미지의 가짜 레이블을 생성하고, 임시 지상 진실로 간주한다.
  • 가짜 레이블 데이터를 사용해 CNN을 미세조정함으로써 특징의 분류 가능성을 향상시키고 모델의 일반화 능력을 강화하여 더 대표적인 이미지 인코더를 만든다.
  • 프로세스를 반복: 업데이트된 CNN으로 이미지를 재인코딩하고, 재군집화 및 재학습을 수행함으로써 표현 학습과 레이블 개선을 번갈아가며 반복 최적화하는 루프를 형성한다.
  • 패치 채굴(PM)을 도입하여 특히 시점 인식 작업에서 국소 시각 패턴 모델링을 향상시킨다. 중위치 시각 패치를 추출하고 군집화함으로써 성능 향상을 이룬다.
  • 최종적으로 학습된 이미지 표현을 사용해 비지도 군집 평가(purity, NMI)와 지도 학습 분류(Liblinear 등)를 수행하여 자기학습된 특징의 품질을 검증한다.

실험 결과

연구 질문

  • RQ1지상 진실 레이블이 없는 상황에서 루프형 최적화 프레임워크가 깊이 특징 학습과 이미지 레이블 탐색을 동시에 개선할 수 있는가?
  • RQ2사전 학습된 CNN에서 추출한 깊이 특징의 비지도 군집화가 시점 인식 작업에서 지도 학습 방법과 비교해 어느 정도의 성능을 달성할 수 있는가?
  • RQ3패치 수준의 시각 패턴 채굴 통합이 시점 인식에서 자기지도 표현의 분류 능력을 어떻게 향상시키는가?
  • RQ4LDPO 프레임워크는 초기화에 관계없이 안정적으로 수렴하는가? 그리고 안정된 성능에 도달하는 데 얼마나 오래 걸리는가?
  • RQ5LDPO 프레임워크는 전문가 레이블링이 필요 없이 대규모 의료 영상 데이터베이스에 대해 효과적이고 확장 가능한 자동 레이블링을 가능하게 할 수 있는가?

주요 결과

  • MIT-67 실내 시점 데이터셋에서 LDPO-V-PM(VGG-VD와 패치 채굴을 사용)는 비지도 군집 정확도 75.3%를 달성하여 기존 비지도 방법들인 k-means(38.1%) 및 DMS(64.0%)를 크게 앞서며 성능을 뛰어나게 했다.
  • LDPO-V-PM의 성능(75.3%)은 동일한 VGG-VD 모델을 사용한 최신 지도 학습 기반 정확도 81.0%에 매우 가까워지며, 자기지도 표현 학습의 효과성을 입증한다.
  • LDPO-V-PM 특징을 사용해 Liblinear를 활용한 지도 학습 분류 평가에서 72.5%의 정확도를 기록하여, 자기학습된 특징가 매우 분류 가능하고 후속 작업에 적합함을 시사한다.
  • LDPO 프레임워크는 초기화에 대해 강건하다: 무작위 초기화와 k-means 기반 레이블 초기화 모두 유사한 최종 성능를 보이며 수렴 민감도가 낮음을 보였다.
  • 의료 영상 분류에서 LDPO는 AlexNet-FC7-Topic를 사용해 Top-1 분류 정확도 0.8109를 달성하여 기존 비지도 의료 영상 자동 레이블링 최고 성능를 초월했다.
  • 더 깊은 네트워크(VGG-VD)의 사용은 MIT-67과 같은 더 큰 데이터셋에서 성능 향상을 가져왔지만, 더 작은 데이터셋에서는 그렇지 않았으며, 이는 모델 깊이가 고복잡도 상황에서 더 유리함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.