[논문 리뷰] Active learning with MaskAL reduces annotation effort for training Mask R-CNN
이 논문은 마스크 R-CNN를 위한 액티브 러닝 방법인 MaskAL을 제안하며, 비라벨 데이터에서 가장 불확실한(분류하기 어려운) 인스턴스를 반복적으로 선택하여 주석 작업을 줄인다. 전체 데이터셋으로 훈련한 마스크 R-CNN 성능의 93.9%를 뿐만 아니라 훈련 데이터의 17.9%만으로도 달성하였으며, 무작위 샘플링 대비 뛰어난 성능을 보였다. 무작위 샘플링은 900장의 이미지로 MaskAL의 성능을 달성하기 위해 2,300장의 이미지가 필요로 했다.
The generalisation performance of a convolutional neural network (CNN) is influenced by the quantity, quality, and variety of the training images. Training images must be annotated, and this is time consuming and expensive. The goal of our work was to reduce the number of annotated images needed to train a CNN while maintaining its performance. We hypothesised that the performance of a CNN can be improved faster by ensuring that the set of training images contains a large fraction of hard-to-classify images. The objective of our study was to test this hypothesis with an active learning method that can automatically select the hard-to-classify images. We developed an active learning method for Mask Region-based CNN (Mask R-CNN) and named this method MaskAL. MaskAL involved the iterative training of Mask R-CNN, after which the trained model was used to select a set of unlabelled images about which the model was most uncertain. The selected images were then annotated and used to retrain Mask R-CNN, and this was repeated for a number of sampling iterations. In our study, MaskAL was compared to a random sampling method on a broccoli dataset with five visually similar classes. MaskAL performed significantly better than the random sampling. In addition, MaskAL had the same performance after sampling 900 images as the random sampling had after 2300 images. Compared to a Mask R-CNN model that was trained on the entire training set (14,000 images), MaskAL achieved 93.9% of that model's performance with 17.9% of its training data. The random sampling achieved 81.9% of that model's performance with 16.4% of its training data. We conclude that by using MaskAL, the annotation effort can be reduced for training Mask R-CNN on a broccoli dataset with visually similar classes. Our software is available on https://github.com/pieterblok/maskal.
연구 동기 및 목표
- 모델 성능을 훼손하지 않으면서 마스크 R-CNN 훈련에 필요한 주석 작업을 줄이는 것.
- 농업 분야에서 인스턴스 세그멘테이션 데이터를 주석 처리하는 데 소요되는 높은 비용과 시간을 해결하는 것.
- 분류하기 어려운(불확실한) 샘플을 선택하면 모델 수렴 속도가 빨라진다는 가설을 검증하는 것.
- 마스크 R-CNN를 위한 인스턴스 세그멘테이션에 특화된 액티브 러닝 프레임워크를 개발하고 평가하는 것.
- 불확실성 기반 샘플링이 자료 효율적인 훈련에서 무작위 샘플링보다 뛰어나다는 것을 입증하는 것.
제안 방법
- 점차 늘어나는 주석이 부여된 이미지 풀에서 마스크 R-CNN를 반복적으로 훈련하는 방식.
- 훈련된 모델을 사용해 비라벨 이미지에 대해 세그멘테이션 마스크를 예측하고, 예측 신뢰도 기반으로 불확실성 점수를 계산하는 방식.
- 가장 높은 불확실성(낮은 신뢰도)을 보이는 비라벨 이미지를 선별하여 인간 주석 처리를 수행하는 방식.
- 선택된 이미지의 주석을 추가로 부여하고 확장된 데이터셋으로 마스크 R-CNN 모델을 재훈련하는 방식.
- 모델 성능 향상을 위해 다중 반복 샘플링 반복을 수행하는 방식.
- 모델의 예측 마스크 품질 기반 신뢰도 임계값을 사용해 불확실한 샘플을 식별하는 방식.
실험 결과
연구 질문
- RQ1모델의 불확실성 기반 액티브 러닝이 마스크 R-CNN 모델을 훈련하기 위해 필요한 주석 이미지 수를 줄일 수 있는가?
- RQ2분류하기 어려운 인스턴스를 선택하면 무작위 샘플링 대비 더 빠른 수렴과 뛰어난 성능을 달성할 수 있는가?
- RQ3MaskAL로 훈련한 마스크 R-CNN 모델의 성능은 전체 데이터셋으로 훈련한 모델과 비교해 어떻게 되는가?
- RQ4시각적으로 복잡한 农업 데이터셋에서 MaskAL은 무작위 샘플링 대비 얼마나 자료 효율적인가?
- RQ5불확실성 기반 샘플링이 훨씬 적은 주석 훈련 데이터로도 높은 성능을 유지할 수 있는가?
주요 결과
- MaskAL은 전체 데이터셋(14,000장)으로 훈련한 마스크 R-CNN 성능의 93.9%를 뿐만 아니라 훈련 데이터의 17.9%(2,500장)만으로도 달성하였다.
- 무작위 샘플링 기준선은 MaskAL이 900장의 이미지로 달성한 성능을 도달하기 위해 2,300장의 이미지가 필요로 하였다.
- MaskAL은 훈련 과정의 모든 데이터 포인트에서 무작위 샘플링 대비 더 높은 평균 정밀도(mAP)를 기록하였다.
- MaskAL의 성능 향상은 초기 훈련 단계에서 가장 두드러졌으며, 이는 정보가 풍부한 샘플로부터 더 빠른 학습이 가능하다는 것을 시사한다.
- 이 방법은 높은 세그멘테이션 정확도를 유지하면서도, 서로 유사한 5개의 클래스를 포함한 브로콜리 데이터셋에서 주석 작업을 크게 줄였다.
- MaskAL의 소스 코드는 GitHub에 공개되어 있어 재현성과 향후 연구를 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.