Skip to main content
QUICK REVIEW

[논문 리뷰] LOST: A flexible framework for semi-automatic image annotation

Jonas Jäger, Gereon Reus|arXiv (Cornell University)|2019. 10. 16.
Advanced Image and Video Retrieval Techniques참고 문헌 26인용 수 4
한 줄 요약

LOST는 다양한 도구와 기계학습 모델을 조합할 수 있는 유연하고 개방형 프레임워크로, 반자동 이미지 주석을 가능하게 한다. 객체 검출 제안과 클러스터링 기반 레이블 할당을 통합함으로써, 반복적인 보완 과정 동안 높은 주석 품질(mAP ~80%)을 유지하면서도 주석 시간을 최대 2배까지 줄일 수 있다. 이는 후속 반복에서 단일 단계 주석보다 우수한 성능을 보인다.

ABSTRACT

State-of-the-art computer vision approaches rely on huge amounts of annotated data. The collection of such data is a time consuming process since it is mainly performed by humans. The literature shows that semi-automatic annotation approaches can significantly speed up the annotation process by the automatic generation of annotation proposals to support the annotator. In this paper we present a framework that allows for a quick and flexible design of semi-automatic annotation pipelines. We show that a good design of the process will speed up the collection of annotations. Our contribution is a new approach to image annotation that allows for the combination of different annotation tools and machine learning algorithms in one process. We further present potential applications of our approach. The source code of our framework called LOST (Label Objects and Save Time) is available at: https://github.com/l3p-cv/lost.

연구 동기 및 목표

  • 컴퓨터 비전 연구에서 수동 이미지 주석의 높은 시간 비용을 해결하기 위해.
  • 다양한 주석 도구와 기계학습 모델을 조합할 수 있는 민첩하고 구성 가능한 워크플로우를 제공하기 위해.
  • 작업을 단순한 단계와 전문가 단계로 분리하여 전문가 주석 시간을 줄이기 위해.
  • 시간이 지남에 따라 모델을 개선하는 피드백 루프를 갖춘 반복적이고 자가 향상되는 주석 파이프라인을 지원하기 위해.
  • 확장 가능하고 협업이 가능한 데이터셋 구축을 위한 재사용 가능하고 개방형 프레임워크를 제공하기 위해.

제안 방법

  • LOST는 웹 기반 인터페이스를 사용한 모듈식 구성 요소를 활용해 구성 가능한 파이프라인으로 주석을 모델링한다.
  • 경계 상자 및 클래스 제안을 생성하기 위해 객체 검출(ResNet50)과 특징 임베딩(ResNet50)을 통합한다.
  • 이중 단계 루프를 사용한다: 첫 번째 단계에서는 경계 상자가 제안되고 그려지고, 두 번째 단계에서는 MIA(Multi-Image Annotation) 인터페이스를 통해 상자 클러스터가 레이블링된다.
  • 각 루프 반복 후 새로 주석 처리된 데이터로 모델(ResNet50, RetinaNet)을 미세 조정함으로써 반복적 보완을 지원한다.
  • 파이프라인 논리와 데이터 플로우를 완전히 제어하기 위해 사용자 정의 파이썬 스크립트를 삽입할 수 있다.
  • 시스템은 Docker를 통한 로컬 배포 또는 클라우드 기반 협업 플랫폼으로 배포할 수 있다.

실험 결과

연구 질문

  • RQ1민첩하고 구성 가능한 프레임워크는 높은 품질의 레이블을 유지하면서도 주석 시간을 줄일 수 있는가?
  • RQ2반복적이고 모델 유도 주석이 단일 단계 수동 주석에 비해 시간과 정확도 측면에서 어떻게 비교되는가?
  • RQ3클러스터링과 배치 주석(MIA를 통한)이 전문가 주석 노력에 얼마나 기여하는가?
  • RQ4피드백 루프를 갖춘 자가 향상 파이프라인은 시간이 지남에 따라 주석 품질을 유지하거나 향상시킬 수 있는가?
  • RQ5간단한(제안 검토)과 전문가(레이블 할당) 작업으로의 노동 분리 전략은 얼마나 효과적인가?

주요 결과

  • 반복적인 후속 반복에서, 루프 기반의 이중 단계 주석 방식은 단일 단계 주석 대비 상자당 평균 주석 시간을 2배로 줄였다.
  • 주석 품질은 약 80% mAP로 안정적으로 유지되었으며, 표준편차 4.3%로 주석자 집중도와 이미지 난이도의 영향을 반영했다.
  • RetinaNet의 검출 성능은 반복 과정에서 향상되어 Pascal VOC 2007에서 mAP 58%에 도달했으며, 완전히 지도 학습된 모델의 66% mAP에 가까워졌다.
  • MIA 인터페이스를 통해 클러스터 수준의 레이블 할당이 가능해져, 상자별 레이블 할당 대비 클래스 레이블링 시간을 최대 50%까지 단축시켰다.
  • 프레임워크 덕분에 작업 분리가 효과적으로 이루어졌으며, 단순한 상자 그리기와 전문가 레이블 할당이 분리되어 전문가 시간 의존도가 감소했다.
  • 휴식 시간(예: 야간) 동안 모델을 훈련함으로써 실질적으로 계산 오버헤드를 무시할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.