[논문 리뷰] The AAU Multimodal Annotation Toolboxes: Annotating Objects in Images and Videos
이 논문은 컴퓨터 시각 연구를 위한 효율적인 다중 모odal(색상 및 열화상) 객체 주석을 위해 설계된 두 가지 C++ 기반 오픈소스 주석 툴박스—Bounding Box Annotator와 Multimodal Pixel Annotator—를 제시한다. OpenCV와 Qt를 기반으로 구축된 이 도구들은 픽셀 마스크, 경계 상자, 분류 태그, 고유 ID, 메타데이터를 지원하며, GrabCut 세그멘테이션, 다각형 그리기, 신경 쓰지 않는 영역 경계, 프레임 일괄 처리 기능을 통해 수만 프레임에 이르는 영상 데이터를 효율적으로 주석 처리할 수 있다.
This tech report gives an introduction to two annotation toolboxes that enable the creation of pixel and polygon-based masks as well as bounding boxes around objects of interest. Both toolboxes support the annotation of sequential images in the RGB and thermal modalities. Each annotated object is assigned a classification tag, a unique ID, and one or more optional meta data tags. The toolboxes are written in C++ with the OpenCV and Qt libraries and are operated by using the visual interface and the extensive range of keyboard shortcuts. Pre-built binaries are available for Windows and MacOS and the tools can be built from source under Linux as well. So far, tens of thousands of frames have been annotated using the toolboxes.
연구 동기 및 목표
- 컴퓨터 시각 연구에서 고품질의 도메인 특화 주석 데이터셋에 대한 증가하는 수요를 해결하기 위해.
- 순차적인 RGB 및 열화상 영상 시퀀스에서 객체를 주석 처리하기 위한 효율적이고 크로스 플랫폼 도구를 제공하기 위해.
- 다양한 시각 응용 분야를 위한 픽셀 수준의 마스크, 경계 상자, 메타데이터 태그를 포함한 융통성 있는 주석 형식을 지원하기 위해.
- 키보드 단축키, 프레임 유지 기능, 일괄 처리 기능을 통해 장기적인 주석 워크플로우를 간소화하기 위해.
- 강건한 시각 시스템 훈련을 위해 다양한 영상 모odal리티(가시광선 및 열화상) 간의 다중 모달 주석을 가능하게 하기 위해.
제안 방법
- 도구들은 GUI를 위한 Qt 프레임워크와 이미지 처리를 위한 OpenCV를 사용한 C++로 구현되어 있으며, Windows, macOS, Linux 간의 크로스 플랫폼 호환성을 확보한다.
- Bounding Box Annotator는 사용자가 직사각형 경계 상자를 그려 각 객체에 클래스 레이블, ID, 메타데이터 태그를 할당할 수 있도록 한다.
- Multimodal Pixel Annotator는 GrabCut, 수동 브러시 페인팅, 다각형 기반 윤곽 그리기를 통해 정밀한 마스크 생성을 지원하는 픽셀 수준의 세그멘테이션을 제공한다.
- 두 도구 모두 '이전/다음 프레임 로드 시 유지' 기능을 통해 인접 프레임 간 주석 전파를 가능하게 하여 시간적 일관성을 확보한다.
- 모호한 객체 경계를 처리하기 위해 회색 값 170을 사용하는 '신경 쓰지 않는 영역 경계' 기능을 지원하며, 설정을 통해 구성할 수 있다.
- 주석은 이미지 경로와 메타데이터를 포함한 단일 CSV 파일에 저장되며, 선택적으로 회색조 마스크 이미지로도 저장 가능하며, COCO 및 경계 상자 형식으로 내보내기 기능을 제공한다.
실험 결과
연구 질문
- RQ1어떻게 하면 영상 시퀀스에서 다중 모달(색상 및 열화상) 객체 주석을 효율적으로 지원할 수 있는 주석 도구를 설계할 수 있는가?
- RQ2대규모 데이터셋에서 주석 처리 시간을 줄이고 일관성을 높이는 데 가장 효과적인 기능은 무엇인가?
- RQ3어떻게 하면 픽셀 수준의 세그멘테이션과 경계 상자 주석을 통합적이고 확장 가능한 도구 프레임워크 안에서 결합할 수 있는가?
- RQ4GrabCut 및 수동 브러시와 같은 상호작용 도구가 복잡한 객체 경계의 세그멘테이션 품질을 향상시키는 데 어떤 역할을 하는가?
- RQ5메타데이터 태그와 객체 추적 상태(예: '마지막 프레임 도달')는 후속 시각 작업을 위한 주석 데이터의 유용성을 어떻게 향상시키는가?
주요 결과
- 이 주석 툴박스들은 인간, 도로 이용자, 동물, 산업 결함 등 다양한 도메인에서 수만 프레임에 이르는 이미지 프레임을 주석 처리하는 데 사용되었다.
- 도구들은 다중 모달 주석을 지원하여 RGB 및 열화상 영상 시퀀스 간 일관된 레이블링을 가능하게 하여 시각 시스템의 강건성을 향상시켰다.
- GrabCut, 수동 브러시, 다각형 도구의 통합은 반복적인 정밀 조정이 가능한 융통성 있고 정확한 픽셀 수준의 세그멘테이션을 가능하게 하였다.
- 고유 ID, 분류 태그, 사용자 정의 메타데이터 태그의 사용은 구조화되고 검색 가능하며 재사용 가능한 주석 데이터를 가능하게 하였다.
- 프레임 유지 및 보간 기능을 통한 효율적인 프레임 단위 주석 처리로, 영상 시퀀스에서 반복 작업을 크게 줄였다.
- COCO 및 경계 상자 형식으로의 내보내기 기능 덕분에 주요 딥러닝 프레임워크 및 벤치마크 파이프라인과의 호환성이 확보되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.