Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end optimized image compression for multiple machine tasks

Lahiru D. Chamain, Fabien Racapé|arXiv (Cornell University)|2021. 03. 06.
Algorithms and Data Compression참고 문헌 1인용 수 9
한 줄 요약

이 논문은 객체 검출을 위해 최적화된 단일 이미지 디코더와 후속 기계비전 모델 사이에 삽입되는 경량이며 작업에 종속되지 않는 신경 모듈인 'Connectors'를 제안한다. 이로 인해 하나의 종단 간 최적화된 코덱(예: 객체 검출을 위한)이 여러 부가 작업(예: 이미지 분류, 세분화)에서 뛰어난 성능을 달성할 수 있다. 검출 최적화된 코덱의 특징을 변환함으로써, 코덱 또는 부가 모델의 재학습 없이도 ImageNet-1K에서 최상위 5 정확도가 최대 8.75% 향상되고 COCO에서 mAP가 4.6% 향상된다.

ABSTRACT

An increasing share of captured images and videos are transmitted for storage and remote analysis by computer vision algorithms, rather than to be viewed by humans. Contrary to traditional standard codecs with engineered tools, neural network based codecs can be trained end-to-end to optimally compress images with respect to a target rate and any given differentiable performance metric. Although it is possible to train such compression tools to achieve better rate-accuracy performance for a particular computer vision task, it could be practical and relevant to re-use the compressed bit-stream for multiple machine tasks. For this purpose, we introduce 'Connectors' that are inserted between the decoder and the task algorithms to enable a direct transformation of the compressed content, which was previously optimized for a specific task, to multiple other machine tasks. We demonstrate the effectiveness of the proposed method by achieving significant rate-accuracy performance improvement for both image classification and object segmentation, using the same bit-stream, originally optimized for object detection.

연구 동기 및 목표

  • 다양한 기계비전 작업에 대해 비용-왜곡 최적화된 코덱을 사용할 때의 비효율성을 해결하기 위해.
  • 하나의 종단 간 최적화된 코덱(예: 객체 검출을 위한 주요 작업에 대해 훈련된)을 여러 후속 작업(예: 분류, 세분화)으로 재사용할 수 있도록 하기 위해.
  • 코덱의 재학습 없이도 주요 작업 최적화된 디코더에서 유도된 특징을 부가 작업(예: 분류, 세분화)에 적합한 표현으로 변환할 수 있는 경량이며 작업에 종속되지 않는 적응 메커니즘을 개발하기 위해.
  • 종단 간 최적화된 코덱이 복잡한 데이터셋(예: COCO)에서 특징을 풍부하게 유지함으로써 다양한 비전 작업으로 일반화될 수 있음을 입증하기 위해.

제안 방법

  • PSNR가 아닌 비용과 검출 정확도(mAP)의 균형을 맞추는 손실 함수를 사용하여 객체 검출을 위해 종단 간 신경 이미지 코덱을 훈련한다.
  • 스케일 하이퍼프리오리 기반의 사전 훈련된 비용-검출 최적화 코덱을 사용하여 이미지를 압축하여, 검출에 최적화되었지만 시각적으로 왜곡된 특징을 생성한다.
  • 디코더와 부가 작업 모델 사이에 삽입되는 작은, 훈련 가능한 신경 모듈인 'Connectors'(예: 1x1 컨벌루션, 디프스와이즈 컨벌루션, 평균 풀링)를 도입하여 특징 표현을 변환한다.
  • 한 번만 수행되는, 작업에 종속되지 않는 방식으로 Connectors를 훈련하여 검출 최적화된 코덱의 특징을 분류 및 세분화와 같은 부가 작업에 적합한 표현으로 매핑한다.
  • 기존의 분류 및 세분화 모델을 검출 최적화된 코덱의 특징에 대해 훈련시키되, Connectors를 사용하여 특징 호환성을 향상시킨다.
  • ImageNet-1K(분류), COCO-2017(객체 검출), Cityscapes(세분화)에서 성능을 평가하여, 기준 비용-왜곡 최적화 코덱 및 비용-정확도-왜곡 최적화 코덱과 비교한다.

실험 결과

연구 질문

  • RQ1한 번의 기계비전 작업(예: 객체 검출)에 최적화된 단일 이미지 코덱이 재압축 또는 코덱 재학습 없이도 여러 다른 후속 작업(예: 분류, 세분화)에 효과적으로 재사용될 수 있는가?
  • RQ2경량이며 작업에 종속되지 않는 Connectors가 검출 최적화된 코덱의 특징을 변형하여 관련 없는 비전 작업의 성능을 향상시키는 데 얼마나 효과적인가?
  • RQ3검출을 위해 종단 간 최적화된 코덱이 시각적 정확도를 희생시키더라도 다른 비전 작업에 유용한 특징을 유지하거나 향상시키는가?
  • RQ4검출 최적화된 특징에 대한 미세조정 전략이 표준 비용-왜곡 최적화 코덱에 비해 부가 작업 정확도를 얼마나 향상시키는가?
  • RQ5여러 데이터셋과 작업에서 Connectors의 성능이 원시적인 검출 최적화된 특징에 직접 추론하는 것과 비교해 어떻게 되는가?

주요 결과

  • 검출 최적화된 코덱을 사용할 때, COCO-2017 객체 검출에서 기준 비용-왜곡 코덱 대비 mAP가 4.6% 상승한다.
  • ImageNet-1K에서 Connectors는 비트레이트 0.2203 BPP에서 최상위 5 분류 정확도를 66.43%에서 75.18%로 8.75% 향상시켜 강력한 일반화 능력을 보여준다.
  • 미세조정 없이도 검출 최적화된 코덱에 Connectors를 적용한 결과가 비용-왜곡 최적화된 코덱보다 부가 작업 정확도에서 뛰어나, 특징의 유용성이 유지됨을 시사한다.
  • 평균 풀링 및 2D 디프스와이즈 컨벌루션 Connectors는 특징 호환성을 크게 향상시키며, 후자는 단순한 평균 풀링보다 더 높은 정확도 향상을 달성한다.
  • 저비트레이트(예: 0.1119 BPP)에서 Connectors는 PSNR를 J-FT의 17.36 dB에서 J-FT + Conv의 21.14 dB로 상승시켜, 특징 변환으로 인해 부가 작업의 복원 품질 향상이 이루어짐을 보여준다.
  • 검출 최적화된 특징에 대해 ResNet-50 분류기의 미세조정을 Connectors를 사용하여 수행한 결과, 표준 비용-왜곡 최적화 이미지에 대해 미세조정한 것보다 더 높은 정확도를 달성하여 특징 공간의 가치를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.