Skip to main content
QUICK REVIEW

[논문 리뷰] PatchDCT: Patch Refinement for High Quality Instance Segmentation

Qinrou Wen, Jirui Yang|arXiv (Cornell University)|2023. 02. 06.
Advanced Image and Video Retrieval Techniques인용 수 5
한 줄 요약

PatchDCT는 DCT 복호화 마스크를 패치로 분할하고 각 패치를 삼중 분류기와 저차원 DCT 벡터 회귀기로 정제하는 새로운 패치 기반 정교화 프레임워크를 제안한다. 이는 Cityscapes에서 Mask-RCNN 대비 4.5% AP 및 7.0% Boundary AP 향상을 달성하며, DCT-Mask 대비 1.3% AP 및 4.2% Boundary AP 향상을 이룬다. 이와 동시에 최소한의 추론 속도 오버헤드를 유지한다.

ABSTRACT

High-quality instance segmentation has shown emerging importance in computer vision. Without any refinement, DCT-Mask directly generates high-resolution masks by compressed vectors. To further refine masks obtained by compressed vectors, we propose for the first time a compressed vector based multi-stage refinement framework. However, the vanilla combination does not bring significant gains, because changes in some elements of the DCT vector will affect the prediction of the entire mask. Thus, we propose a simple and novel method named PatchDCT, which separates the mask decoded from a DCT vector into several patches and refines each patch by the designed classifier and regressor. Specifically, the classifier is used to distinguish mixed patches from all patches, and to correct previously mispredicted foreground and background patches. In contrast, the regressor is used for DCT vector prediction of mixed patches, further refining the segmentation quality at boundary locations. Experiments on COCO show that our method achieves 2.0%, 3.2%, 4.5% AP and 3.4%, 5.3%, 7.0% Boundary AP improvements over Mask-RCNN on COCO, LVIS, and Cityscapes, respectively. It also surpasses DCT-Mask by 0.7%, 1.1%, 1.3% AP and 0.9%, 1.7%, 4.2% Boundary AP on COCO, LVIS and Cityscapes. Besides, the performance of PatchDCT is also competitive with other state-of-the-art methods.

연구 동기 및 목표

  • Mask-RCNN 및 DCT-Mask에서의 군더미 마스크 표현의 한계를 해결하여 세밀한 세부 사항과 경계 정확도를 유지하지 못하는 문제를 해결한다.
  • 전체 DCT 벡터 정교화의 불안정성 문제를 해결하여, 전역적 종속성으로 인해 작은 변화가 전체 마스크에 영향을 미치는 것을 방지한다.
  • 마스크 정교화를 국소적 패치 수준의 작업으로 분리함으로써 다단계 정교화를 가능하게 하여 경계 정밀도와 세그멘테이션 품질을 향상시킨다.
  • 기본 방법 대비 거의 영향을 주지 않는 계산 오버헤드를 유지하면서도 고해상도 마스크 출력을 유지할 수 있는 경량이고 효율적인 프레임워크를 설계한다.

제안 방법

  • 300차원 DCT 벡터에서 복호화된 고해상도 마스크를 겹치지 않는 패치들(예: 8×8 또는 14×14)으로 분해하여 국소적 정교화를 수행한다.
  • 각 패치를 배경, 전경, 혼합으로 분류하는 삼중 분류기를 사용하여 잘못 예측된 영역을 수정한다.
  • 혼합 패치에 대해서만 저차원(예: 6차원) DCT 벡터를 예측하는 DCT 벡터 회귀기를 적용하여 경계 세부 정보를 정교화한다.
  • 역디스crete余弦변환(IDCT)을 사용해 정교화된 패치를 재구성하고, 정확히 분류된 패치들과 병합하여 최종 고해상도 마스크를 구성한다.
  • 패치 간 독립성을 확보하여 한 패치의 DCT 벡터 변경이 다른 패치에 영향을 주지 않도록 하여 전반적인 마스크 왜곡을 방지한다.
  • 분류기와 회귀기를 다중 작업 손실을 통해 엔드 투 엔드로 훈련하여 분류 정확도와 DCT 벡터 재구성 정밀도를 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1전체 DCT 벡터 정교화 대비 국소적 패치 수준의 DCT 인코딩 마스크 정교화가 인스턴스 세그멘테이션 품질 향상에 기여하는가?
  • RQ2마스크 정교화를 전경, 배경, 혼합 패치 카테고리로 분리함으로써 경계 정확도 향상과 잘못된 예측 감소에 기여하는가?
  • RQ3혼합 패치에 대해 저차원 DCT 벡터 회귀를 적용함으로써 계산 비용 증가 없이 세밀한 경계 세부 정보를 효과적으로 복원할 수 있는가?
  • RQ4패치 크기와 DCT 벡터 차원 수가 정교화 품질과 모델 복잡도 사이의 트레이드오프에 미치는 영향은 어떠한가?
  • RQ5다단계 정교화가 유의미한 성능 향상을 이끌어내며, 한 단계의 PatchDCT만으로도 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • PatchDCT는 COCO에서 Mask-RCNN 대비 2.0% AP 및 3.4% Boundary AP 향상, LVIS에서는 3.2% AP 및 5.3% Boundary AP 향상, Cityscapes에서는 4.5% AP 및 7.0% Boundary AP 향상 달성.
  • COCO에서 DCT-Mask 대비 0.7% AP 및 0.9% Boundary AP 향상, LVIS에서는 1.1% AP 및 1.7% Boundary AP 향상, Cityscapes에서는 1.3% AP 및 4.2% Boundary AP 향상 달성.
  • 이중 분류보다 삼중 분류기가 0.3% AP 및 0.4% AP* 향상으로 더 우수한 성능을 보이며, 잘못 예측된 전경 및 배경 패치 보정의 중요성을 입증한다.
  • 회귀기 제거 시 AP B는 1.2% 감소하고 AP* B는 3.0% 감소하여, 경계 세부 정보 정교화에서의 핵심적 역할을 확인한다.
  • 패치당 6차원 DCT 벡터가 최적의 성능을 달성하며, 이 이상의 차원 수에서는 수익 감소 현상이 나타난다.
  • 한 단계의 PatchDCT가 충분히 효과적이며, 두 단계 정교화는 성능 향상이 미미하지만 계산 비용은 거의 두 배로 증가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.