Skip to main content
QUICK REVIEW

[논문 리뷰] Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point Supervision

Yi Yu, Xue Yang|arXiv (Cornell University)|2023. 11. 23.
Advanced Neural Network Applications인용 수 5
한 줄 요약

Point2RBox는 유사한 시각 패턴과 변환 자기지도 학습을 활용하여 바운딩 박스나 마스크 애너테이션 없이도 회전된 바운딩 박스(RBoxes)를 회귀할 수 있는 엔드 투 엔드, 단일 점 주도의 오리엔티드 객체 검출 방법을 제안한다. 이는 경량이며 단일 단계 파이프라인임에도 불구하고 DOTA/DIOR/HRSC에서 각각 41.05%/27.62%/80.01% AP의 최신 기술 수준 성능을 달성한다.

ABSTRACT

With the rapidly increasing demand for oriented object detection (OOD), recent research involving weakly-supervised detectors for learning rotated box (RBox) from the horizontal box (HBox) has attracted more and more attention. In this paper, we explore a more challenging yet label-efficient setting, namely single point-supervised OOD, and present our approach called Point2RBox. Specifically, we propose to leverage two principles: 1) Synthetic pattern knowledge combination: By sampling around each labeled point on the image, we spread the object feature to synthetic visual patterns with known boxes to provide the knowledge for box regression. 2) Transform self-supervision: With a transformed input image (e.g. scaled/rotated), the output RBoxes are trained to follow the same transformation so that the network can perceive the relative size/rotation between objects. The detector is further enhanced by a few devised techniques to cope with peripheral issues, e.g. the anchor/layer assignment as the size of the object is not available in our point supervision setting. To our best knowledge, Point2RBox is the first end-to-end solution for point-supervised OOD. In particular, our method uses a lightweight paradigm, yet it achieves a competitive performance among point-supervised alternatives, 41.05%/27.62%/80.01% on DOTA/DIOR/HRSC datasets.

연구 동기 및 목표

  • 바운딩 박스나 마스크 애너테이션 대신 단일 점 애너테이션만을 사용하는 최소한의 주도 방식으로 오리엔티드 객체 검출기를 훈련하는 데 도전한다.
  • 두 단계 파이프라인(예: Point-to-HBox-to-RBox)이 느리고 정확도가 열악한 점을 개선한다.
  • 점 주도에서 직접 RBoxes를 회귀하는 새로운 엔드 투 엔드 프레임워크를 개발하여 애너테이션 비용과 복잡성을 줄인다.
  • 이미지 변환과 유사한 패턴 지식의 조합을 통한 자기지도 학습을 통해 모델의 일반화 능력과 강건성을 향상시킨다.

제안 방법

  • 유사한 패턴 지식 조합: 각 점 애너테이션 주변에 직사각형, 원, 무늬가 있는 형태, 또는 스케치 유사 패턴과 같은 유사한 시각 패턴을 생성하여 RBox 회귀를 위한 암묵적인 크기 및 방향 정보를 제공한다.
  • 변환 자기지도 학습: 입력 이미지에 기하학적 변환(회전, 뒤집기, 스케일링)을 적용하고 예측된 RBoxes가 동일한 변환을 따라야 한다는 조건을 부여함으로써, 네트워크가 상대적 크기 및 회전 불변성을 학습하도록 유도한다.
  • 동일한 크기의 여러 앵커를 분류 점수에 따라 할당하여, 점 주도에서 크기 정보가 누락된 상황에서도 정밀한 정위치를 향상시킨다.
  • 유사한 패턴 지식을 실제 점 애너테이션과 융합하여 분류 및 회귀를 통합된 엔드 투 엔드 방식으로 공동으로 주도한다.
  • 경량이며 FPN을 포함하지 않는 검출기 아키텍처(예: YOLOF-A1)를 설계하여 효율성과 점 기반 주도와의 호환성을 유지한다.
  • 훈련 중에 노이즈 증강을 적용하여 경계가 모호한 객체에 대해 더 강건한 성능을 확보한다.

실험 결과

연구 질문

  • RQ1단일 점 주도 검출기가 바운딩 박스나 마스크 애너테이션 없이도 경쟁 가능한 성능을 내는가?
  • RQ2단일 점만 제공될 경우, 유사한 시각 패턴이 객체의 크기와 방향을 얼마나 효과적으로 추론할 수 있는가?
  • RQ3변환 자기지도 학습이 객체 간 상대적 척도와 회전을 인식하는 데 모델의 능력을 얼마나 향상시키는가?
  • RQ4두 단계 파이프라인(예: Point-to-HBox-to-RBox)과 비교할 때 정확도와 추론 속도 측면에서 본 방법의 성능은 어떠한가?
  • RQ5다양한 객체 형태와 경계의 모호함을 가진 다양한 데이터셋 간에 본 방법이 일반화 가능한가?

주요 결과

  • ResNeSt-CSPNeXt-l 백본을 사용할 경우 Point2RBox는 DOTA에서 41.05% AP, DIOR에서 27.62%, HRSC에서 80.01%를 기록하여 최신 기술 수준의 두 단계 파이프라인(P2BNet + H2RBox-v2)을 크게 앞서는 성능을 달성한다.
  • ResNet50 백본을 사용할 경우 Point2RBox는 DOTA에서 40.27% AP, DIOR에서 27.34%, HRSC에서 79.40%를 기록하여 최소한의 주도 조건에서도 강력한 성능을 보여준다.
  • 회전 및 뒤집기 변환을 적용할 경우 변환 자기지도 학습 모듈이 평균적으로 4.29% 향상시키며, 스케일링을 추가로 적용하면 추가로 1.82% 향상된다.
  • 유사한 패턴에 곡선 무늬를 추가하면 HRSC에서 성능이 75.01%에서 78.77%로 향상되어 더 rich한 패턴 설계의 이점이 있음을 보여준다.
  • 스케치 기반 유사 패턴을 사용할 경우 기본 형태 대비 DOTA에서 성능이 7.35% 향상되어 의미 있는 경계 일치의 가치를 입증한다.
  • 모델은 애너테이션 노이즈에 강건하다: 10% 노이즈 상황에서 DIOR의 성능은 약간 향상되어 30.82%로 상승하고, 20% 노이즈 시 평균적으로 1.03% 감소에 그쳐 실제 레이블링 오류에 대한 내성성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.