Skip to main content
QUICK REVIEW

[論文レビュー] Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point Supervision

Yi Yu, Xue Yang|arXiv (Cornell University)|Nov 23, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

Point2RBox は、合成視覚パターンと変換自己教師学習を活用して、バウンディングボックスやマスクのアノテーションを必要とせずに回転バウンディングボックス(RBox)を回帰する、エンドツーエンドで単一の点アノテーションに依存するオriented object detection手法を提案する。軽量で単一段階のパラダイムを採用し、DOTA/DIOR/HRSC でそれぞれ 41.05%/27.62%/80.01% の AP を達成し、最先端の性能を実現した。

ABSTRACT

With the rapidly increasing demand for oriented object detection (OOD), recent research involving weakly-supervised detectors for learning rotated box (RBox) from the horizontal box (HBox) has attracted more and more attention. In this paper, we explore a more challenging yet label-efficient setting, namely single point-supervised OOD, and present our approach called Point2RBox. Specifically, we propose to leverage two principles: 1) Synthetic pattern knowledge combination: By sampling around each labeled point on the image, we spread the object feature to synthetic visual patterns with known boxes to provide the knowledge for box regression. 2) Transform self-supervision: With a transformed input image (e.g. scaled/rotated), the output RBoxes are trained to follow the same transformation so that the network can perceive the relative size/rotation between objects. The detector is further enhanced by a few devised techniques to cope with peripheral issues, e.g. the anchor/layer assignment as the size of the object is not available in our point supervision setting. To our best knowledge, Point2RBox is the first end-to-end solution for point-supervised OOD. In particular, our method uses a lightweight paradigm, yet it achieves a competitive performance among point-supervised alternatives, 41.05%/27.62%/80.01% on DOTA/DIOR/HRSC datasets.

研究の動機と目的

  • バウンディングボックスやマスクのアノテーションを必要とせず、単一の点アノテーションのみを用いた最小限の監督のもとでオriented object detector を学習する課題に対処すること。
  • 2段階のパイプライン(例:Point-to-HBox-to-RBox)が遅く、精度的にも最適でないという制限を克服すること。
  • 点アノテーションから直接 RBox を回帰する、新規のエンドツーエンドフレームワークを構築し、アノテーションコストと複雑さを低減すること。
  • 画像変換と合成パターンの知識を組み合わせた自己教師学習により、モデルの汎化性とロバスト性を向上させること。

提案手法

  • 合成パターンの知識の組み合わせ:各点アノテーションの周囲に、長方形、円、テクスチャ付き形状、スケッチ風のパターンなどの合成視覚パターンを生成し、RBox回帰のための暗黙的なサイズおよび方向の手がかりを提供する。
  • 変換自己教師学習:入力画像に幾何変換(回転、反転、スケーリング)を適用し、予測された RBox が同じ変換に従うように制約を課すことで、ネットワークが相対的なサイズおよび回転不変性を学習できるようにする。
  • 分類スコアに基づいて割り当てられる、同じサイズの複数のアノテーションを用いることで、点アノテーションにサイズ情報が欠落している場合でも、局所化の精度を向上させる。
  • 実際の点アノテーションと合成パターンの知識を統合し、分類と回帰を統合的かつエンドツーエンドに同時に監視する。
  • FPN を使用しない軽量な検出器アーキテクチャ(例:YOLOF-A1)を設計することで、効率性と点ベースの監督との互換性を維持する。
  • 訓練中にノイズ増幅を適用することで、境界が曇っている物体に対して特に有効なロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1バウンディングボックスやマスクのアノテーションを一切必要とせず、単一の点アノテーションでの監督のもとで、オriented object detection で競争力のある性能を達成できるか?
  • RQ21つの点しか与えられていない状況で、合成視覚パターンをどれだけ効果的に用いて、物体のサイズと方向を推定できるか?
  • RQ3変換自己教師学習が、物体間の相対的なスケールや回転を認識する能力をどの程度向上させるか?
  • RQ42段階のパイプライン(例:Point-to-HBox-to-RBox)と比較して、精度と推論速度の両面で、本手法はどの程度優れているか?
  • RQ5本手法は、物体の形状や境界の曇り具合が異なる多様なデータセットに対しても汎化可能か?

主な発見

  • ResNeSt-CSPNeXt-l バッキングで、Point2RBox は DOTA で 41.05% AP、DIOR で 27.62%、HRSC で 80.01% を達成し、SOTA 2段階パイプライン(P2BNet + H2RBox-v2)を大きく上回った。
  • ResNet50 バッキングを用いた場合、Point2RBox は DOTA で 40.27% AP、DIOR で 27.34%、HRSC で 79.40% を達成し、最小限の監督のもとで強力な性能を示した。
  • 回転と反転を用いた変換自己教師学習モジュールは、全データセットで平均 4.29% の性能向上をもたらし、スケーリングを追加するとさらに 1.82% 向上した。
  • 合成パターンにカーブテクスチャを追加すると、HRSC での性能が 75.01% から 78.77% に向上し、より洗練されたパターン設計の有効性が示された。
  • スケッチ風の合成パターンを用いることで、基本形状と比較して DOTA で 7.35% の性能向上が得られ、境界の意味的整合性の価値が裏付けられた。
  • モデルはアノテーションノイズに対してロバストである:10% のノイズ条件下では DIOR で 30.82% にわずかに向上し、20% のノイズでも平均でたった 1.03% の低下にとどまり、実世界のラベルエラーに耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。