[論文レビュー] Data Augmentation for Object Detection via Differentiable Neural Rendering
本稿では、オブジェクト検出のための新しいオフラインデータ拡張手法であるDifferentiable Neural Renderingベースのデータ拡張(DANR)を提案する。この手法は、3Dに意識した特徴投影と深度推定を用いて、現実的で新しい視点の画像を生成するとともに、自動的に対応するバウンディングボックスアノテーションを生成する。本手法は、データが不足する状況下でも検出性能を顕著に向上させ、特に長尾分布や低リソースデータセットにおいて優れた効果を示すが、既存のオンライン拡張技術とも完全に互換性がある。
It is challenging to train a robust object detector under the supervised learning setting when the annotated data are scarce. Thus, previous approaches tackling this problem are in two categories: semi-supervised learning models that interpolate labeled data from unlabeled data, and self-supervised learning approaches that exploit signals within unlabeled data via pretext tasks. To seamlessly integrate and enhance existing supervised object detection methods, in this work, we focus on addressing the data scarcity problem from a fundamental viewpoint without changing the supervised learning paradigm. We propose a new offline data augmentation method for object detection, which semantically interpolates the training data with novel views. Specifically, our new system generates controllable views of training images based on differentiable neural rendering, together with corresponding bounding box annotations which involve no human intervention. Firstly, we extract and project pixel-aligned image features into point clouds while estimating depth maps. We then re-project them with a target camera pose and render a novel-view 2d image. Objects in the form of keypoints are marked in point clouds to recover annotations in new views. Our new method is fully compatible with online data augmentation methods, such as affine transform, image mixup, etc. Extensive experiments show that our method, as a cost-free tool to enrich images and labels, can significantly boost the performance of object detection systems with scarce training data. Code is available at \url{https://github.com/Guanghan/DANR}.
研究の動機と目的
- 教師あり学習の文脈で、パラダイムを変更せずにデータが不足する状況下でも頑健なオブジェクト検出器を訓練する課題に対処すること。
- 完全に自動化されたバウンディングボックスアノテーションを伴い、意味的に意味のある現実的で新しい視点の訓練画像を生成すること。
- 従来のオンライン拡張法を超えて、多様性と現実性を高めた制御可能で3Dに意識したデータ拡張手法を提供すること。
- mixup やアフィン変換などの既存のオンラインデータ拡張技術と完全に互換性を持つこと。
- 少数クラスのサンプルが不足する長尾分布データセットにおける性能向上を図ること。
提案手法
- まず、入力されたRGB画像から深度マップを推定し、ピクセル単位の特徴を抽出する。
- これらの特徴を3D潜在空間に点群として投影し、オブジェクトインスタンスはキーポイントとしてマークする。
- 微分可能なニューラルレンダリングパイプラインを用いて、点群を新しいカメラポーズから再投影し、2Dの新しい視点画像を生成する。
- 3D点群内のキーポイントを用いて、人為的介入なしに新しい視点における正確なバウンディングボックスアノテーションを回復する。
- アプローチは完全に微分可能であり、画像とアノテーション生成のエンドツーエンド最適化を可能にする。
- 任意のカメラポーズ制御をサポートしており、多様で意味的に一貫性のあるデータ拡張を実現する。
実験結果
リサーチクエスチョン
- RQ1微分可能なニューラルレンダリングは、データが不足する状況下でオブジェクト検出器の一般化性能を向上させる現実的で多様な新しい視点の画像を生成できるか?
- RQ2これらの新しい視点に対して、人為的ラベル付けなしに自動的かつ正確にバウンディングボックスアノテーションを生成できるか?
- RQ3DANRを用いて訓練されたオブジェクト検出器の性能は、標準的なオンライン拡張法を用いた場合と比較して、低データ環境下でどのように異なるか?
- RQ4本手法は、1段階検出器と2段階検出器の両方の検出器アーキテクチャ、およびResNetとResNeStのバックボーンに対して、同等に有効性を維持するか?
- RQ5解像度と深度推定の正確さが、拡張データの品質および下流の検出性能に与える影響は何か?
主な発見
- ICR-Weapon、ICR-Flag、ICR-Logoの各データセットにおいて、DANRはデータが不足する条件下で、それぞれAUCを0.68から0.75、0.72から0.97、0.73から0.96に向上させた。
- インDoorデータセットでは、ResNeSt-50バックボーンを用いた場合、APが69.4から79.6に上昇し、訓練データが不足していない状況でも一貫した向上を示した。
- 1段階検出器を用いたインDoorデータセットでは、APが10.2ポイント(69.4から79.6)上昇し、AP50が2.3ポイント(95.4から97.7)上昇した。
- 小サイズオブジェクトの検出性能向上が顕著で、インDoorデータセットではAP_Sが56.5から61.4に上昇した。
- COCOデータセットでは、データ量の多さと解像度制限のため、DANRによる向上は限定的であったが、小サイズオブジェクトの検出リ콜は向上した。
- 本手法はオンライン拡張と完全に互換性があり、両者の併用により、評価されたすべての設定でさらなる性能向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。