Skip to main content
QUICK REVIEW

[論文レビュー] GeneAnnotator: A Semi-automatic Annotation Tool for Visual Scene Graph

Zhixuan Zhang, Chi Zhang|arXiv (Cornell University)|Sep 6, 2021
Multimodal Machine Learning Applications参考文献 8被引用数 6
ひとこと要約

GeneAnnotator は、画像内のオブジェクト、関係、属性、領域、クラスタを効率的でカスタマイズ可能かつインタラクティブにラベリングできる、半自動的でオープンソースの Python ツールです。ルールベースの関係推薦によりアノテーション作業負荷を低減し、Traffic Genome と呼ばれる高密度な 1,000 枚の画像からなるシーングラフデータセットを構築しました。Visual Genome や VG150 と比較して、属性カバレッジと関係密度の両面で優れた性能を示しています。

ABSTRACT

In this manuscript, we introduce a semi-automatic scene graph annotation tool for images, the GeneAnnotator. This software allows human annotators to describe the existing relationships between participators in the visual scene in the form of directed graphs, hence enabling the learning and reasoning on visual relationships, e.g., image captioning, VQA and scene graph generation, etc. The annotations for certain image datasets could either be merged in a single VG150 data-format file to support most existing models for scene graph learning or transformed into a separated annotation file for each single image to build customized datasets. Moreover, GeneAnnotator provides a rule-based relationship recommending algorithm to reduce the heavy annotation workload. With GeneAnnotator, we propose Traffic Genome, a comprehensive scene graph dataset with 1000 diverse traffic images, which in return validates the effectiveness of the proposed software for scene graph annotation. The project source code, with usage examples and sample data is available at https://github.com/Milomilo0320/A-Semi-automatic-Annotation-Software-for-Scene-Graph, under the Apache open-source license.

研究の動機と目的

  • 視覚的関係理解のためのアクセス可能でカスタマイズ可能かつ効率的なシーングラフアノテーションツールの不足を解消すること。
  • 半自動的関係推薦により、シーングラフ作成における手作業アノテーションの負担を軽減すること。
  • 自動運転など特定の分野に特化した高品質なシーングラフデータセットを研究者がカスタムで構築できるようにすること。
  • 多様なデータ形式に対応し、既存のシーングラフ学習モデルと統合可能なモジュラーで拡張性のあるソフトウェアアーキテクチャを提供すること。
  • Traffic Genome と呼ばれる包括的でオープンソースのデータセットを構築することで、このツールの有効性を実証すること。

提案手法

  • メインアノテーション、半自動アノテーション、補助機能の 3 つの独立したモジュールからなるモジュラーなシステムアーキテクチャを実装すること。
  • ユーザー定義可能なオブジェクトおよび関係のカテゴリ、階層、属性をサポートすることで、分野特化のカスタマイズを可能にすること。
  • オブジェクトタイプと空間的配置に基づいて妥当な関係を提案するルールベースの関係推薦エンジンを統合すること。
  • バウンディングボックスによる領域アノテーションと、近接するオブジェクトのグループ(クラスタ)アノテーションを許可することで、アノテーションの効率性と意味的関連性を向上させること。
  • GUI を通じてリアルタイムで進化するシーングラフを可視化し、即時のフィードバックと検証を可能にすること。
  • 広範な互換性を確保するため、統一された VG150 互換フォーマットおよび個別画像フォーマットの両方でアノテーションをエクスポートすること。

実験結果

リサーチクエスチョン

  • RQ1半自動アノテーションツールは、高品質な視覚的シーングラフを構築するために必要な時間と作業負荷を著しく削減できるか?
  • RQ2注目領域(ROI)およびクラスタレベルのアノテーションを含めることで、アノテーションの効率性とシーングラフの品質はどのように向上するか?
  • RQ3ルールベースの関係推薦は、人的アノテーションの関係と比べて、正確性と関連性の面でどの程度の水準に達するか?
  • RQ4得られたデータセット(Traffic Genome)は、Visual Genome や VG150 といった既存のベンチマークと比較して、オブジェクトおよび関係の密度、属性カバレッジ、構造的完全性の観点でどの程度優れているか?
  • RQ5生成されたデータセットは、最先端のシーングラフ生成モデルの学習および評価を効果的にサポートできるか?

主な発見

  • Traffic Genome には 1,000 枚の画像に合計 29,192 の関係が含まれており、1 枚あたり平均 29.19 の関係を有する。これは Visual Genome の平均 14.17 や VG150 の 5.76 よりも 2 倍以上高い。
  • Traffic Genome におけるオブジェクト 1 つあたりの平均関係数は 3.02 であり、Visual Genome の 1.36 や VG150 の 2.02 よりも著しく高い。これは、はるかに高密度なシーングラフ構造であることを示している。
  • Traffic Genome の関係の 43.85% が空間的関係(例:「左側に」)であり、42.04% が領域ベースの関係(例:「道路上を走行中」)である。これは、空間的推論のカバレッジが非常に高いことを示している。
  • Traffic Genome は方向属性(前方、左方、右方、後方)を 100% のカバレッジで実装しており、Visual Genome の 58.65% や VG150 の 53.66% を大きく上回っている。
  • Traffic Genome で微調整されたシーングラフモデルは、競争力ある述語分類性能を示しており、VCTree では mR@100 スコアが最大 24.85、VCTree-TDE では 20.87 を達成。これは VG150 での結果と同等またはそれを上回っている。
  • GeneAnnotator の半自動機能とモジュラー設計により、効率的でスケーラブルかつ拡張可能なアノテーションが可能であり、高品質で分野特化したデータセットの構築によってその有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。