[論文レビュー] TICaM: A Time-of-flight In-car Cabin Monitoring Dataset
TICaM は、6.7K の実際のおよび 3.3K の合成の時間飛び時間深度、RGB、赤外線画像を含む大規模かつマルチモーダルな車内キャビンモニタリングデータセットであり、2次元/3次元検出、インスタンスおよびセマンティックセグメンテーション、アクティビティ認識の包括的なアノテーションを備えています。本データセットは、自律走行車両の安全性および人間-車両インタラクションシステムのための耐障害性の高い学習とドメイン適応評価を可能にするために、実データと合成データを独自に組み合わせています。
We present TICaM, a Time-of-flight In-car Cabin Monitoring dataset for vehicle interior monitoring using a single wide-angle depth camera. Our dataset addresses the deficiencies of currently available in-car cabin datasets in terms of the ambit of labeled classes, recorded scenarios and provided annotations; all at the same time. We record an exhaustive list of actions performed while driving and provide for them multi-modal labeled images (depth, RGB and IR), with complete annotations for 2D and 3D object detection, instance and semantic segmentation as well as activity annotations for RGB frames. Additional to real recordings, we provide a synthetic dataset of in-car cabin images with same multi-modality of images and annotations, providing a unique and extremely beneficial combination of synthetic and real data for effectively training cabin monitoring systems and evaluating domain adaptation approaches. The dataset is available at https://vizta-tof.kl.dfki.de/.
研究の動機と目的
- 多様な乗員タイプ、実世界のシナリオ、マルチモーダルアノテーションをカバーする包括的な車内キャビンデータセットの不足を解消すること。
- 乗客、前向き/後向きシートに座った子供、日常的な物などの未反映なシナリオを含めることで、既存のデータセットの限界を克服すること。
- 車両環境におけるマルチモーダルコンピュータビジョンタスクのための、同期された深度、RGB、赤外線データを統合した一貫したデータセットを提供すること。
- Blender を用いて生成されたリアルな合成データと高品質な実データを組み合わせることで、ドメイン適応研究を可能にすること。
- 詳細なマルチタスクアノテーションを通じて、適応式エアバッグ展開やドライバーの注意散漫モニタリングなどの安全を要するシステムの開発を支援すること。
提案手法
- リアビューミラー付近に設置された Kinect Azure を用いて、実際の車内キャビンシーンを記録し、時間飛び深度、RGB、赤外線画像を取得する。
- ドライバーや乗客の行動を20の異なるアクティビティクラスに分類した同期アノテーションを備えた123KのRGBフレームを収集する。
- SALT 3Dアノテーションツールを用いて、実データを手動でアノテートし、2次元/3次元バウンディングボックス、インスタンスおよびクラスセグメンテーションマスク、アクティビティラベルを提供する。
- Blender を用いて、2次元/3次元検出、セグメンテーション、アクティビティラベルの自動生成された真値を備えた3.3Kの合成画像を生成する。
- クロスマodal学習のための、深度カメラとRGBカメラの間の整合性を保つために、キャリブレーションを行い、既知の外部パラメータを提供する。
- 実データをトレーニング用(86KのRGBフレーム)とテスト用(37KのRGBフレーム)に分割し、ドメイン適応評価のため、合成データはトレーニングのみに使用する。
実験結果
リサーチクエスチョン
- RQ1実データと合成データを組み合わせた時間飛び型車内キャビンモニタリングデータセットは、キャビンモニタリングシステムの耐障害性および一般化性能を向上させることができるか?
- RQ2乗客、後向きシートに座った子供、日常的な物などの多様なシナリオの組み込みが、車内モニタリングデータセットの実用的有用性をどの程度向上させるか?
- RQ3合成データは、実世界の車内深度ベースの認識タスクにおけるドメイン適応をどの程度効果的に可能にするか?
- RQ4深度、RGB、赤外線、2次元/3次元検出、セグメンテーション、アクティビティといったマルチモーダルアノテーションを統合することで、ドライバーステート推定および安全応用における性能向上が図れるか?
- RQ5深度、RGB、赤外線モダリティにわたる同期的かつマルチリゾリューションのアノテーションが、アノテーションコストの低減とモデルトレーニング効率の向上にどの程度寄与するか?
主な発見
- TICaM は、20の異なるアクティビティクラス(左・右に向けながら曲がるなど複雑な行動を含む)をカバーする6.7Kの実際の時間飛び深度画像と123KのRGBフレーム(アクティビティアノテーション付き)を提供している。
- 同じアノテーションフォーマットを備えた3.3Kの合成画像が含まれており、ドメイン適応技術の直接評価が可能である。
- 実データには、2次元/3次元検出のトレーニング用に4.7Kの画像、テスト用に2.0Kの画像が含まれており、完全な3次元バウンディングボックス、セグメンテーションマスク、アクティビティラベルが付与されている。
- 正確なカメラモデルとオブジェクト配置を用いて Blender で生成された合成データは、実データと高い視覚的および幾何的忠実度を達成している。
- 同期されたアノテーションを深度、RGB、赤外線モダリティにわたって提供するため、マルチモーダル学習とクロスマodalモデルトレーニングを可能にしている。
- 反射性または暗い素材の物体に対して低反射フラグを追加することで、困難な照明・素材条件における検出の耐障害性が向上している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。