[論文レビュー] Automatic Image Registration in Infrared-Visible Videos using Polygon Vertices
本稿では、標的の輪郭の多角形近似と時間的キーポoinマッチングを用いて、赤外線・可視光ビデオペアのための特徴ベースの画像登録手法を提案する。離散的曲線崩壊(DCE)を用いてキーポイントを検出し、局所的形状の凸性とユークリッド距離に基づいてそれらをマッチングし、時間的バッファと被り割合基準を用いて最適なアフィン変換を選択することで、特に複数標的および非平面なシーンにおいて、先行研究に比べ顕著に低い登録誤差を達成する。
In this paper, an automatic method is proposed to perform image registration in visible and infrared pair of video sequences for multiple targets. In multimodal image analysis like image fusion systems, color and IR sensors are placed close to each other and capture a same scene simultaneously, but the videos are not properly aligned by default because of different fields of view, image capturing information, working principle and other camera specifications. Because the scenes are usually not planar, alignment needs to be performed continuously by extracting relevant common information. In this paper, we approximate the shape of the targets by polygons and use affine transformation for aligning the two video sequences. After background subtraction, keypoints on the contour of the foreground blobs are detected using DCE (Discrete Curve Evolution)technique. These keypoints are then described by the local shape at each point of the obtained polygon. The keypoints are matched based on the convexity of polygon's vertices and Euclidean distance between them. Only good matches for each local shape polygon in a frame, are kept. To achieve a global affine transformation that maximises the overlapping of infrared and visible foreground pixels, the matched keypoints of each local shape polygon are stored temporally in a buffer for a few number of frames. The matrix is evaluated at each frame using the temporal buffer and the best matrix is selected, based on an overlapping ratio criterion. Our experimental results demonstrate that this method can provide highly accurate registered images and that we outperform a previous related method.
研究の動機と目的
- 視野の違い、センサ特性の相違、およびテクスチャや強度の対応の欠如による赤外線・可視光ビデオシーケンスにおけるずれの問題に対処する。
- 標的が必ずしも平面的でない、複数モodalなビデオ監視環境における登録精度を向上させる。
- グローバル特徴マッチングの制限を克服するため、各標的の輪郭を個別に処理することで曖昧さや外れ値マッチングを低減する。
- 前面ピクセルの被り割合に基づく頑健な変換選択基準を開発し、時間経過に伴う整合性を高める。
- 変動する照明条件下でのオブジェクト検出、トラッキング、認識などの応用に向けた正確な画像統合を可能にする。
提案手法
- 背景差分処理後に、可視光および赤外線ビデオフレームにおける標的の形状をノイズを含む多角形として近似する。
- 離散的曲線崩壊(DCE)技術を用いて輪郭キーポイントを検出することで、多角形境界上の顕著な点を特定する。
- 特に多角形頂点の凸性を含む局所的形状特徴を用いて、各キーポイントを記述する。
- 形状特徴のユークリッド距離と幾何的整合性に基づいて、対応する多角形間のキーポイントをマッチングする。
- 複数フレームにわたってマッチングされたキーポイントペアを時間的バッファに格納し、信頼性の高い対応関係を蓄積する。
- 各フレームで、変換された前面ピクセルの被り割合基準(交差和集合)を用いて候補となるアフィン変換行列を評価し、整合性を最大化する行列を選択する。
実験結果
リサーチクエスチョン
- RQ1グローバル特徴マッチングと比較して、標的輪郭の多角形近似が赤外線・可視光ビデオ登録における特徴マッチング精度を向上させるか。
- RQ2マッチングされたキーポイントの時間的バッファリングが、アフィン変換推定の頑健性と精度をどのように向上させるか。
- RQ3前面ピクセルの被り割合基準が、最適な変換行列選択において、従来の類似性測定法をどの程度上回るか。
- RQ4深度差がある非平面なシーンにおける複数標的の登録が、本手法で効果的に可能か。
- RQ5本手法が、標的数の変動に応じて定量的に先行研究と比較して登録誤差の面でどの程度優れているか。
主な発見
- 1人の人物に対して100フレームのバッファサイズを用いた場合、本手法は平均登録誤差0.6084ピクセルを達成し、Sonnら[2]が報告した2.3522ピクセルよりも顕著に低い。
- シーンに5人の人物がいる場合、100フレームのバッファを用いた本手法は平均誤差1.1354ピクセルを達成し、同じ条件下でSonnらの4.5206ピクセルを上回る。
- 1〜5人の人物を対象にテストした全範囲で、本手法は30フレームおよび100フレームのバッファ構成において、ベースライン手法[2]に比して一貫して優れた性能を示す。
- 各多角形を個別に処理することで曖昧さが低減され、背景差分処理が不完全で1人あたり複数の多角形が生成される状況でも、矛盾するマッチングを効果的に除外できる。
- 被り割合に基づく変換選択基準により、より正確で安定した行列更新が可能となり、全体の整合性精度が向上する。
- 標的が同じ深度平面にない場合でも本手法は有効であるが、その場合やや性能が低下する傾向にあり、個々の標的ごとの変換行列を用いることでさらなる拡張が可能であると考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。