Skip to main content
QUICK REVIEW

[論文レビュー] Teaching Where to Look: Attention Similarity Knowledge Distillation for Low Resolution Face Recognition

Sungho Shin, Joosoon Lee|arXiv (Cornell University)|Sep 29, 2022
Face recognition and analysis被引用数 4
ひとこと要約

本稿では、高分解能(HR)教師ネットワークの注目マップを、低分解能(LR)学生ネットワークにコサイン類似度を用いて転送する、注目マップ類似度知識蒸留(A-SKD)を提案する。この手法により、LR顔認識の性能が顕著に向上し、複数のLRベンチマークで最先端の手法を上回る。学生ネットワークはHRデータから学習した判別性の高い顔領域に注目するようガイドされる。

ABSTRACT

Deep learning has achieved outstanding performance for face recognition benchmarks, but performance reduces significantly for low resolution (LR) images. We propose an attention similarity knowledge distillation approach, which transfers attention maps obtained from a high resolution (HR) network as a teacher into an LR network as a student to boost LR recognition performance. Inspired by humans being able to approximate an object's region from an LR image based on prior knowledge obtained from HR images, we designed the knowledge distillation loss using the cosine similarity to make the student network's attention resemble the teacher network's attention. Experiments on various LR face related benchmarks confirmed the proposed method generally improved recognition performances on LR settings, outperforming state-of-the-art results by simply transferring well-constructed attention maps. The code and pretrained models are publicly available in the https://github.com/gist-ailab/teaching-where-to-look.

研究の動機と目的

  • 高分解能(HR)で訓練されたモデルを低分解能(LR)画像に適用した際の顕著な性能低下を解消すること。
  • HRデータからの事前知識を活用することで、LR画像における空間情報の損失を是正すること。
  • 生の特徴量やログティスの代わりに、注目マップ(どこに注目すべきかを表す)を転送することで、LR認識性能を向上させること。
  • 顔認識を越えて、顔検出や一般物体分類の分野へも一般化できるかを実証すること。
  • 超解像技術の高コストを回避する、軽量で効率的な知識蒸留フレームワークの開発

提案手法

  • CBAMモジュールを用いて詳細で情報量の多い注目マップを生成する高分解能(HR)教師ネットワークを訓練する。
  • HR教師ネットワークとLR学生ネットワークの注目マップ間のコサイン類似度を知識蒸留損失として用いる。
  • 学生ネットワークを最適化し、教師の注目マップ(特に目、鼻、口などの重要な顔領域)に一致させる。
  • 認識および検出タスクの両方で性能向上を図るため、A-SKD損失を標準的なログティス蒸留と統合する。
  • 一般化のため、ResNet18にCBAMを組み合わせ、一般物体分類および顔検出への適用を実施する。
  • データオーグメンテーションおよびダウンサンプリング(4×、16×、32×)を用いて、複数のベンチマークでLR状態を模擬する。

実験結果

リサーチクエスチョン

  • RQ1高分解能(HR)ネットワークの注目マップは、低分解能(LR)顔認識の有効な事前知識として機能するか?
  • RQ2コサイン類似度を用いた注目マップの転送は、特徴量ベースやログティスベースの蒸留と比較して、LR認識性能を向上させるか?
  • RQ3A-SKDは顔認識を越えて、顔検出や物体分類といった他のLRビジョンタスクへ一般化できるか?
  • RQ4低解像度環境下において、注目マップ類似度損失はAT や RKD といった既存の知識蒸留手法よりも効果的か?
  • RQ5A-SKDは監視環境に似た低解像度画像における小サイズ顔の検出を向上させられるか?

主な発見

  • 4×ダウンサンプリングされたImageNetにおいて、A-SKDはログティス蒸留と組み合わせて66.52%のトップ1精度を達成し、AT(65.79%)やRKD(65.95%)を上回った。
  • WIDER FACEでは、16×ダウンサンプリング下で、エイジリーサンプルでmAPが15.72%、ミドルクラスで14.15%、ハードクラスで33.98%向上した。
  • 32×ダウンサンプリング下では、エイジリーサンプルでmAPが7.54%、ミドルクラスで12.59%、ハードクラスで14.43%向上し、極端な解像度低下に対しても頑健であることが示された。
  • 定性的な結果から、A-SKDはLR画像における小サイズ顔の検出を顕著に向上させたことが図6で確認された。
  • アブレーションスタディの結果、注目マップがLR認識に最も効果的な事前知識であり、コサイン類似度が最適な転送メカニズムであることが確認された。
  • 本手法は顔認識を越えて一般物体分類や顔検出タスクにおいても一貫した性能向上を示し、良好な一般化性能を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。