Skip to main content
QUICK REVIEW

[论文解读] Revisiting Pose-Normalization for Fine-Grained Few-Shot Recognition

Luming Tang, Davis Wertheimer|arXiv (Cornell University)|Apr 1, 2020
Domain Adaptation and Few-Shot Learning参考文献 33被引用 4
一句话总结

本文通過定位語義部件並描述其外觀,重新探討了姿態歸一化表示在細粒度少樣本識別中的應用,相較於黑箱架構,準確率提升高達20個百分點。該方法僅需極小的模型容量增加,且在無需測試時部件註解的情況下,能良好地適應不同主幹網絡、少樣本算法與數據集。

ABSTRACT

Few-shot, fine-grained classification requires a model to learn subtle, fine-grained distinctions between different classes (e.g., birds) based on a few images alone. This requires a remarkable degree of invariance to pose, articulation and background. A solution is to use pose-normalized representations: first localize semantic parts in each image, and then describe images by characterizing the appearance of each part. While such representations are out of favor for fully supervised classification, we show that they are extremely effective for few-shot fine-grained classification. With a minimal increase in model capacity, pose normalization improves accuracy between 10 and 20 percentage points for shallow and deep architectures, generalizes better to new domains, and is effective for multiple few-shot algorithms and network backbones. Code is available at https://github.com/Tsingularity/PoseNorm_Fewshot

研究动机与目标

  • 透過利用姿態不變表示,彌補人類與機器在細粒度少樣本分類任務中的性能差距。
  • 重新評估姿態歸一化在少樣本學習設定中的實用性——此方法曾因端到端黑箱架構的出現而被忽視。
  • 證明姿態歸一化特徵能提升泛化能力,特別是在訓練數據有限且類別差異細微的情況下。
  • 確保該方法即使僅使用少量姿態註解(例如基類數據的5%)仍具有效能,且與主幹網絡及少樣本學習技術的選擇無關。

提出的方法

  • 使用輕量級姿態估計器定位輸入圖像中的語義部件(例如:喙、翅膀),生成針對部件的特徵向量。
  • 通過聚合每個定位部件的外觀描述子,構建與全局圖像姿態無關的姿態歸一化表示。
  • 將姿態歸一化特徵無縫整合至標準少樣本學習流程(例如:原型網絡)中,無需修改主幹網絡或學習算法。
  • 端到端訓練姿態估計器與分類頭,僅使用圖像級標籤,推理時不依賴部件註解。
  • 使用無監督關鍵點檢測作為消融實驗,以評估學習到的部件定位的魯棒性。
  • 透過部件重要性分析與最近鄰可視化,解釋並驗證學習到的部件表示在語義上的一致性。

实验结果

研究问题

  • RQ1與標準黑箱架構相比,姿態歸一化表示是否能顯著提升少樣本細粒度分類的準確率?
  • RQ2姿態歸一化是否能提升在未見領域與新類別上的泛化能力,且僅需少量標註數據?
  • RQ3當使用監督式與無監督式關鍵點檢測進行部件定位時,姿態歸一化的性能表現有何差異?
  • RQ4學習到的部件表示在多大程度上與人類專家對區分鳥類物種的判斷一致?
  • RQ5姿態歸一化能否有效結合多種少樣本學習算法與主幹網絡架構?

主要发现

  • 在所有評估的數據集、主幹網絡與少樣本算法中,姿態歸一化使少樣本準確率提升10–20個百分點。
  • 僅使用4層卷積網絡(4-layer ConvNet)並搭配姿態歸一化,其表現優於未使用姿態歸一化的更深的ResNet18,顯示在低數據場景下結構偏置的有效性。
  • 即使僅對基類訓練數據的5%進行姿態註解,姿態歸一化仍能帶來顯著提升,顯示對弱監督的魯棒性。
  • 部件重要性分析顯示,模型對特定部件(例如:喙、冠部)的關注程度與專家指南中的描述高度一致。
  • 最近鄰分析確認,部件向量具有跨類別的泛化能力——例如,不同物種間相似的喙形會產生相似的部件嵌入。
  • 無監督關鍵點檢測產生的熱力圖不一致且語義不穩定,解釋了其性能劣於監督姿態估計的原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。