[論文レビュー] Rethinking Nearest Neighbors for Visual Classification
本論文は、トレーニング時および推論時においてk-近傍法(k-NN)を統合することで、現代のニューラルネットワーク分類器の性能を向上させるシンプルでありながら効果的な手法を提案する。トレーニング時においてk-NNの予測を用いて難易度の高いサンプルを同定し、推論時においてk-NNとモデルの確率を線形補間することで、特にデータが少ない状況や細分化された認識タスクにおいて、最先端の性能を達成する。標準的な線形分類器を上回り、ディープラーニング時代においても古典的手法の持続的価値を示している。
Neural network classifiers have become the de-facto choice for current "pre-train then fine-tune" paradigms of visual classification. In this paper, we investigate k-Nearest-Neighbor (k-NN) classifiers, a classical model-free learning method from the pre-deep learning era, as an augmentation to modern neural network based approaches. As a lazy learning method, k-NN simply aggregates the distance between the test image and top-k neighbors in a training set. We adopt k-NN with pre-trained visual representations produced by either supervised or self-supervised methods in two steps: (1) Leverage k-NN predicted probabilities as indications for easy vs. hard examples during training. (2) Linearly interpolate the k-NN predicted distribution with that of the augmented classifier. Via extensive experiments on a wide range of classification tasks, our study reveals the generality and flexibility of k-NN integration with additional insights: (1) k-NN achieves competitive results, sometimes even outperforming a standard linear classifier. (2) Incorporating k-NN is especially beneficial for tasks where parametric classifiers perform poorly and / or in low-data regimes. We hope these discoveries will encourage people to rethink the role of pre-deep learning, classical methods in computer vision. Our code is available at: https://github.com/KMnP/nn-revisit.
研究の動機と目的
- 現代のディープラーニングパイプラインにおける古典的手法k-NN分類器の役割を再評価すること。
- k-NNが、特にデータが少ない状況や細分化認識タスクにおいて、現代のニューラルネットワークモデルと補完的であるかどうかを調査すること。
- トレーニング時および推論時にk-NNを統合する統一されたフレームワークを構築し、モデルのロバスト性と精度を向上させること。
- k-NNが非パラメトリックかつ「ラクス」であるにもかかわらず、事前学習済みのディープ特徴と組み合わせることで依然として非常に有効であることを示すこと。
- ディープラーニング以前の手法に再び関心を向けるきっかけを提供すること。その際、現代のニューラルネットワークと相補的な強みを示すことを目的とする。
提案手法
- トレーニング時、k-NNの予測を用いて難易度の高いサンプルを同定し、k-NNの信頼度に基づいて交差エントロピー損失をスケーリングすることで、モデルが困難なサンプルに注目するように強制する。
- 推論時、最終的な予測は、モデルの出力とk-NNの予測確率分布を線形補間することで得られる。
- k-NN分類器は、教師ありまたは自己教師ありのモデルから得られる事前学習済みの視覚的特徴の上に直接作用し、再学習を必要としない。
- 本手法は、さまざまなバックボーン(ResNet、ViT、Swin)および事前学習目的(ImageNet、MoCo、DINO、Barlow Twins)に適用可能であり、広範な互換性を示している。
- 補間係数は検証データ上で最適化され、モデルとk-NNの予測のバランスを取ることで汎化性能を向上させる。
- 本手法は、複数のベンチマークで標準的な線形評価およびエンドツーエンドのファインチューニングプロトコルの両方で評価されている。
実験結果
リサーチクエスチョン
- RQ1k-NNを現代のディープラーニングパイプラインに統合することで、視覚分類タスクの性能向上が図れるか?
- RQ2k-NNは、データが少ない状況や細分化認識タスクにおいて特に利点を発揮するか?
- RQ3k-NNの予測をトレーニング時のみに統合するアプローチは、推論時のみに統合するアプローチよりも効果的か?
- RQ4同じ特徴を用いた場合、k-NNは標準的な線形分類器と比べてどのように差をつけるか?
- RQ5k-NNは、さまざまな事前学習済み表現およびアーキテクチャに対して、ロバストでモデルに依存しないコンponentsとして機能できるか?
主な発見
- k-NNの統合により、ImageNet、細分化ベンチマーク、NeWTベンチマークを含むすべての評価済みデータセットで性能向上が見られ、一貫した向上が確認された。
- ImageNetの線形評価プロトコルにおいて、本手法はViT-S/16特徴を用いてトップ-1精度80.2%を達成し、標準的な線形分類器を上回った。
- iNaturalist2021-miniおよびNeWTベンチマークのようなデータが少ない状況では、k-NN統合により顕著な向上が見られ、平均精度で最大5.2%の向上が達成された。
- Caltech-UCSD Birds-200-2011およびStanford Dogsデータセットでは、SOTAを1%以上のトップ-1精度向上で上回った。
- ResNet-50およびViT-B/16を含む、すべてのバックボーンおよび事前学習組み合わせにおいて、k-NNは線形分類器を常に上回るか、同等の性能を発揮した。
- アブレーションスタディにより、トレーニング時および推論時両方での統合が、推論時のみの統合よりも効果的であることが確認され、ImageNetでは平均1.5%の向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。