Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Fusion Weight Learning in Multiple Classifier Systems

Anurag Kumar, Bhiksha Raj|arXiv (Cornell University)|Feb 6, 2015
Machine Learning and Data Classification参考文献 15被引用数 6
ひとこと要約

本稿では、ラベルなしテストデータ上で明確さ指標を直接最適化することで、検証データセットに依存しない、非教師ありでインスタンス固有の融合重み学習手法を提案する。この手法は平均融合より順序付け性能を向上させ、ノイズの多い分類器に対しても頑健であり、特定の花のクラスで平均精度に最大9%の絶対的向上を達成する。

ABSTRACT

In this paper we present an unsupervised method to learn the weights with which the scores of multiple classifiers must be combined in classifier fusion settings. We also introduce a novel metric for ranking instances based on an index which depends upon the rank of weighted scores of test points among the weighted scores of training points. We show that the optimized index can be used for computing measures such as average precision. Unlike most classifier fusion methods where a single weight is learned to weigh all examples our method learns instance-specific weights. The problem is formulated as learning the weight which maximizes a clarity index; subsequently the index itself and the learned weights both are used separately to rank all the test points. Our method gives an unsupervised method of optimizing performance on actual test data, unlike the well known stacking-based methods where optimization is done over a labeled training set. Moreover, we show that our method is tolerant to noisy classifiers and can be used for selecting N-best classifiers.

研究の動機と目的

  • ラベル付き検証データを必要とせずに、複数分類器システムにおけるインスタンス固有の融合重みを学習する非教師あり手法の開発。
  • 保持済みのラベル付きデータ上で融合重みを最適化することで生じる一般化ギャップを解消し、実際のテストデータの挙動を反映しない問題に対処する。
  • 各テストインスタンスごとに最も信頼性の高い分類器を動的に同定することで、N番目の良い分類器の選択を可能にする。
  • 二部マッチング損失に基づく新しい明確さ指標を導入し、教師なしでテストインスタンスおよび融合重みの順序付けを可能にする。
  • 実際のテストインスタンス上で非教師あり最適化が行われることで、従来のスタッキングや平均化手法よりも優れた性能が得られることを実証する。

提案手法

  • 融合重み学習を、重み付き分類器スコアに基づく関連インスタンスと不関連インスタンスの分離度を測る「生の明確さ指標」(RCL) を最大化する問題として定式化する。
  • 関連性と不関連性の両方の損失を含む修正版二部マッチング損失を用いて明確さ指標を計算し、訓練データ出力とそのインスタンスの分類器スコアのみを用いて、各テストインスタンスごとに最適化する。
  • 勾配ベース最適化により明確さ指標を最適化することで、インスタンス固有の重みを学習し、最適化段階でラベル付きデータを必要としない。
  • 最適化された明確さ指標自体をテストインスタンスの順序付けスコアとして使用し、重み付き和スコアの代替として機能する。
  • 完全融合(すべての分類器)とN番目の良い分類器の融合(選択的分類器結合)の両方をサポートし、ノイズ耐性を実現する。
  • 個々の分類器の学習をブラックボックスとして扱い、スコアの順序付けの意味が一貫している(スコアが高いほど順位が高い)ことのみを要件とする。

実験結果

リサーチクエスチョン

  • RQ1ラベル付き検証データが存在しない状況でも、インスタンス固有の融合重みを学習可能であり、実際のテストインスタンスへの一般化性能が向上するか?
  • RQ2ラベルなしテストデータ上で明確さ指標を最適化することで、従来の平均化やスタッキングベースの融合よりも優れた性能が得られるか?
  • RQ3提案手法は各インスタンスごとにN番目の良い分類器を効果的に選択でき、ノイズの多いまたは信頼性の低い分類器に対しても頑健性を示せるか?
  • RQ4真のラベルが存在しない状況下でも、明確さ指標はテストインスタンスの順序付けに有効で妥当な指標とみなせるか?
  • RQ5特に一部の分類器が損傷している場合に、分類器のノイズレベルが変化しても本手法の性能はどの程度維持されるか?

主な発見

  • 提案手法は、異なるデータセットにおいて「Pansy」花のクラスで平均精度(AP)に最大9%の絶対的向上を達成し、平均融合を著しく上回った。
  • N番目の良い分類器融合戦略において、上位N個の分類器の重み付き平均(N-BEST W.AVG)は、3つの分類器が損傷している状況で89.82%のMAPを達成したのに対し、平均融合では85.73%に低下し、4.03%の性能低下を示した。
  • 4つの分類器が損傷している場合、N-BEST W.AVGは82.70%のMAPを維持したのに対し、平均融合は81.20%に低下し、ノイズ耐性の優位性が顕著に示された。
  • 明確さ指標(RCL)は、標準的な重み付き和スコアよりも優れたインスタンス順序付け性能を示し、いくつかの花のクラスでAPに2–5%の絶対的向上を達成した。
  • 本手法は、分類器の40%が劣化している場合でさえも性能を維持する強力な耐性を示し、信頼性の低いモデルが存在する実世界の設定において特に有用であることが示された。
  • アルゴリズムは、与えられた訓練データとテストスコアベクトルに対して、可能な限り最高の明確さに収束することが示され、定義された目的関数下での理論的安定性と最適性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。