Skip to main content
QUICK REVIEW

[論文レビュー] Discriminative Clustering with Relative Constraints

Yuanli Pei, Xiaoli Z. Fern|arXiv (Cornell University)|Dec 30, 2014
Advanced Clustering Algorithms Research参考文献 26被引用数 6
ひとこと要約

本稿では、相対的制約(例:インスタンス $x_i$ が $x_j$ より $x_k$ よりも類似しているかどうかを尋ねるクエリ)を活用する判別的クラスタリング手法 DCRC を提案する。特に、'知らない'(dnk)応答を含めることで、より高い耐障害性を実現する。インスタンス、クラスタメンバーシップ、制約の間の確率的関係をモデル化することで、DCRC は尤度を最大化するとともにクラスタ分離性とバランスを強制し、合成データおよび人為的にノイズが加えられたラベル付き制約の両方で、最先端手法を上回る F-スコアとノイズ耐性を達成する。

ABSTRACT

We study the problem of clustering with relative constraints, where each constraint specifies relative similarities among instances. In particular, each constraint $(x_i, x_j, x_k)$ is acquired by posing a query: is instance $x_i$ more similar to $x_j$ than to $x_k$? We consider the scenario where answers to such queries are based on an underlying (but unknown) class concept, which we aim to discover via clustering. Different from most existing methods that only consider constraints derived from yes and no answers, we also incorporate don't know responses. We introduce a Discriminative Clustering method with Relative Constraints (DCRC) which assumes a natural probabilistic relationship between instances, their underlying cluster memberships, and the observed constraints. The objective is to maximize the model likelihood given the constraints, and in the meantime enforce cluster separation and cluster balance by also making use of the unlabeled instances. We evaluated the proposed method using constraints generated from ground-truth class labels, and from (noisy) human judgments from a user study. Experimental results demonstrate: 1) the usefulness of relative constraints, in particular when don't know answers are considered; 2) the improved performance of the proposed method over state-of-the-art methods that utilize either relative or pairwise constraints; and 3) the robustness of our method in the presence of noisy constraints, such as those provided by human judgement.

研究の動機と目的

  • 既存のクラスタリング手法が相対的類似性クエリに対する 'はい/いいえ' 応答のみを扱うという限界を是正すること。特に、ユーザーが比較を自信を持って判断できない実世界の状況を想定する。
  • インスタンス類似度、潜在的クラスタメンバーシップ、観測された相対的制約('知らない'(dnk)応答を含む)の間の確率的関係をモデル化することで、クラスタリングの正確性を向上させること。
  • 未ラベルデータを用いて、観測された制約の尤度を同時に最大化し、クラスタ分離性とバランスを強制することで、クラスタリング性能を向上させること。
  • 人為的判断から生じるノイズの多い制約、特に実用的応用で一般的なノイズに対して、本手法の耐障害性を評価すること。

提案手法

  • DCRC は、3つのインスタンスの潜在的クラスタメンバーシップに基づいて、相対的制約 $(x_i, x_j, x_k)$ が 'はい'($x_i$ が $x_j$ より $x_k$ よりも類似している)と回答される確率をモデル化する。
  • 生成的確率的フレームワークを用い、ソフトクラスタリング割り当ての下で観測された制約の尤度を最大化する。ラベル付きおよび未ラベル付きインスタンスを両方取り入れる。
  • ノイズモデルを導入し、'知らない'(dnk)応答を無視するのではなく、情報として扱う。クラスタの近接度に基づいて、その尤度をモデル化する。
  • クラスタ分離性とバランスは、未ラベルデータにおけるエントロピーの最小化とクラスタ間マージンの最大化により正則化された目的関数によって強制され、半教師あり学習の原則を踏襲する。
  • 尤度制約を最大化するための EM に類似したアルゴリズムを用いて最適化を実行する。この手法では、クラスタ割り当ての推定とモデルパラメータの更新を交互に繰り返す。
  • 不確実性をモデル化するために $\epsilon = 0.15$ を用い、真のラベルに基づく制約および制御されたノイズを加えた人為的ラベル付き制約を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1相対的制約に '知らない'(dnk)応答を組み込むことで、'はい/いいえ' 応答のみを扱う手法と比較して、クラスタリング性能が向上するか?
  • RQ2人為的ラベル付きノイズ制約の下で、提案手法 DCRC は、メトリクス学習ベースやペairwise制約手法と比較して、どのように性能を発揮するか?
  • RQ3dnk 制約の導入が、クラスタリングの耐障害性と正確性を向上させる意味のある情報を提供するか?
  • RQ4DCRC の確率的定式化は、F-スコアおよびノイズ耐性の観点で、既存の判別的クラスタリング手法をどの程度上回るか?

主な発見

  • DCRC は、相対的またはペアワイズ制約を用いる最先端手法を著しく上回り、150個の相対的制約を用いた合成データでは F-スコア 0.7412 を達成した。これは Xing が 0.6438、ITML が 0.6347 を記録したのと比較して顕著な向上である。
  • 人為的にノイズが加えられたラベル付き制約の下でも、DCRC は高い性能(F-スコア 0.7021)を維持し、他の手法が劣化する中で優位性を示し、ラベルノイズに対する耐障害性を実証した。
  • '知らない'(dnk)制約の導入により性能が向上し、結果の劣化も見られなかった。これは、dnk 応答がクラスタ構造に関する有用な情報を含んでいることを示唆する。
  • ハイパーパramータの選択に対して安定しており、$\epsilon$ の値が 0.05 から 0.2 の範囲で変動しても F-スコアは 0.01 未満にしか変化しなかった。これは、ノイズの多い環境下でも安定性が保証されていることを示している。
  • dnk を含まない DCRC-YN でさえ、ノイズのある制約において ITML を上回る性能を示しており、dnk を使用しない場合でも、本手法の設計が耐障害性を向上させることを示している。
  • ロジスティック回帰分類器ベースラインは、制約なしの K-means よりも性能が悪く、DCRC の向上が分類器自体の効果ではなく、補助情報の有効な活用によるものであることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。