Skip to main content
QUICK REVIEW

[論文レビュー] Information Recovery-Driven Deep Incomplete Multiview Clustering Network

Chengliang Liu, Jie Wen|arXiv (Cornell University)|Apr 2, 2023
Face and Expression Recognition被引用数 5
ひとこと要約

本稿では、自己注意機構と逐次的グラフ再構成機構を備えた2段階のトランスフォーマーに基づくオートエンコーダを用いて、欠損しているビューの回復と、堅牢で判別性の高い表現の学習を同時に実現する、新しい深層不完全マルチビュークラスタリングフレームワーク、RecFormerを提案する。本手法は、視点間の相互作用と幾何構造に配慮した回復を効果的に行うことにより、複数のベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Incomplete multi-view clustering is a hot and emerging topic. It is well known that unavoidable data incompleteness greatly weakens the effective information of multi-view data. To date, existing incomplete multi-view clustering methods usually bypass unavailable views according to prior missing information, which is considered as a second-best scheme based on evasion. Other methods that attempt to recover missing information are mostly applicable to specific two-view datasets. To handle these problems, in this paper, we propose an information recovery-driven deep incomplete multi-view clustering network, termed as RecFormer. Concretely, a two-stage autoencoder network with the self-attention structure is built to synchronously extract high-level semantic representations of multiple views and recover the missing data. Besides, we develop a recurrent graph reconstruction mechanism that cleverly leverages the restored views to promote the representation learning and the further data reconstruction. Visualization of recovery results are given and sufficient experimental results confirm that our RecFormer has obvious advantages over other top methods.

研究の動機と目的

  • 一部のビューが欠損している不完全マルチビューデータの課題に対処すること。これはクラスタリング性能の低下を引き起こす。
  • 既存手法の限界を克服すること。既存手法は欠損ビューを無視するか、特定の2ビュー仮定に依存している。
  • 複数のビューにおいて任意の欠損パターンを処理可能な汎用的なフレームワークの開発。
  • ビュー回復とクラスタリングを統合したエンドツーエンドで学習可能なアーキテクチャにより、表現学習の向上。
  • データの幾何構造を考慮した逐次的グラフ制約を用いて、回復されたビューと表現を精緻化し、クラスタリング性能の向上。

提案手法

  • 2段階の訓練フレームワークを設計:段階1では、マルチヘッド自己注意を用いた視点間の特徴相互作用を実現する、視点間オートエンコーダを用いて欠損ビューを回復。
  • トランスフォーマー風のエンコーダ-デコーダモジュールを実装し、高レベルの意味的表現学習と視点間の情報交換を可能に。
  • データの幾何構造を考慮した構造認識型逐次的グラフ制約を導入し、反復的に回復されたビューを精緻化。
  • 欠損データの影響を抑えるために、不完全マスク行列を組み込み、回復プロセスをガイド。
  • 再構成損失、クラスタリング損失、グラフ正則化を統合した共同最適化目的関数を用い、ビュー回復と表現学習を統一。
  • t-SNE可視化とアブレーションスタディを実施し、フレームワーク内各コンponentの有効性を検証。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースのフレームワークは、元の幾何構造を保持したまま、マルチビューデータにおける欠損ビューを効果的に回復できるか?
  • RQ2ビュー回復と表現学習を統合的に学習することで、分離されたアプローチに比べてクラスタリング性能がどのように向上するか?
  • RQ3提案された逐次的グラフ制約は、回復されたビューの品質と下流のクラスタリングにどの程度寄与するか?
  • RQ4ハイパーパrameter、特にβ(再構成重み)とK(グラフ近傍数)の変更に伴い、モデルの性能はどの程度感度を示すか?
  • RQ52段階の訓練戦略は、単一段階の代替手法に比べて、収束性と表現品質に優れているか?

主な発見

  • 50%の欠損ビューを想定したHandwrittenデータセットにおいて、RecFormerは91.74%のクラスタリング精度(ACC)と83.39%の正規化相互情報量(NMI)を達成し、比較された最先端手法をすべて上回った。
  • NH_Faceデータセットにおいて、50%の欠損率下でも95.40%の精度と92.01%のNMIを達成し、優れた判別能力を示した。
  • アブレーションスタディにより、不完全マスクや段階2を削除すると性能が著しく低下することが確認された(例:マスクなしではACCが91.74%から55.40%に低下)。これにより、これらの要素の重要性が裏付けられた。
  • 段階2では回復されたビューを用いて表現学習を精緻化するが、これにより単一段階ベースラインに比べてACCが1.8%向上した。
  • 逐次的グラフ制約により、局所的および大域的なデータ構造が保持され、明確で分離性の高いクラスタが得られることが、t-SNE可視化で裏付けられた。
  • ハイパーパramータ感度分析の結果、HandwrittenおよびCaltech7データセットではβ ∈ [10⁻³, 10] および K ∈ [5, 15] が最適な性能を示し、パラメータ選択に対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。