Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations of Sets through Optimized Permutations

Yan Zhang, Jonathon Hare|arXiv (Cornell University)|Dec 10, 2018
Multimodal Machine Learning Applications参考文献 27被引用数 8
ひとこと要約

本稿では、従来の順序不変の削減操作による表現のボトルネックを回避するため、集合を順序付きの系列に再順序付けするための微分可能パーミュテーション最適化(PO)モジュールを提案する。学習可能なペアワイズコスト関数を用いて勾配降下法でパーミュテーションを最適化することで、数の並べ替え、画像モザイク再構築、視覚的質問応答(VQA)といったセット表現学習タスクで最先端の結果を達成した。明示的および暗黙的の両方の教師信号を用いて評価された。

ABSTRACT

Representations of sets are challenging to learn because operations on sets should be permutation-invariant. To this end, we propose a Permutation-Optimisation module that learns how to permute a set end-to-end. The permuted set can be further processed to learn a permutation-invariant representation of that set, avoiding a bottleneck in traditional set models. We demonstrate our model's ability to learn permutations and set representations with either explicit or implicit supervision on four datasets, on which we achieve state-of-the-art results: number sorting, image mosaics, classification from image mosaics, and visual question answering.

研究の動機と目的

  • 和集合の順序不変表現を学習する課題に取り組み、和集合の和や最大値といった削減操作に起因する表現のボトルネックを回避する。
  • 事前に望ましい順序が分かっている必要がない状態で、エンドツーエンドに最適なパーミュテーションを学習するための微分可能最適化を用いる。
  • 分類や視覚的質問応答といった下流タスクにおいて、モデルが暗黙的かつ有用な順序を発見できるようにする。
  • 学習可能で微分可能なパーミュテーションプロセスを用いて、無順序の集合を順序付きの系列に変換することで、集合表現学習を向上させる。

提案手法

  • 本手法は、ニューラルネットワークがペアごとの要素を比較することで、集合要素の相対的順序を決定する学習可能なペアワイズ順序コスト関数を用いる。
  • 全コスト関数は、与えられたパーミュテーションの品質を測るためのペアワイズコストの合計として定義される。
  • 固定回数のステップで勾配降下法を用いてパーミュテーションを最適化し、アンラールドバックプロパゲーションによりエンドツーエンドの学習を可能にする。
  • パーミュテーションの連続的リラクゼーションは、正規化されていないパーミュテーション行列を最適化することで達成され、各ステップで有効なパーミュテーション行列に正規化される。
  • 得られた順序付き系列は、LSTMなどの順序系列モデルに供給され、元の集合の順序不変表現を学習する。
  • このモジュール全体は微分可能であり、順序コストと下流タスクの損失を同時に最適化可能である。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、下流の表現学習を促進する順序に集合を並べ替える能力を学習できるか?
  • RQ2微分可能なパーミュテーション最適化は、従来の削減ベースの集合モデルに比べ、表現能力および精度において優れているか?
  • RQ3明示的な順序の教師信号がなくても、画像分類や視覚的質問応答といったタスクにおいて、モデルが有用な順序を暗黙的に発見できるか?
  • RQ4特に暗黙的教師信号下で、POモジュールは元の集合構造をどれほど正確に再構築できるか?

主な発見

  • POモジュールは、数の並べ替えおよび画像モザイク再構築タスクで最先端の性能を達成し、明示的教師信号下でMNIST 2×2モザイクでは100%の正確さ、CIFAR10 3×3モザイクでは87.3%を達成した。
  • 暗黙的教師信号タスクでは、PO-LAバージョンがCIFAR10 3×3モザイクで66.0%の正確さ、ImageNet 3×3モザイクで28.6%を達成し、LinAssignおよび他のベースラインを上回った。
  • 暗黙的学習において、POモジュールは再構築誤差を顕著に低減した。ImageNet 3×3では平均二乗誤差が0.41、CIFAR10 3×3では0.28であり、LinAssignに比べて高い誤差を示した。
  • 可視化結果から、POモデルはLinAssignよりも正確で整合性のとれた再構築を学習していることが示され、暗黙的教師信号下でも優れた内部表現学習を示している。
  • 本手法は、最先端のVQAモデルの性能を向上させ、複雑で現実世界のセットベースタスクにおける実用性を示した。
  • モデルは複数のデータセットにわたって良好に一般化し、MNIST、CIFAR10、ImageNetで安定した性能を示した。特に、再構築がより困難になる高レベルのタイル数でも、頑健な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。