Skip to main content
QUICK REVIEW

[論文レビュー] Interactive Preference Learning of Utility Functions for Multi-Objective Optimization

Ian Dewancker, Michael McCourt|arXiv (Cornell University)|Dec 14, 2016
Machine Learning and Algorithms参考文献 8被引用数 8
ひとこと要約

本稿では、多目的最適化におけるスカラー値の効用関数の生成モデルを提案し、ステークホルダーの好みを表すためにベータ累積分布関数の積を用いる。インタラクティブでアクティブな学習を用い、二値の好みクエリを通じて逐次的に効用推定値を精緻化し、Fスコアや制約付きの目的関数を含む多様なテストケースにおいて、真値の効用関数と0.96までの高い相関を達成する。

ABSTRACT

Real-world engineering systems are typically compared and contrasted using multiple metrics. For practical machine learning systems, performance tuning is often more nuanced than minimizing a single expected loss objective, and it may be more realistically discussed as a multi-objective optimization problem. We propose a novel generative model for scalar-valued utility functions to capture human preferences in a multi-objective optimization setting. We also outline an interactive active learning system that sequentially refines the understanding of stakeholders ideal utility functions using binary preference queries.

研究の動機と目的

  • 精度とコストといった競合する指標のバランスをとるステークホルダーが内蔵する非表示の好みをモデル化する課題に対処すること。
  • 非線形なトレードオフや制約(例:適合率・再現率のバランス、しきい値要件)を捉えることが可能な柔軟で生成的な効用関数モデルを開発すること。
  • 逐次的な二値の好みクエリを通じて、必要な対話回数を減らしながらも精度を高める、インタラクティブでアクティブな効用関数学習を可能にすること。
  • 模擬的人間の好みを用いて、非線形的で制約付きの、あるいはFスコア形式の目的関数を含む複雑な効用構造の回復能力を検証すること。

提案手法

  • 効用関数は、個々の効用関数の積としてモデル化され、それぞれが形状パrameter α と β を持つベータ分布の累積分布関数(CDF)から導出される。
  • log(α) と log(β) にログノルム分布の事前分布を設定することで、非負の形状パラメータの柔軟な学習と不確実性の定量化を可能にする。
  • ステークホルダーは、2つのシステム構成を比較する二値のクエリを提示し、ベイズ推論を用いて効用パラメータの事後分布を更新する。
  • アクティブな学習の獲得関数(ランダム、単一エントロピー、ペアエントロピー)が、真の効用関数に関する情報量の増加を最大化するように次のクエリペアを選択する。
  • 最大化と最小化の両方の目的関数を扱えるように、最大化にはCDF、最小化には生存関数(1 - CDF)を用いる。
  • フレームワークは、反復回数に応じた平均値と四分位範囲を可視化することで、個々の効用関数の不確実性を意識した可視化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ベータCDFの積に基づく生成モデルは、トレードオフや制約を含む複雑な現実世界の効用関数を正確に表現できるか?
  • RQ2二値の好みクエリを用いたインタラクティブでアクティブな学習は、最小限のクエリ回数で未知の効用関数を回復できるか?
  • RQ3異なるアクティブな学習の獲得戦略(ランダム、エントロピーに基づく)は、多様なテストケースにおいて効用関数の学習でどのように比較されるか?
  • RQ4F1やF2スコア、またはしきい値ベースの目的関数のような非線形な効用構造を、モデルはどの程度正確に捉えることができるか?
  • RQ5モデルは個々の指標の信頼性のある不確実性推定値を提供できるか?これにより、ステークホルダーが学習プロセスを内省できるか?

主な発見

  • ペアエントロピー獲得戦略は、テスト用効用関数 max(5f₁f₂/(4f₁ + f₂)) において、平均ケンダール順位相関が0.9120に達し、ランダムおよび単一エントロピー戦略を上回った。
  • 線形効用関数 max(f₁ + 10f₂) においても、ペアエントロピー探索を用いることでケンダール相関が0.9615に達し、線形トレードオフの正確な回復を示した。
  • しきい値制約(例:f₂ > 0.6 の条件下で min(f₁))を成功裏に捉えた。f₂の個別効用関数には0.6付近で急激なスパイクが観察され、f₁の効用は減少し、相関は0.6893に達した。
  • 高次元の制約(例:f₃ > 0.95 の条件下で max(2f₁f₂/(f₁ + f₂)))を含む複雑な非線形目的関数に対しても、ペアエントロピーを用いることで相関が0.2648に達し、高い耐性を示した。
  • ランダム探索ベースラインも驚くほど良好な性能を示した(例:max(f₁ + 2f₂) で0.8756)、これは反復的モデル適合が不要な低計算コストのアプローチが、比較的単純なケースでは有効であることを示唆している。
  • 個別効用関数の可視化により、単調な挙動や非単調な挙動(最小化目的の生存関数を含む)の正確な回復が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。