Skip to main content
QUICK REVIEW

[論文レビュー] Bandit-Based Random Mutation Hill-Climbing

Jialin Liu, Diego Pérez-Liébana|arXiv (Cornell University)|Jun 20, 2016
Advanced Bandit Algorithms Research参考文献 21被引用数 3
ひとこと要約

本稿では、探索と活用のバランスを取るために、ランダムな近隣選択を多腕バンディット選択ユニットに置き換えたバンドイットベースのランダム変異勾配上昇(RMHC)アルゴリズムを提案する。標準的なRMHCよりも顕著に優れており、ノイズのあるOneMaxおよびRoyal Road問題において、最大10倍のフィットネス評価数の削減が達成された。特にリサンプリング数が2の場合に顕著で、問題サイズに比例して線形スケーリングする。

ABSTRACT

The Random Mutation Hill-Climbing algorithm is a direct search technique mostly used in discrete domains. It repeats the process of randomly selecting a neighbour of a best-so-far solution and accepts the neighbour if it is better than or equal to it. In this work, we propose to use a novel method to select the neighbour solution using a set of independent multi- armed bandit-style selection units which results in a bandit-based Random Mutation Hill-Climbing algorithm. The new algorithm significantly outperforms Random Mutation Hill-Climbing in both OneMax (in noise-free and noisy cases) and Royal Road problems (in the noise-free case). The algorithm shows particular promise for discrete optimisation problems where each fitness evaluation is expensive.

研究の動機と目的

  • フィットネス評価が高コストとなるノイズのある複雑な離散最適化問題において、標準的なRMHCの非効率性を解消すること。
  • 多腕バンディット選択メカニズムを統合することで、勾配上昇における探索と活用のトレードオフを改善すること。
  • ノイズや不確実性のあるフィットネス評価を伴う実世界の応用に適したスケーラブルで頑健な最適化手法を開発すること。
  • 標準ベンチマーク問題、特にOneMaxおよびRoyal Road関数におけるバンドイットベースのRMHCの性能を評価すること。
  • バンドイットベースの選択が、ランダムな近隣選択と比較して、収束速度の向上と評価オーバーヘッドの低減をもたらすことを示すこと。

提案手法

  • バイナリ文字列の各遺伝子を2腕のバンディットとしてモデル化し、腕はビットを0または1に反転させることに対応する。
  • 上界信頼区間(UCB)アルゴリズムを用いて次の近隣を選択し、緊急度項を介して探索と活用のバランスを取る。
  • フィットネス評価は遺伝子ごとに保存・更新され、ノイズの影響を軽減するためにリサンプリングが用いられる。
  • 最良のこれまでの解が維持され、各変異からのフィットネス増加に基づいてバンディットユニットが更新される。
  • アルゴリズムはUCBの探索項を通じて、有望な遺伝子値を動的に優先しつつ、未十分にサンプリングされた選択肢を探索する。
  • 問題の次元とブロックサイズを変化させたOneMaxおよびRoyal Road問題に、この手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1バンドイットベースの選択メカニズムは、ノイズのある複雑な離散最適化問題におけるランダム変異勾配上昇の性能を向上させることができるか?
  • RQ2OneMaxおよびRoyal Road関数において、バンドイットベースのRMHCは標準的なRMHCと比較して、フィットネス評価の効率性にどの程度優れているか?
  • RQ3ノイズ環境下でバンドイットベースのRMHCに最適なリサンプリング数は何か?また、それは収束にどのようないンパクトを与えるか?
  • RQ4バンドイットベースのアプローチは問題次元に比例して線形にスケーリングするか?また、信用配分における遅延フィットネス報酬をどのように処理するか?
  • RQ5バンドイットメカニズムにより、特にノイズ環境下で最適解に到達するためのフィットネス評価回数を削減できるか?

主な発見

  • ノイズのあるOneMax問題において、バンドイットベースのRMHCは標準的なRMHCと比較して、フィットネス評価数を最大10倍まで削減した。
  • リサンプリング数が2の場合、OneMaxおよびRoyal Road問題の両方において、合計のフィットネス評価数が問題次元にほぼ線形に比例した。
  • 8x8のRoyal Road問題において、バンドイットベースのRMHCは、ミンチェルらが報告した最も効率の良いRMHCバージョンと比較して、関数評価回数を半分にまで削減した。
  • 異なる問題サイズおよびブロック構成においても安定した性能を維持し、ノイズなしおよびノイズありの両設定で標準的なRMHCを上回った。
  • UCBベースの選択メカニズムは、探索と活用を効果的にバランスさせ、ノイズ環境下でも早期収束を防ぐことができた。
  • バンドイットベースの選択では、平均フィットネス評価数と問題次元の比が安定していたのに対し、標準的なRMHCではリサンプリング数が小さいほど比が増加した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。