Skip to main content
QUICK REVIEW

[論文レビュー] Multi-objective Pointer Network for Combinatorial Optimization

Le-yang Gao, Rui Wang|arXiv (Cornell University)|Apr 25, 2022
Advanced Multi-Objective Optimization Algorithms被引用数 6
ひとこと要約

本稿では、マルチオブジェクティブ・ポインタ・ネットワーク(MOPN)を提案する。これは、マルチオブジェクティブTSPを含むマルチオブジェクティブ組合せ最適化問題(MOCOP)を解くための単一モデル型深層強化学習フレームワークであり、ポインタ・ネットワークを拡張したものである。入力構造の強化と、代表モデルベースの訓練戦略および転移学習の2つの訓練戦略を採用することで、DRL-MOAに比べて60–80%の訓練時間短縮が達成され、推論速度も向上し、パレートフロントの収束性が優れている。また、メタヒューリスティクスを上回る解の品質と多様性を達成している。

ABSTRACT

Multi-objective combinatorial optimization problems (MOCOPs), one type of complex optimization problems, widely exist in various real applications. Although meta-heuristics have been successfully applied to address MOCOPs, the calculation time is often much longer. Recently, a number of deep reinforcement learning (DRL) methods have been proposed to generate approximate optimal solutions to the combinatorial optimization problems. However, the existing studies on DRL have seldom focused on MOCOPs. This study proposes a single-model deep reinforcement learning framework, called multi-objective Pointer Network (MOPN), where the input structure of PN is effectively improved so that the single PN is capable of solving MOCOPs. In addition, two training strategies, based on representative model and transfer learning, respectively, are proposed to further enhance the performance of MOPN in different application scenarios. Moreover, compared to classical meta-heuristics, MOPN only consumes much less time on forward propagation to obtain the Pareto front. Meanwhile, MOPN is insensitive to problem scale, meaning that a trained MOPN is able to address MOCOPs with different scales. To verify the performance of MOPN, extensive experiments are conducted on three multi-objective traveling salesman problems, in comparison with one state-of-the-art model DRL-MOA and three classical multi-objective meta-heuristics. Experimental results demonstrate that the proposed model outperforms all the comparative methods with only 20\% to 40\% training time of DRL-MOA.

研究の動機と目的

  • マルチオブジェクティブ組合せ最適化問題(MOCOP)に特化した深層強化学習(DRL)手法の不足に応えること。MOCOPはNP困難であり、実世界の応用で一般的に見られる。
  • 繰り返し処理を必要とせず、複数のサブモデルを必要としない単一モデルのDRLフレームワークを開発し、高品質なパレート最適解を効率的に生成すること。
  • DRL-MOAのような既存のDRLモデルに比べ、訓練時間の短縮と最適化性能の向上を図ること。DRL-MOAは複数のサブ-PNを必要とし、広範な訓練を要する。
  • 異なる問題スケールにわたる一般化を確保し、再訓練なしにさまざまなサイズのMOCOPに適用可能なモデルを実現すること。
  • 代表モデルベースの訓練戦略および転移学習ベースのファインチューニングという2つの新規訓練戦略を導入し、パレートフロントの収束性と多様性を向上させること。

提案手法

  • 複数の目的を同時に処理できるように、標準ポインタ・ネットワーク(PN)を拡張し、入力構造を改善することで、多目的コストベクトルに基づいてアクションを選択可能なアテンション機構を実装する。
  • ポリシー勾配法を用いた深層強化学習を採用し、パレート支配に基づく累積報酬を訓練信号として用い、アクション選択をガイドする。
  • 集団から多様で高品質な解を抽出し、MOPNを事前学習する代表モデルベースの訓練戦略を導入することで、初期ポリシーの品質を向上させる。
  • 事前に学習済みモデルの知識を活用してMOPNをファインチューニングする転移学習を適用し、新しい問題インスタンスにおける収束速度の向上と性能向上を図る。
  • デコーダーにアテンション機構を導入し、入力都市に対して動的に注目を向けることで、複数の目的を最適化する都市訪問順序のシーケンスを生成可能にする。
  • 訓練の安定性と勾配分散の低減を図るため、クリティックネットワークをベースラインとして採用し、ポリシー勾配の分散を低減することで、訓練の安定性と収束速度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1複数のサブモデルや反復的ヒューリスティクスを必要としない単一の深層強化学習モデルが、マルチオブジェクティブ組合せ最適化問題を効果的に解けるか。
  • RQ2提案されたMOPNフレームワークは、マルチオブジェクティブTSPインスタンスにおいて、最先端のDRLおよび古典的メタヒューリスティクス手法と比較して、性能と効率性に優れているか。
  • RQ3提案された訓練戦略(代表モデルベースおよび転移学習ベース)が、パレートフロントの収束性と多様性にどの程度向上効果をもたらすか。
  • RQ4MOPNは問題スケールの変化に対してどれほど感受的か。また、再訓練なしにさまざまなサイズのMOCOPインスタンスに一般化可能か。
  • RQ5DRL-MOAおよびNSGAIIIやMOEA/Dといった古典的メタヒューリスティクスに比べ、MOPNは収束性と解の多様性に優れているか。

主な発見

  • MOPNは、全テスト対象マルチオブジェクティブTSPインスタンスにおいて、DRL-MOA、NSGAIII、MOEA/Dに比べ、パレートフロントの収束性と多様性に優れている。
  • MOPN-TLは、特に第3の目的を最適化する点で、MOPN-RMおよびDRL-MOAを上回る解の品質を達成し、より均一でギャップのないパレートフロントを生成する。
  • MOPNはDRL-MOAに比べて訓練時間を60–80%短縮しており、MOPN-RMは全手法の中で最短の訓練時間を達成している。
  • MOPN-RMは問題スケールに依存しないため、再訓練なしにさまざまなサイズのMOCOPに適用可能であり、優れた一般化能力を示している。
  • 三目的TSP(Ins.T2O3S200-1)において、MOPN-TLは最高のハイパーボリューム(HV)値を達成し、非支配解の収束性とスパンの優位性を示している。
  • MOPNが生成するパレートフロントは、均一に分布しておりギャップがないが、DRL-MOAやメタヒューリスティクスでは疎で断片的なフロントが得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。