Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Curriculum Learning Strategies in Neural Combinatorial Optimization

Michal Lisicki, Arash Afkanpour|arXiv (Cornell University)|Nov 12, 2020
Topic Modeling参考文献 21被引用数 11
ひとこと要約

本論文は、多様な問題サイズにおけるTSPを解くニューラル組合せ最適化(NCO)モデルの性能を向上させるために、適応的段階的サンプリングを用いたカリキュラム学習戦略を提案する。動的にタスクの難易度を調整し、より小さい問題の繰り返し学習を組み込むことで、深刻な忘却を軽減し、一般化性能を向上させ、4~150のサイズ範囲で最適解との差(optimality gap)において、標準的なカリキュラム学習および一様サンプリング手法を上回る結果を得た。

ABSTRACT

Neural combinatorial optimization (NCO) aims at designing problem-independent and efficient neural network-based strategies for solving combinatorial problems. The field recently experienced growth by successfully adapting architectures originally designed for machine translation. Even though the results are promising, a large gap still exists between NCO models and classic deterministic solvers, both in terms of accuracy and efficiency. One of the drawbacks of current approaches is the inefficiency of training on multiple problem sizes. Curriculum learning strategies have been shown helpful in increasing performance in the multi-task setting. In this work, we focus on designing a curriculum learning-based training procedure that can help existing architectures achieve competitive performance on a large range of problem sizes simultaneously. We provide a systematic investigation of several training procedures and use the insights gained to motivate application of a psychologically-inspired approach to improve upon the classic curriculum method.

研究の動機と目的

  • ニューラル組合せ最適化(NCO)モデルと古典的ソルバーとの性能格差を是正し、複数の問題サイズにわたる一般化を可能にする。
  • カリキュラム学習が、特に変動するTSPインスタンスサイズにわたる、深刻な忘却を軽減し、知識の転送を向上させられるかを調査する。
  • 特にリハーサルベースおよび適応的アプローチを含む、さまざまなサンプリング戦略のモデルの一般化性能および性能の一貫性への効果を評価する。
  • 生物的・心理学的根拠を持つ訓練戦略(例:適応的段階的)を、組合せ最適化におけるディープラーニングに適用可能かどうかを検討する。

提案手法

  • 変動するサイズのTSPインスタンスを解くためのベースアーキテクチャとして、[19]で提示されたアテンションベースモデル(AM)を採用した。
  • モデルのパフォーマンスに基づいて動的に調整されるカリキュラム学習フレームワークを設計し、タスクの難易度を増加する順序でスケジューリングした。
  • 性能の閾値(α = 0.05)を用いてタスク難易度を段階的に引き上げるとともに、以前に学習済みの小さな問題を再び学習する、適応的段階的サンプリングを実装した。
  • 1エポックあたりのバッチ数を現在のグラフサイズに比例させるように定義し、サイズ間でのデータ露出をバランスさせた。
  • 最適解との差を計算する基準として、Held-Karp(HK)下界を用い、一貫性があり分野標準の評価を保証した。
  • 一様サンプリング、古典的カリキュラム、適応的段階的サンプリングといった、異なるサンプリング戦略を用いてモデルを訓練し、全問題サイズにわたるパフォーマンスを比較した。

実験結果

リサーチクエスチョン

  • RQ1カリキュラム学習は、広範なTSP問題サイズにわたるNCOモデルの一般化を改善できるか?
  • RQ2問題サイズ間での知識転送はどのように変化するか?サイズが増加するに従い滑らかに変化するか?
  • RQ3問題サイズが増加する中で訓練する際、深刻な忘却が性能にどの程度制限を加えるか?
  • RQ4リハーサルベースで適応的なカリキュラム戦略(例:適応的段階的)は、標準的カリキュラムおよび一様サンプリングを上回る性能を示せるか?
  • RQ5生物的・心理学的根拠を持つ訓練戦略(例:適応的段階的)は、組合せ最適化におけるモデル性能の向上と忘却の軽減に有効であるか?

主な発見

  • NCOにおける問題サイズ間の知識転送は測定可能であり、サイズが小さいほど大きいサイズへの転送が顕著であるが、サイズが増加するに従いその大きさは減少する。
  • 一様サンプリングで訓練されたモデルは、最も一貫性のあるパフォーマンスを示したが、全体の最適解との差が最も大きく、一般化性能が最適でないことが示された。
  • 古典的カリキュラム学習は、小さな問題でのパフォーマンスの低下を軽減したが、以前に学習済みのタスクでの深刻な忘却に見舞われた。
  • 動的な難易度調整とリハーサルを組み合わせた適応的段階的戦略は、平均パフォーマンスと忘却のバランスが最も良く、すべてのベースラインを上回った。
  • 適応的段階的戦略で訓練された最終モデルは、4~150の全問題サイズで最適解との差が10%未満であり、5回の実験で信頼区間が安定しており、性能の一貫性が保証された。
  • 結果から、小さな問題のリハーサルがサイズにわたるパフォーマンスの維持に不可欠であることが明らかになった。これは、NCOにおける適応的かつ心理学的根拠を持つ訓練スケジュールの必要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。