[論文レビュー] A Lightweight CNN-Transformer Model for Learning Traveling Salesman Problems
本論文では、CNN埋め込み層を用いて空間特徴の学習を向上させ、デコーダーにおける部分的自己注意機構を導入することで計算負荷を低減する軽量なCNN-Transformerモデルを提案する。このモデルは、TSPインスタンスにおいて最先端の解の品質を達成するとともに、従来のTransformerベースのモデルと比較してGPUメモリ使用量を約20%削減し、推論時間を45%短縮した。
Several studies have attempted to solve traveling salesman problems (TSPs) using various deep learning techniques. Among them, Transformer-based models show state-of-the-art performance even for large-scale Traveling Salesman Problems (TSPs). However, they are based on fully-connected attention models and suffer from large computational complexity and GPU memory usage. Our work is the first CNN-Transformer model based on a CNN embedding layer and partial self-attention for TSP. Our CNN-Transformer model is able to better learn spatial features from input data using a CNN embedding layer compared with the standard Transformer-based models. It also removes considerable redundancy in fully-connected attention models using the proposed partial self-attention. Experimental results show that the proposed CNN embedding layer and partial self-attention are very effective in improving performance and computational complexity. The proposed model exhibits the best performance in real-world datasets and outperforms other existing state-of-the-art (SOTA) Transformer-based models in various aspects. Our code is publicly available at https://github.com/cm8908/CNN_Transformer3.
研究の動機と目的
- 大規模なTSPインスタンスを解く際、標準的なTransformerモデルの高い計算複雑性とGPUメモリ使用量を低減すること。
- 標準的な埋め込みをCNNベースの埋め込み層に置き換えることで、TSPにおける空間特徴抽出を向上させること。
- 部分的自己注意機構を用いてデコーダー内の冗長な注意計算を削減し、解の品質を損なわず効率を向上させること。
- 既存の最先端のTransformerベースのTSPソルバーと比較して、より優れたTSPの解の品質を実現するとともに、より低いメモリ使用量とより速い推論速度を達成すること。
- 組合せ最適化問題(TSPを含む)に対して、より効率的かつスケーラブルなディープラーニングソリューションを提供すること。
提案手法
- 都市の座標入力における局所的な空間パターンをよりよく捉えるために、CNNベースの埋め込み層を導入する。
- 注意計算を関連するトークンに限定することで冗長性を低減する、部分的自己注意機構を適用した変更版のTransformerデコーダーを採用する。
- 反復的生成戦略とビームサーチを用いて、重複した都市の訪問を回避しながら有効なTSP巡回路を生成する。
- 従来のモデルで一般的な層正則化とは異なり、エンコーダーとデコーダーのブロックにバッチ正則化を適用する。
- 巡回路長を最適化目的関数として、教師あり学習によりモデルを訓練する。
- メモリ消費量の低減により、トレーニング中により大きなバッチサイズを可能にし、トレーニング効率を向上させる。

実験結果
リサーチクエスチョン
- RQ1CNN-Transformerハイブリッドモデルは、標準的なTransformerと比較して、TSPにおける空間特徴の学習を向上させることができるか?
- RQ2デコーダーにおける部分的自己注意機構は、計算負荷を低減しつつも、解の品質を維持または向上させることができるか?
- RQ3提案手法は、最先端のTransformerベースのTSPソルバーと比較して、より速い推論速度と低いGPUメモリ使用量を達成できるか?
- RQ4本モデルは、ランダムな合成TSPインスタンスおよびkroC100やberlin52などの実世界のTSPベンチマークにおいて、どのように性能を発揮するか?
- RQ5ヒューリスティックな精錬技術と組み合わせることで、モデルの性能はどの程度向上するか?
主な発見
- 提案モデルはTSP Transformerと比較してGPUメモリ使用量を約20%削減し、より大きなバッチサイズの利用が可能になった。
- TSP100において、推論時間が74.86秒のTSP Transformerと比較して51.33秒にまで短縮され、45%の高速化が達成された。
- kroC100では平均巡回路長21,523を達成し、TSP Transformerの21,788を上回った。
- berlin52では平均巡回路長7,610を記録し、TSP Transformerの7,637を上回った。
- TSP Transformer(1.41Mパラメータ)と比較してやや多い1.43Mパラメータを有するが、これに見合う高い効率性と性能向上が見られた。
- ランダムおよび実世界のTSPインスタンスの両方において、優れた解の品質を示し、TSP50では最適解とのギャップが0.0004%、TSP100では0.39%であった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。