Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Objective Optimization of the Textile Manufacturing Process Using Deep-Q-Network Based Multi-Agent Reinforcement Learning

Zhenglei He, Kim Phuc Tran|arXiv (Cornell University)|Dec 2, 2020
Textile materials and evaluations参考文献 44被引用数 4
ひとこと要約

本稿では、テキスタイル製造工程を確率的ゲームに変換し、利己的選択メカニズムを用いて相関均衡解を達成する、深層Qネットワークに基づくマルチエージェント強化学習(MARL)フレームワークを提案する。この手法は、テキスタイルオゾネーション工程の多目的最適化において、従来手法を上回る収束性と解の品質を示す。

ABSTRACT

Multi-objective optimization of the textile manufacturing process is an increasing challenge because of the growing complexity involved in the development of the textile industry. The use of intelligent techniques has been often discussed in this domain, although a significant improvement from certain successful applications has been reported, the traditional methods failed to work with high-as well as human intervention. Upon which, this paper proposed a multi-agent reinforcement learning (MARL) framework to transform the optimization process into a stochastic game and introduced the deep Q-networks algorithm to train the multiple agents. A utilitarian selection mechanism was employed in the stochastic game, which (-greedy policy) in each state to avoid the interruption of multiple equilibria and achieve the correlated equilibrium optimal solutions of the optimizing process. The case study result reflects that the proposed MARL system is possible to achieve the optimal solutions for the textile ozonation process and it performs better than the traditional approaches.

研究の動機と目的

  • テキスタイル製造における多目的最適化の複雑化に対処すること、特にオゾネーションのような工程を対象とする。
  • 高次元かつ動的な条件下で失敗し、高い人為的介入を要する従来の最適化手法の限界を克服すること。
  • リアルタイム意思決定のためのスケーラブルで知的なフレームワークを、マルチエージェント強化学習を用いて開発すること。
  • 複数の均衡が存在する状況を避けるために、確率的ゲーム設定で相関均衡解を達成すること。
  • テキスタイルオゾネーション工程を対象とした事例研究を通じて、フレームワークの有効性を検証すること。

提案手法

  • フレームワークは、複数のエージェントが特定の工程変数を制御する、確率的ゲームとしてテキスタイル製造工程をモデル化する。
  • 各エージェントは、環境との試行錯誤的相互作用を通じて最適方策を学習するために、深層Qネットワーク(DQN)を用いる。
  • 探索と活用のバランスを図るために、-greedy探索戦略が適用され、収束の強靭性が確保される。
  • 相関均衡解への誘導を図るために、利己的選択メカニズムが導入され、協調性と解の品質が向上する。
  • 共同行動の評価と学習のための価値関数ターゲットを提供するために、集中型コーチが使用される。
  • 経験再生とターゲットネットワークを用いて、学習の安定化を図るエンドツーエンドの学習が実施される。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェント強化学習フレームワークは、テキスタイル製造工程の多目的最適化を効果的に処理できるか?
  • RQ2利己的選択メカニズムを備えた本稿のMARLシステムは、従来手法と比較して解の安定性をどのように向上させるか?
  • RQ3DQNに基づくMARLアプローチは、テキスタイル工程の確率的ゲーム設定において、どの程度相関均衡解を達成できるか?
  • RQ4本フレームワークは、テキスタイルオゾネーション工程におけるプロセスばらつきの低減と主要パフォーマンス指標の向上にどの程度寄与するか?
  • RQ5最適化結果を維持または向上させつつ、人的介入の依存度を低下させることができるか?

主な発見

  • 提案されたMARLフレームワークは、テキスタイルオゾネーション工程において最適解を効果的に達成し、従来の最適化手法を上回った。
  • 利己的選択メカニズムのおかげで、複数の均衡が存在する問題を緩和し、収束速度と安定性が向上した。
  • 深層Qネットワークの使用により、産業用テキスタイル工程に一般的な高次元の状態空間と行動空間においても、効果的な学習が可能になった。
  • 複数の工程変数における意思決定の自動化により、人的介入の必要性が低減された。
  • 事例研究により、MARLシステムが、収量の向上とリソース消費の低減を含む、より優れた多目的トレードオフを達成したことが確認された。
  • 結果から、MARLとDQN、利己的選択メカニズムの統合は、複雑な産業最適化タスクに対して実用的かつ効果的なアプローチであると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。