[論文レビュー] An LLM-Based Digital Twin for Optimizing Human-in-the Loop Systems
本稿では、大型ショッピングモールにおける多様な人口グループの熱的快適性嗜好および行動をシミュレートするLLMベースのデジタルツインを提案し、適応型HVAC制御のための強化学習(RL)エージェントを訓練する。LLM駆動のエージェントが合成された人間のフィードバックを生成することで、AitL-RLフレームワークは、エネルギー消費と居住者快適性の両立を実現するリアルタイムのシミュレーションにおいて、個別化・分散型温度制御ポリシーを採用し、固定設定値制御を上回る性能を発揮した。
The increasing prevalence of Cyber-Physical Systems and the Internet of Things (CPS-IoT) applications and Foundation Models are enabling new applications that leverage real-time control of the environment. For example, real-time control of Heating, Ventilation and Air-Conditioning (HVAC) systems can reduce its usage when not needed for the comfort of human occupants, hence reducing energy consumption. Collecting real-time feedback on human preferences in such human-in-the-loop (HITL) systems, however, is difficult in practice. We propose the use of large language models (LLMs) to deal with the challenges of dynamic environments and difficult-to-obtain data in CPS optimization. In this paper, we present a case study that employs LLM agents to mimic the behaviors and thermal preferences of various population groups (e.g. young families, the elderly) in a shopping mall. The aggregated thermal preferences are integrated into an agent-in-the-loop based reinforcement learning algorithm AitL-RL, which employs the LLM as a dynamic simulation of the physical environment to learn how to balance between energy savings and occupant comfort. Our results show that LLMs are capable of simulating complex population movements within large open spaces. Besides, AitL-RL demonstrates superior performance compared to the popular existing policy of set point control, suggesting that adaptive and personalized decision-making is critical for efficient optimization in CPS-IoT applications. Through this case study, we demonstrate the potential of integrating advanced Foundation Models like LLMs into CPS-IoT to enhance system adaptability and efficiency. The project's code can be found on our GitHub repository.
研究の動機と目的
- ヒューマンインザループ(HITL)サイバーフィジカルシステム(CPS-IoT)において、特にショッピングモールなどの公共施設において、リアルタイムの人間フィードバックを収集する課題に対処すること。
- 大規模言語モデル(LLM)を用いて、複雑な人間行動と嗜好をスケーラブルかつプライバシー保護的にシミュレートする方法を開発すること。
- デジタルツイン駆動の強化学習フレームワークを通じて、HVACシステムのエネルギー効率と居住者快適性を最適化すること。
- LLMによって生成されたデータが、現実世界の動的環境に一般化可能なRLポリシーを効果的に訓練できるかどうかを評価すること。
- エネルギーコストとユーザー快適性のバランスを取る上で、集中型対分散型制御ポリシーの性能を比較すること。
提案手法
- LLM駆動の自律的エージェントが、ショッピングモール環境内における、若年層の家族や高齢カップルなど、個別の移動パターンと熱的快適性嗜好を有する異なる人口グループをシミュレートする。
- GPT-3.5とGPT-4を用いて、各シミュレーションイテレーションにおいて、ユーザーの到着、移動、快適性フィードバックを合成的に生成するが、微調整は行わず、推論のみに限定することで計算コストを最小限に抑える。
- 得られたシミュレートデータを用いて、エネルギーコストとユーザー快適性の両方を最適化する重み付き目的関数を通じて、AitL-RL(エージェントインザループ強化学習)アルゴリズムを事前学習する。
- RLポリシーは、LLMによって生成されたデータを用いてオフラインで学習され、その後、未知の日付の新しいシナリオにおいてリアルタイム制御とフィードバックを伴うオンライン評価が行われる。
- 集中型(均一な温度設定)と分散型(店舗別温度制御)の2つの制御戦略を比較し、快適性とエネルギーコストの両方を考慮したバランススコアを用いてポリシーの性能を測定する。
- 快適性(wc)とエネルギーコスト(we)の重みを調整可能な多目的損失関数をフレームワークに採用し、異なる運用優先順位におけるトレードオフ分析を可能にする。

実験結果
リサーチクエスチョン
- RQ1LLM駆動のエージェントは、ショッピングモールのような大規模で開放的な公共空間において、多様な人間行動および熱的快適性嗜好を正確にシミュレートできるか?
- RQ2LLMによって生成された合成データは、ヒューマンインザループシステムにおけるリアルタイムHVAC制御のための強化学習ポリシーを効果的に訓練できるか?
- RQ3エネルギー節約と居住者快適性のバランスを取る上で、分散型温度制御は集中型制御に比べて優れているか?
- RQ4目的関数の重み(快適性対エネルギーコスト)の違いが、得られる制御ポリシーおよびシステム性能に与える影響は何か?
- RQ5AitL-RLフレームワークは、未観測の運用シナリオに一般化可能であり、標準の設定値制御ポリシーを上回る性能を発揮できるか?
主な発見
- AitL-RLフレームワークは、全評価指標において固定設定値制御(25°C)を著しく上回り、エネルギーコストとユーザー快適性の両立を実現した。
- 個別化と迅速な反応性に優れるため、占有状況とグループの嗜好に基づいて各店舗で温度を最適化する分散型制御ポリシーが、集中型ポリシーを上回った。
- 快適性とエネルギーコストの両方の目的関数を組み合わせたバランス重みアプローチが、最高の全体的システムスコアを達成し、多目的最適化の重要性を示した。
- LLMベースのデジタルツインは、大規模な開放空間内の複数の店舗にわたり、グループ固有の移動行動と熱的快適性嗜好を含む複雑な人間行動を効果的にシミュレートした。
- エネルギー中心の設定(wc=0)では、ポリシーが周囲温度(30°C)に近づけるよう温度を上昇させ、エネルギー消費を顕著に削減した。一方、快適性中心の設定(we=0)では、居住者の満足度を最優先するために温度を低下させた。
- すべての学習設定において、RLポリシーが効果的に収束したため、LLMによって生成されたデータがポリシー学習に安定的かつスケーラブルであることが確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。