Skip to main content
QUICK REVIEW

[論文レビュー] Prototype of Fault Adaptive Embedded Software for Large-Scale Real-Time Systems

Derek Messie, Min-A Jung|ArXiv.org|Apr 29, 2005
Embedded Systems and FPGA Design被引用数 6
ひとこと要約

この論文は、フェルミラブのBTeV高エネルギー物理学実験を対象として、大規模リアルタイムシステムにおける故障に適応する埋め込みソフトウェアのプロトタイプを提示する。Very Lightweight Agents (VLAs) と Adaptive, Reconfigurable, and Mobile Objects for Reliability (ARMOR) を採用し、16個のDSP上で自己修復・自己保護・自己最適化の故障耐性を実現した。これは、高データレート環境における、スケーラブルで分散的かつリアルタイムな故障応答を示している。

ABSTRACT

This paper describes a comprehensive prototype of large-scale fault adaptive embedded software developed for the proposed Fermilab BTeV high energy physics experiment. Lightweight self-optimizing agents embedded within Level 1 of the prototype are responsible for proactive and reactive monitoring and mitigation based on specified layers of competence. The agents are self-protecting, detecting cascading failures using a distributed approach. Adaptive, reconfigurable, and mobile objects for reliablility are designed to be self-configuring to adapt automatically to dynamically changing environments. These objects provide a self-healing layer with the ability to discover, diagnose, and react to discontinuities in real-time processing. A generic modeling environment was developed to facilitate design and implementation of hardware resource specifications, application data flow, and failure mitigation strategies. Level 1 of the planned BTeV trigger system alone will consist of 2500 DSPs, so the number of components and intractable fault scenarios involved make it impossible to design an `expert system' that applies traditional centralized mitigative strategies based on rules capturing every possible system state. Instead, a distributed reactive approach is implemented using the tools and methodologies developed by the Real-Time Embedded Systems group.

研究の動機と目的

  • BTeV素粒子物理学実験のような、大規模で高データレートのリアルタイムシステムにおける故障耐性の課題に対処する。
  • 中央集権的なエキスパートシステムの限界を克服するため、故障緩和に向けた分散型で適応可能なソフトウェアアーキテクチャを設計する。
  • リアルタイムでのエラー検出・診断・回復を可能にする、軽量で自己保護機能を備えたエージェント(VLAs)および再構成可能な信頼性オブジェクト(ARMOR)を開発する。
  • 自己設定可能で移動可能かつ反応性のあるソフトウェアコンポーネントを通じて、環境の変化への動的適応を可能にする。
  • DSPとEPICSを用いて故障注入および監視を実施する実ハードウェアプロトタイプにおいて、故障に適応するコンポーネントの統合とスケーラビリティを実証する。

提案手法

  • アセンブリ言語を用いてVery Lightweight Agents (VLAs) を実装し、DSPの例外および割り込みメカニズムを活用して、能動的・受動的な故障監視を実現する。
  • エラー検出を可能にし、是正措置を開始するか、上位コンポーネントに通知するための必須および任意の能動的コンponentsを備えたVLAsを設計する。
  • L2/L3レベルでの信頼性を実現するため、適応可能で再構成可能かつ移動可能なソフトウェアオブジェクト(ARMOR)を開発する。
  • システム設計および実装のため、ハードウェアリソース、データフロー、障害緩和戦略をモデル化するために、Generic Modeling Environment (GME) を使用する。
  • 故障注入およびVLAの動作とシステム全体の故障緩和の監視を可能にするために、Experimental Physics and Industrial Control System (EPICS) を統合する。
  • 16個のTexas Instruments DSPを用いてプロトタイプを構築し、リアルタイムで高データレート環境における分散型で適応可能な故障耐性アプローチを検証する。

実験結果

リサーチクエスチョン

  • RQ1BTeVトリガー・システムのような、数千個の処理要素を有する大規模リアルタイムシステムで、故障耐性をどのように達成できるか?
  • RQ2中央集権的制御なしに、分散型で軽量なエージェントが故障を検出し、応答するためのメカニズムは何か?
  • RQ3高速データ処理を目的としたリアルタイム埋め込みソフトウェアに、自己修復および自己保護機能をどのように組み込むことができるか?
  • RQ4汎用モデリング環境(GME)は、故障に適応するシステムのスケーラブルな設計および実装をどのように可能にするか?
  • RQ5適応的故障緩和動作の検証のため、プロトタイプに故障注入および監視を効果的に統合する方法は何か?

主な発見

  • 16個のDSPを用いたプロトタイプは、分散型で軽量なエージェントベースの故障耐性の実現可能性を成功裏に検証した。
  • VLAsは例外シグナルおよび割り込み処理を通じて故障を検出し、応答可能であり、リアルタイムでのエラー緩和を可能にした。
  • ARMORは、上位処理レベルでの信頼性を実現するための柔軟で自己設定可能なメカニズムを提供し、システム変化への動的適応を支援した。
  • EPICSの統合により、効果的な故障注入とVLAの緩和行動のリアルタイム監視が可能になり、システムの応答性が確認された。
  • プロトタイプは、バージョン管理、システム変更のログ記録、大規模共同開発における標準化された開発手法の必要性に関する重要な教訓を明らかにした。
  • 2,500個のDSPへのスケーリングは依然として主な課題であり、今後の作業は、スケールでのパフォーマンスおよび故障耐性の実証に焦点を当てる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。