Skip to main content
QUICK REVIEW

[논문 리뷰] Learning-based decentralized offloading decision making in an adversarial environment

Byungjin Cho, Yu Xiao|arXiv (Cornell University)|2021. 04. 26.
Privacy-Preserving Technologies in Data참고 문헌 42인용 수 7
한 줄 요약

이 논문은 동적인 불확실한 조건 하에서 흐름 노드 선택을 최적화하기 위해 적대적 다중 손잡이 밴딧 이론을 사용하는 학습 기반 탈중앙화 오프로딩 알고리즘을 제안한다. 입력 크기 의존성 선택과 적응형 점수 패치 기법을 통합함으로써, 변동성이 큰 자원 공급과 수요가 존재하는 적대적 환경에서도 낮은 회귀와 뛰어난 성능을 달성하며, 평균 비트당 비용에서 벤치마크 대비 최대 30% 향상을 이룬다.

ABSTRACT

Vehicular fog computing (VFC) pushes the cloud computing capability to the distributed fog nodes at the edge of the Internet, enabling compute-intensive and latency-sensitive computing services for vehicles through task offloading. However, a heterogeneous mobility environment introduces uncertainties in terms of resource supply and demand, which are inevitable bottlenecks for the optimal offloading decision. Also, these uncertainties bring extra challenges to task offloading under the oblivious adversary attack and data privacy risks. In this article, we develop a new adversarial online learning algorithm with bandit feedback based on the adversarial multi-armed bandit theory, to enable scalable and low-complexity offloading decision making. Specifically, we focus on optimizing fog node selection with the aim of minimizing the offloading service costs in terms of delay and energy. The key is to implicitly tune the exploration bonus in the selection process and the assessment rules of the designed algorithm, taking into account volatile resource supply and demand. We theoretically prove that the input-size dependent selection rule allows to choose a suitable fog node without exploring the sub-optimal actions, and also an appropriate score patching rule allows to quickly adapt to evolving circumstances, which reduce variance and bias simultaneously, thereby achieving a better exploitation-exploration balance. Simulation results verify the effectiveness and robustness of the proposed algorithm.

연구 동기 및 목표

  • 변동성이 큰 자원 공급과 수요가 존재하는 환경에서 탈중앙화된 작업 오프로딩 문제를 해결하기 위해.
  • 중앙 집중적 조율에 의존하지 않고도 오프로딩 서비스 비용—특히 지연과 에너지—를 최소화하기 위해.
  • 적대적이고 비정상적인 환경에서 실시간 의사결정에서 탐색과 이용의 균형을 맞추기 위해.
  • 전체 상태 정보 공유를 피하고 밴딧 피드백만을 사용하여 확장 가능하고 복잡도가 낮은 오프로딩 결정을 가능하게 하기 위해.
  • 후보 흐름 노드 가용성과 작업 크기 동적 변화에 대한 강건성을 향상시키기 위해.

제안 방법

  • 각 잠재적 VFN을 한 개의 팔로 간주하여, 흐름 노드 선택 문제를 적대적 다중 손잡이 밴딧 문제로 수식화한다.
  • 부적절한 행동의 탐색을 줄이기 위해 입력 크기에 따라 선택되는 규칙을 도입한다.
  • 환경 변화에 신속하게 적응하기 위해 동적 점수 패치 규칙을 활용한다.
  • 전체 상태 관측 없이도 오프로딩 비용(지연 및 에너지)을 밴딧 피드백을 통해 학습한다.
  • 탐색과 이용의 균형을 유지하면서도 회귀를 최소화하는 학습 알고리즘을 설계한다.
  • 이론적 분석을 통해 불확실성 하에서 의사결정의 분산과 편향을 모두 감소시킨다는 것을 증명한다.

실험 결과

연구 질문

  • RQ1제한된 정보 하에서 변동성이 크고 적대적인 차량 기반 퍼그 환경에서 탈중앙화된 작업 오프로딩을 어떻게 최적화할 수 있는가?
  • RQ2자원 가용성과 수요가 변동성이 클 경우 탐색-이용 균형을 효과적으로 달성할 수 있는 메커니즘은 무엇인가?
  • RQ3중앙 집중적 조율이나 전체 상태 지식 없이도 학습 기반 접근이 낮은 회귀와 낮은 비트당 비용을 달성할 수 있는가?
  • RQ4입력 크기 의존성은 의사결정 정확도를 향상시키고 불필요한 탐색을 줄이는 데 어떤 영향을 미치는가?
  • RQ5적응형 점수 패치 기법은 환경 변화에 대한 반응성을 얼마나 향상시키는가?

주요 결과

  • 제안된 알고리즘은 고밀도 VFN 환경에서 주행 중 저조도 시나리오에서 UCB 및 Exp3IX 대비 평균 비트당 비용을 최대 30% 감소시킨다.
  • 정점 교통 시간대에는 UCB 대비 23% 감소, 부분 리셋이 있는 변동성이 큰 Exp3IX 대비 10% 감소한 평균 비트당 비용을 달성한다.
  • 알고리즘은 다양한 작업 크기와 동적인 VFN 가용성 상황에서도 강건한 성능 유지를 보이며 뛰어난 적응성을 입증한다.
  • 이론적 분석을 통해 입력 크기 의존성 선택 규칙이 부적절한 행동의 탐색을 피함으로써 효율성을 향상시킨다는 것이 확인된다.
  • 점수 패치 규칙은 환경 변화에 대한 빠른 적응을 가능하게 하여 의사결정의 편향과 분산을 모두 감소시킨다.
  • 시뮬레이션 결과는 가중치 파rameter ξ에 따라 성능 저하 또는 향상이 부드럽게 변화함을 보이며, 지연과 에너지 비용 간의 조율 가능한 트레이드오프를 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.