Skip to main content
QUICK REVIEW

[논문 리뷰] Certifiably Robust Policy Learning against Adversarial Communication in Multi-agent Systems

Yanchao Sun, Ruijie Zheng|arXiv (Cornell University)|2022. 06. 21.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 다중 에이전트 강화 학습에서 악성 통신에 대응하는 증명 가능하게 강건한 방어 기법인 Ablated Message Ensemble(AME)을 제안한다. 여러 개의 메시지 부분 집합을 추출하여 행동을 집약함으로써, 최대 $ C < \frac{N-1}{2} $개의 메시지가 손상된 경우에도 정책의 강건성을 보장하면서 정상적인 통신 상황에서도 뛰어난 성능을 유지한다. 이 방법은 공격 전략과 무관하게 이론적 보장을 제공한다.

ABSTRACT

Communication is important in many multi-agent reinforcement learning (MARL) problems for agents to share information and make good decisions. However, when deploying trained communicative agents in a real-world application where noise and potential attackers exist, the safety of communication-based policies becomes a severe issue that is underexplored. Specifically, if communication messages are manipulated by malicious attackers, agents relying on untrustworthy communication may take unsafe actions that lead to catastrophic consequences. Therefore, it is crucial to ensure that agents will not be misled by corrupted communication, while still benefiting from benign communication. In this work, we consider an environment with $N$ agents, where the attacker may arbitrarily change the communication from any $C&lt;\frac{N-1}{2}$ agents to a victim agent. For this strong threat model, we propose a certifiable defense by constructing a message-ensemble policy that aggregates multiple randomly ablated message sets. Theoretical analysis shows that this message-ensemble policy can utilize benign communication while being certifiably robust to adversarial communication, regardless of the attacking algorithm. Experiments in multiple environments verify that our defense significantly improves the robustness of trained policies against various types of attacks.

연구 동기 및 목표

  • 악성 통신으로 인해 에이전트가 치명적인 행동을 유도당할 수 있는 다중 에이전트 강화 학습의 핵심적 안전성 격차를 해결하기 위해.
  • 최대 $ C < \frac{N-1}{2} $개의 메시지를 손상시킬 수 있는 강력하고 적응형 공격자에 대비해 강건성을 보장하는 방어 기법을 개발하기 위해.
  • 정상적인 통신 상황에서도 높은 성능을 유지하면서 악성 조건 하에서도 이론적 강건성을 확보하기 위해.
  • 실험적 방어와는 달리 증명 가능한 방어를 제공하여 공격자의 전략과 관계없이 수학적 보장을 제공하기 위해.

제안 방법

  • 다양한 무작위로 제거된 메시지 부분 집합에서 행동을 집약하는 메시지 앙상블 정책을 제안한다.
  • N-1명의 에이전트에서 무작위로 선택된 k개의 메시지 기반으로 기본 행동을 출력하는 메시지 제거 정책을 학습한다.
  • 여러 개의 메시지 부분 집합에서의 행동을 평균 내거나 투표하여 최종 정책를 구성함으로써 최대 C개의 손상된 메시지에 대한 강건성을 확보한다.
  • 이론적 분석을 통해 $ k \geq \frac{C}{2} + 1 $ 조건을 만족할 경우, 적어도 하나의 부분 집합에 정상 메시지의 다수를 포함함을 보장함으로써 이론적으로 증명 가능한 강건성을 입증한다.
  • 사전 처리 단계에서 액션 바이어스를 활용해 악성 메시지를 탐지하여 제거함으로써 더 큰 k 값을 허용하고 자연스러운 성능을 향상시키는 방법을 도입한다.
  • 행동 바이어스의 중앙값 기반 메트릭을 사용해 극단적으로 이탈하는 행동을 유도하는 메시지를 식별함으로써, 이는 손상된 에이전트에서 유래할 가능성이 높다고 가정한다.

실험 결과

연구 질문

  • RQ1공격자가 최대 $ C < \frac{N-1}{2} $개의 메시지를 손상시킬 수 있는 적응형 공격자에 대비해, 다중 에이전트 시스템에서 악성 통신에 대해 강건성을 보장하는 방어 기법을 설계할 수 있는가?
  • RQ2어떤 악성 변형이든 존재하는 상황에서 정상 통신 상황의 높은 성능을 유지하면서도 이론적 강건성을 확보할 수 있는가?
  • RQ3메시지 제거와 앙상블 집약이 악성 훈련이나 히وري스틱에 의존하지 않고도 증명 가능한 강건성을 제공할 수 있는가?
  • RQ4악성 메시지를 어떻게 탐지할 수 있을까? 이는 강건한 정책의 자연스러운 성능을 향상시키되, 증명 가능한 보장을 훼손하지 않도록 하기 위해서다.
  • RQ5메시지 필터링과 부정확 기반 앙상블을 조합함으로써 강건성과 자연스러운 성능 간의 트레이드오프를 완화할 수 있는가?

주요 결과

  • 부정확 메시지 앙상블(AME) 방어 기법은 공격자의 전략과 관계없이 항상 유효한 이론적 보장을 제공하는 증명 가능하게 강건한 방어를 달성한다.
  • AME는 다양한 다중 에이전트 강화 학습 환경에서 정상 통신 상황에서도 뛰어난 성능을 유지함을 입증하였으며, 강건성이 자연스러운 성능에 비용을 치르지 않음을 보여준다.
  • 실험 결과, AME는 도드라진, 적응형, 협력형 공격을 포함한 다양한 공격 타입에 대해 강건성을 크게 향상시킴을 확인하였다.
  • 액션 바이어스 메트릭은 악성 메시지를 효과적으로 식별하며, 해킹된 에이전트는 정상 에이전트보다 유의미하게 높은 바이어스를 보였다. 이는 탐지 방법의 타당성을 검증한다.
  • 단 한 개의 악성 메시지라도 제거하면 더 큰 $ k $ 값을 허용할 수 있어 정책의 자연스러운 성능을 향상시키면서도 강건성을 유지할 수 있다.
  • 이론적 조건이 완화되어도 이론적 보장 이외의 실질적 강건성이 유지됨을 확인하여, 공식 보장 이외의 실용적 강건성도 확보됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.