Skip to main content
QUICK REVIEW

[논문 리뷰] Person-in-WiFi: Fine-grained Person Perception using WiFi

Fei Wang, Sanping Zhou|arXiv (Cornell University)|2019. 03. 30.
Indoor and Outdoor Localization Technologies참고 문헌 52인용 수 17
한 줄 요약

이 논문은 1차원 센서인 일반 소매 WiFi 안테나만을 사용하여 정교한 사람 인식—신체 분할 및 자세 추정—을 달성한 최초의 시스템인 Person-in-WiFi를 제안한다. 여러 WiFi 송수신기 쌍으로부터의 1차원 채널 상태 정보(CSI) 신호에 딥러닝을 적용하고 2차원 이미지 레이블을 지도로 사용함으로써, 카메라 기반 방법과 비교할 만한 성능을 달성하였으며, 이는 1차원 전자기파 신호가 다소 불안정한 문제임에도 불구하고 인간의 신체 공간적 구조를 상세하게 재구성할 수 있음을 보여준다.

ABSTRACT

Fine-grained person perception such as body segmentation and pose estimation has been achieved with many 2D and 3D sensors such as RGB/depth cameras, radars (e.g., RF-Pose) and LiDARs. These sensors capture 2D pixels or 3D point clouds of person bodies with high spatial resolution, such that the existing Convolutional Neural Networks can be directly applied for perception. In this paper, we take one step forward to show that fine-grained person perception is possible even with 1D sensors: WiFi antennas. To our knowledge, this is the first work to perceive persons with pervasive WiFi devices, which is cheaper and power efficient than radars and LiDARs, invariant to illumination, and has little privacy concern comparing to cameras. We used two sets of off-the-shelf WiFi antennas to acquire signals, i.e., one transmitter set and one receiver set. Each set contains three antennas lined-up as a regular household WiFi router. The WiFi signal generated by a transmitter antenna, penetrates through and reflects on human bodies, furniture and walls, and then superposes at a receiver antenna as a 1D signal sample (instead of 2D pixels or 3D point clouds). We developed a deep learning approach that uses annotations on 2D images, takes the received 1D WiFi signals as inputs, and performs body segmentation and pose estimation in an end-to-end manner. Experimental results on over 100000 frames under 16 indoor scenes demonstrate that Person-in-WiFi achieved person perception comparable to approaches using 2D images.

연구 동기 및 목표

  • 카메라, 레이더, LiDAR와 비교해 저렴하고, 더 적은 전력 소비, 개인정보 보호에 유리한 일반 소매 WiFi 안테나만을 사용하여 정교한 사람 인식—예를 들어 신체 분할 및 자세 추정—을 가능하게 하는 것.
  • 다중 경로 전파, 신체 이질성, 생리적 운동으로 인해 본질적으로 모호한 1D WiFi 채널 상태 정보(CSI) 신호로부터 인간 신체의 2D 공간적 세부 정보를 복원하는 도전 과제를 해결하는 것.
  • 2D RGB 영상에서 유도된 레이블을 사용하여 1D CSI 신호를 2D 인간 신체 마스크 및 관절 좌표로 매핑하는 딥러닝 프레임워크를 개발하고, 엔드 투 엔드 학습을 가능하게 하는 것.
  • 실내 환경에서의 WiFi 기반 인식의 타당성과 성능을 평가하고, 훈련되지 않은 장면으로의 일반화 능력을 검증하는 것.
  • 환경 변화에 대한 강인성 향상과 새로운 환경에서의 일반화 능력을 향상시키기 위해 데이터 증강 및 적대적 훈련 기법을 탐색하는 것.

제안 방법

  • 시스템은 표준 라우터처럼 배열된 3개의 일반 소매 WiFi 안테나 세트(송신기 1개, 수신기 1개)를 사용하여 2.4 GHz 중심 주변 30개 주파수에서 1차원 CSI 신호를 캡처한다.
  • 각 CSI 신호는 인간 신체, 가구, 벽 등으로부터 반사된 파장의 초합으로서, 안테나 쌍 별로 1차원 시간 시리즈 신호를 형성한다.
  • 2D 이미지 레이블(OpenPose 및 Mask R-CNN에서 유도된 신체 마스크 및 관절 좌표)을 지도로 사용하고 1D CSI 신호를 입력으로 사용하여 엔드 투 엔드로 딥러닝 모델을 훈련한다.
  • 모델은 분할 작업을 위해 U-Net 기반 아키텍처를 사용하고, 관절 추정을 위해 히트맵 회귀 헤드를 활용하며, 두 작업을 동시에 최적화한다.
  • 환경 변화에 대한 강인성을 향상시키기 위해, 생성 모델이 환경에 영향을 받지 않는 CSI 표현을 학습하도록 하는 GAN 기반의 적대적 훈련 전략을 도입한다.
  • 시스템은 16개의 실내 장면에서 10만 개 이상의 프레임을 대상으로 평가되었으며, mIoU 및 mPCK 지표를 사용해 카메라 기반 기준과 성능을 비교하였다.

실험 결과

연구 질문

  • RQ11D 신호의 강도 데이터에서 2D 공간적 구조를 복원하는 데 있어 심각한 불안정성 문제에도 불구하고, 1D WiFi 신호만을 사용하여 정교한 인간 신체 인식(분할 및 자세 추정)을 달성할 수 있는가?
  • RQ2카메라 기반 최신 기술과 비교했을 때, WiFi 기반 사람 인식의 성능은 분할 정확도와 자세 추정 정밀도 측면에서 어떻게 평가되는가?
  • RQ32D 이미지 레이블로 훈련된 딥러닝 모델이 1D WiFi CSI 신호로 일반화되는 정도는 어느 정도이며, 주요 실패 원인은 무엇인가?
  • RQ4적대적 훈련 및 데이터 증강 기법을 통해, 다른 레이아웃과 재질을 가진 훈련되지 않은 실내 환경에서도 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ5특히 작은 사지, 드문 자세, 가림 현상에 대해 WiFi 기반 인식의 주요 한계는 무엇이며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • Person-in-WiFi는 신체 분할에 대해 평균 교차율(mIoU) 0.66과 자세 추정에 대해 평균 PCK@0.20 78.75%의 성능을 기록하여 카메라 기반 방법과 비교할 만한 성능을 입증하였다.
  • 160개의 균일하게 샘플링된 프레임으로 구성된 테스트 세트에서 mIoU 0.66과 mPCK@0.20 78.75%를 기록하여 다양한 실내 장면으로의 강력한 일반화 능력을 보였다.
  • 환경에 강인한 표현을 얻기 위한 적대적 훈련 덕분에, 훈련되지 않은 환경에서 mIoU는 0.12에서 0.24로, mPCK@0.20는 19.34%에서 31.06%로 향상되어 실생활 적용 가능성에 대한 희망을 보였다.
  • 실패 케이스의 주요 원인은 낮은 공간 해상도(12.5cm 파장에서 회절으로 인한 작은 사지 누락), 드문 자세, 단일 카메라 시야 한계로 인한 완전하지 않은 레이블이었다.
  • 모델은 머리와 발과 같은 작은 또는 가려진 부위보다 더 큰 신체 부위(예: 흉부와 팔)에서 더 잘 작동했으며, 머리 및 발 그룹의 관절에 대해 낮은 PCK 점수를 기록했다.
  • 더 고품질의 데이터와 향상된 데이터 증강 기법을 통해 WiFi 기반 인식과 카메라 기반 인식 간의 성능 격차를 추가로 줄일 수 있을 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.