Skip to main content
QUICK REVIEW

[논문 리뷰] A Hybrid Approach to Video Source Identification

Massimo Iuliani, Marco Fontani|arXiv (Cornell University)|2017. 05. 04.
Digital Media Forensic Detection참고 문헌 9인용 수 8
한 줄 요약

이 논문은 스마트폰 내장 디지털 안정화 기능이 있는 비디오를 포함해 다양한 비디오 소스를 식별하기 위해 정적 이미지에서 유도된 센서 패턴 노이즈(SPN)를 활용하는 하이브리드 비디오 소스 식별 방법을 제안한다. 이 방법은 비안정화된 비디오에서는 최신 기술 수준의 성능을 달성하며, 기존에는 해결하기 어려웠던 안정화된 비디오에 대해서도 18대의 현대적 기기들 간의 이미지 및 비디오 SPN 간 기하학적 관계를 모델링하여 신뢰할 수 있는 소스 식별을 가능하게 한다.

ABSTRACT

Multimedia Forensics allows to determine whether videos or images have been captured with the same device, and thus, eventually, by the same person. Currently, the most promising technology to achieve this task, exploits the unique traces left by the camera sensor into the visual content. Anyway, image and video source identification are still treated separately from one another. This approach is limited and anachronistic if we consider that most of the visual media are today acquired using smartphones, that capture both images and videos. In this paper we overcome this limitation by exploring a new approach that allows to synergistically exploit images and videos to study the device from which they both come. Indeed, we prove it is possible to identify the source of a digital video by exploiting a reference sensor pattern noise generated from still images taken by the same device of the query video. The proposed method provides comparable or even better performance, when compared to the current video identification strategies, where a reference pattern is estimated from video frames. We also show how this strategy can be effective even in case of in-camera digitally stabilized videos, where a non-stabilized reference is not available, by solving some state-of-the-art limitations. We explore a possible direct application of this result, that is social media profile linking, i.e. discovering relationships between two or more social media profiles by comparing the visual contents - images or videos - shared therein.

연구 동기 및 목표

  • 비디오에서 직접 SPN 추출이 어려운, 특히 내장 디지털 안정화 기능이 있는 스마트폰의 비디오 소스 식별 문제를 해결한다.
  • 기기별 비디오 학습 데이터가 필요로 하는 제약을 극복하기 위해 정적 이미지를 비디오 지문화의 대체 수 Mittel로 사용한다.
  • 안정화 및 비안정화 기기 모두를 포함한 다양한 스마트폰 간 이미지 및 비디오 SPN 간 기하학적 모델을 수립한다.
  • 동일한 지문화 기반 접근 방식을 사용해 소셜 미디어 플랫폼 간(예: 페이스북 이미지와 유튜브 비디오)의 크로스 플랫폼 소스 식별을 가능하게 한다.
  • 339개의 비디오와 5,289장의 이미지를 포함한 대규모 데이터셋을 개발 및 공개하여 향후 다중미디어 포렌식 연구를 지원한다.

제안 방법

  • 동일 기기에서 촬영한 고품질 정적 이미지에서 센서 패턴 노이즈(SPN) 지문을 추정하여, 이를 비디오 소스 지문의 대체 수 Mittel로 간주한다.
  • 정규화된 상관관계를 사용해 이미지 및 비디오 SPN 간 기하학적 변환(스케일링, 자르기, 회전)을 모델링하여 다중 모odal 간 지문을 정렬한다.
  • 스케일링 및 회전 파라미터에 대한 브루트 포스 검색을 수행하여 이미지 기반 SPN과 비디오 SPN 간 매칭을 수행하며, 피크 정규화된 상관관계를 매칭 지표로 사용한다.
  • 다중 비디오 프레임에 걸쳐 일치 점수를 임계값 기반 융합 전략(융합 임계값 τ)을 통해 집계하여 정확도를 향상시키고 오류 경고를 감소시킨다.
  • SPN 패치 간 유사도를 계산하기 위해 0 패딩 정규화된 상관관계를 사용하며, 주요 매칭 점수로 ρpeak(𝐗, 𝐘)를 사용한다.
  • 스마트폰 카메라는 이미지와 비디오 모두 동일한 센서를 사용하므로, 안정화 조건에서도 SPN이 다중 모달 간 이동 가능하다는 점을 활용한다.

실험 결과

연구 질문

  • RQ1비디오 자체에서 사용 가능한 비안정화된 SPN를 제공하지 못하는 경우에도 정적 이미지에서 유도된 SPN를 신뢰성 있게 비디오 소스 식별에 활용할 수 있는가?
  • RQ2최근 스마트폰, 특히 내장 디지털 안정화 기능이 있는 기기들 간의 이미지 및 비디오 SPN 간 기하학적 관계는 어떠한가?
  • RQ3하이브리드 접근 방식은 품질 수준이 다른 플랫폼 간(예: 페이스북과 유튜브) 비디오 및 이미지 콘텐츠를 얼마나 효과적으로 연결할 수 있는가?
  • RQ4저품질 이미지 기반 참조를 사용할 경우, 신뢰할 수 있는 소스 식별을 위해 최소 몇 프레임의 비디오가 필요한가?
  • RQ5기존 SPN 추출 기법이 실패하는 내장 디지털 안정화 비디오의 소스 식별에서 제안된 방법이 높은 정확도를 달성할 수 있는가?

주요 결과

  • 유튜브 비디오에서 500프레임을 사용해 비디오 지문을 추정할 경우 하이브리드 접근 방식은 AUC 0.88을 달성하며, 기존 비디오 기반 SPN 방법과 동등하거나 이를 초월한다.
  • 참조로 저품질 페이스북 이미지를 사용할 경우 1,000개의 비디오 프레임을 사용하면 AUC 0.86를 기록하여, 더 높은 프레임 수가 열악한 참조 품질을 상쇄할 수 있음을 보여준다.
  • 최적의 융합 임계값 τ = 38을 사용할 경우, 내장 디지털 안정화 유튜브 비디오의 소스 식별에 대해 전체 정확도 87.3%를 달성한다.
  • 직접 비디오에서 SPN 추출이 불가능한 최근 애플 기기의 안정화 비디오 소스도 성공적으로 식별할 수 있었다.
  • 300프레임 미만일 경우 성능이 크게 저하되어, 신뢰할 수 있는 지문 추정을 위해 최소 프레임 수가 필수적임을 시사한다.
  • 18대의 현대 스마트폰에서 일관된 이미지 및 비디오 SPN 간 기하학적 관계를 규명하여, 신뢰할 수 있는 정렬 및 매칭을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.