Skip to main content
QUICK REVIEW

[논문 리뷰] Protect, Show, Attend and Tell: Empowering Image Captioning Models with Ownership Protection

Jian Han Lim, Chee Seng Chan|arXiv (Cornell University)|2020. 08. 25.
Multimodal Machine Learning Applications참고 문헌 29인용 수 4
한 줄 요약

이 논문은 순환 신경망(RNN)의 은닉 메모리 상태에 기밀 키를 임bedding하여 이미지 캡션 모델에 대한 저작권 보호 메커니즘을 제안한다. 이 방법은 유일한 키를 가진 모델만 고성능 캡션을 생성하도록 보장하며, 원본 모델의 성능을 유지하면서 위조 키의 효과를 차단함으로써 MS-COCO 및 Flickr30k 데이터셋에서 제거 및 모호성 공격에 대해 강력한 보호 기능을 제공한다.

ABSTRACT

By and large, existing Intellectual Property (IP) protection on deep neural networks typically i) focus on image classification task only, and ii) follow a standard digital watermarking framework that was conventionally used to protect the ownership of multimedia and video content. This paper demonstrates that the current digital watermarking framework is insufficient to protect image captioning tasks that are often regarded as one of the frontiers AI problems. As a remedy, this paper studies and proposes two different embedding schemes in the hidden memory state of a recurrent neural network to protect the image captioning model. From empirical points, we prove that a forged key will yield an unusable image captioning model, defeating the purpose of infringement. To the best of our knowledge, this work is the first to propose ownership protection on image captioning task. Also, extensive experiments show that the proposed method does not compromise the original image captioning performance on all common captioning metrics on Flickr30k and MS-COCO datasets, and at the same time it is able to withstand both removal and ambiguity attacks. Code is available at https://github.com/jianhanlim/ipr-imagecaptioning

연구 동기 및 목표

  • 기존 워터마킹 프레임워크에서 간과되는 이미지 캡션 모델에 대한 지적재산권(IP) 보호의 부재를 해결하기 위해.
  • 무단 사용을 방지할 수 있는 사전적이고 비용 효율적이며 시기적절한 IP 보호 메커니즘을 개발하기 위해.
  • 정확한 기밀 키를 가진 모델만 고품질의 의미적으로 정확한 캡션을 생성하도록 보장하여 침해 행위를 억제하기 위해.
  • 유효한 키를 사용할 경우 원본 모델과 거의 동일한 성능을 유지하는 반면, 위조 키를 사용할 경우 성능이 크게 떨어짐을 입증하기 위해.
  • 기존의 이미지 분류를 위한 워터마킹 방법에 한계가 있는 바, 이미지 캡션 분야에서 지적재산권 보호를 위한 첫 번째 알려진 솔루션을 제공하기 위해.

제안 방법

  • 훈련 중에 RNN 기반 이미지 캡션 모델의 은닉 메모리 상태에 고유한 기밀 키를 두 가지 다른 임베딩 방식을 사용해 삽입하기.
  • 기밀 키를 학습 가능한 변환을 통해 RNN 셀의 은닉 상태 계산에 통합함으로써 키가 모델의 내부 표현에 깊이 통합되도록 수정하기.
  • 추론 중에 서명 검증 메커니즘을 사용하여 정확한 키의 존재를 검증함으로써, 정당한 키 없이 모델 사용을 차단하기.
  • 모든 위조 키가 은닉 상태의 동역학을 교란시켜 의미적으로 타당하지 않거나 저품질의 캡션을 생성하도록 임베딩 설계하기.
  • 기밀 키를 은닉 상태에 통합하여 엔드 투 엔드로 모델을 훈련함으로써 원본 모델의 표준 캡션 메트릭에서 성능을 유지하기.
  • 다양한 벤치마크에서 유효 키와 위조 키를 사용하여 성능을 테스트함으로써 제거 및 모호성 공격에 대한 강건성 평가하기.

실험 결과

연구 질문

  • RQ1RNN 기반 이미지 캡션 모델의 은닉 메모리 상태에 임베딩된 기밀 키가 무단 사용을 효과적으로 방지할 수 있는가?
  • RQ2제안된 기반 키 보호 메커니즘이 표준 이미지 캡션 메트릭에서 원본 모델의 성능을 유지하는가?
  • RQ3기밀 키를 추출하거나 위조하려는 공격자가 시도하는 제거 및 모호성 공격에 대해 이 방법의 효과는 어떠한가?
  • RQ4이 방법은 Up-Down 및 SCST와 같은 다양한 이미지 캡션 아키텍처로 일반화될 수 있는가?
  • RQ5위조 키를 사용할 경우의 성능 저하가 원본 모델 및 워터마킹 기반 접근 방식과 비교해 어떻게 되는가?

주요 결과

  • 유효한 키를 사용할 경우 원본 모델과 거의 동일한 성능을 유지하며, MS-COCO에서 Up-Down 모델의 CIDEr-D 점수는 101.93, SCST 모델은 101.87을 기록한다.
  • 위조 키를 사용할 경우 Up-Down 모델의 CIDEr-D 점수는 17.27% 감소(84.33로 하락)하고, SCST 모델은 11.14% 감소(90.53으로 하락)하여 강력한 성능 저하를 보인다.
  • Up-Down 모델에서 위조 키 사용 시 SPICE 점수는 19.90에서 16.53으로 하락하여 참조 표현 정확도에 심각한 손실이 있음을 나타낸다.
  • 패스포트 기반 워터마킹과 같은 기존 워터마킹 프레임워크보다 더 정확하고 완전한 캡션을 생성함으로써 공격 조건에서도 우수한 성능을 보인다.
  • 위조 키를 사용한 모델은 의미적으로 타당하지 않거나 잘못된 캡션을 생성하여 실질적인 응용에서 사용 불가능하게 된다.
  • 이 방법은 MS-COCO 및 Flickr30k 데이터셋 모두에서 강건성을 입증하여 다양한 이미지 캡션 벤치마크에 일반화됨을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.