[논문 리뷰] Lightweight Efficient Multi-keyword Ranked Search over Encrypted Cloud Data using Dual Word Embeddings
이 논문은 사전 훈련된 word2vec 임베딩 기반의 이중 임베딩 공간 모델(DESM)을 사용하여 암호화된 클라우드 데이터를 위한 경량이며 효율적인 다중 키워드 순위 기반 검색 기법인 LRSE를 제안한다. 기존의 벡터 공간 모델(VSM) 대신 DESM를 도입함으로써, 사전 업데이트 없이도 고정밀도, 개인정보 보호 기능을 갖춘 상위-k 순위 검색을 가능하게 하여 실제 데이터셋에서 기존 기법들보다 효율성과 정확도 면에서 뛰어난 성능을 발휘한다.
Cloud computing is emerging as a revolutionary computing paradigm which pro-vides a flexible and economic strategy for data management and resource sharing. Security and privacy become major concerns in the cloud scenario, for which Searchable Encryption (SE) technology is proposed to support efficient retrieval of encrypted data. However, the absence of lightweight ranked search is still a typical shortage in existing SE schemes. In this paper, we propose a Lightweight Efficient Multi-keyword Ranked Search over Encrypted Cloud Data using Dual Word Embeddings (LRSE) scheme that supports top-k retrieval in the known background model. For the first time, we formulate the privacy issue and design goals for lightweight ranked search in SE. We employ word embedding trained on the whole English Wikipedia using word2vec to replace the general dictionary, afterwards we make use of Dual Embedding Space Model (DESM) to substitute traditional Vector Space Model (VSM), based on which we achieve the goal of lightweight ranked search with higher precision and solve the challenging prob-lems caused by updating the traditional dictionary in existing SE schemes. In LRSE, we employ an improved secure kNN scheme to guarantee sufficient pri-vacy protection. Our security analysis shows that LRSE satisfies our formulated privacy requirements and extensive experiments performed on real-world datasets demonstrate that LRSE indeed accords with our proposed design goals.
연구 동기 및 목표
- 기존의 암호화된 클라우드 데이터를 위한 검색 암호화(SE) 기법에서 경량이며 순위 기반 검색 기능의 부족을 해결하기 위해.
- 경량 순위 기반 검색을 위한 SE에 특화된 개인정보 보호 요구사항과 설계 목표를 수립하기 위해.
- 기존의 사전 기반 벡터 공간 모델(VSM)을 사전 훈련된 word2vec 임베딩을 활용한 이중 임베딩 공간 모델(DESM)로 대체하여 의미적 표현을 향상시키기 위해.
- 빈번한 사전 업데이트가 필요 없이 효율적이고 안전한 상위-k 검색을 가능하게 하여 확장성과 성능을 향상시키기 위해.
- 검색 과정에서의 개인정보 보호를 강화하기 위해 개선된 안전한 kNN 기법을 통합하기 위해.
제안 방법
- 전체 영문 위키백과에서 사전 훈련된 word2vec 임베딩을 활용하여 키워드와 문서를 조밀한 벡터 공간에 표현함으로써 의미적 이해를 향상시키기 위해.
- 질의와 문서를 별도이지만 정렬된 임베딩 공간에 매핑하는 이중 임베딩 공간 모델(DESM)을 설계하여 유사도 점수를 계산하기 위해.
- 기존의 벡터 공간 모델(VSM)을 DESM로 대체하여 암호화된 데이터에 대한 의미 인식 기반의 순위 기반 검색을 지원하기 위해.
- 사용자 질의와 데이터 기밀성을 유지하면서도 비밀성 보장된 효율적인 상위-k 검색을 가능하게 하기 위해 개선된 안전한 kNN 프로토콜을 통합하기 위해.
- 동적 사전 업데이트를 피하기 위해 정적 사전 훈련 임베딩을 활용하는 하이브리드 인덱싱 메커니즘을 사용하기 위해.
- 이중 임베딩 공간에서 질의와 문서 임베딩 간의 코사인 유사도를 적용하여 결과를 순위 매기기 위해.
실험 결과
연구 질문
- RQ1비용이 많이 드는 사전 업데이트 없이도 암호화된 클라우드 데이터에 대해 경량이며 순위 기반 검색 기능을 갖춘 기법을 설계할 수 있는가?
- RQ2사전 훈련된 임베딩을 사용하면 개인정보 보호를 해치지 않으면서도 암호화된 검색에서 검색 정밀도를 어떻게 향상시킬 수 있는가?
- RQ3다중 키워드 질의에 대해 DESM이 기존의 VSM에 비해 검색 정확도와 효율성 면에서 어느 정도 뛰어나게 되는가?
- RQ4안전한 kNN 프로토콜을 어떻게 변형하여 암호화된 환경에서 비밀성 보장된 상위-k 순위 기반 검색을 지원할 수 있는가?
- RQ5제안된 LRSE 기법이 클라우드 환경에서의 검색 암호화를 위한 공식적인 개인정보 보호 요구사항을 충족하는가?
주요 결과
- LRSE는 단어 임베딩을 통한 의미적 유사도를 활용함으로써 기존의 VSM 기반 기법에 비해 훨씬 높은 검색 정밀도를 달성한다.
- 사전 훈련된 word2vec 임베딩의 사용으로 동적 사전 업데이트가 필요 없어져 계산 오버헤드가 감소하고 확장성이 향상된다.
- 제안된 DESM 모델은 키워드 간의 의미적 관계를 포착함으로써 복잡한 다중 키워드 질의에 대해서도 정확한 순위 기반 결과를 제공한다.
- 실제 데이터셋을 대상으로 한 광범위한 실험을 통해 LRSE가 효율성, 개인정보 보호, 높은 정밀도라는 설계 목표를 충족함을 확인했다.
- 개선된 안전한 kNN 프로토콜은 사용자 질의와 데이터 내용의 泄露를 방지하는 강력한 개인정보 보호 보장을 제공한다.
- 기존의 유사한 功能을 갖춘 SE 기법들에 비해 응답 시간과 자원 사용량 면에서 뚜렷한 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.