[논문 리뷰] Data Poisoning Attack against Knowledge Graph Embedding
이 논문은 지식 그래프 임bedding(KGE) 모델을 대상으로 하는 최초의 데이터 풀링 공격 전략을 제안하며, 훈련 사실을 직접적·간접적으로 조작하여 타겟 사실의 타당성을 떨어뜨리는 방식을 사용한다. 이 공격들은 최소한의 변형으로도 효과적으로 링크 예측 성능을 저하시키며(FB15K에서 직접 추가 공격 시 MRR이 0.04 감소), 실제 KGE 응용에서 높은 효율성과 정교함을 입증한다.
Knowledge graph embedding (KGE) is a technique for learning continuous embeddings for entities and relations in the knowledge graph.Due to its benefit to a variety of downstream tasks such as knowledge graph completion, question answering and recommendation, KGE has gained significant attention recently. Despite its effectiveness in a benign environment, KGE' robustness to adversarial attacks is not well-studied. Existing attack methods on graph data cannot be directly applied to attack the embeddings of knowledge graph due to its heterogeneity. To fill this gap, we propose a collection of data poisoning attack strategies, which can effectively manipulate the plausibility of arbitrary targeted facts in a knowledge graph by adding or deleting facts on the graph. The effectiveness and efficiency of the proposed attack strategies are verified by extensive evaluations on two widely-used benchmarks.
연구 동기 및 목표
- 지식 그래프 임베딩(KGE) 모델이 데이터 풀링 공격에 얼마나 취약한지 조사하는 것.
- 기존의 적대적 공격 방법은 동종 그래프 가정에 의존하기 때문에 이질적인 지식 그래프에는 적용 불가하므로, 이러한 격차를 보완하는 것.
- 특정 사실을 추가하거나 삭제하여 KGE의 타당성을 조작하는 효과적이고 효율적이며 정교한 공격 전략을 설계하는 것.
- 실제 벤치마크(FB15K 및 WN18)에서 KGE 모델의 적대적 데이터 풀링에 대한 내성 강도를 평가하는 것.
제안 방법
- 특정 사실을 추가하거나 삭제하여 타겟 사실에 포함된 엔티티의 임베딩을 조작하는 직접적 공격 전략을 제안한다.
- 프록시 엔티티를 사용하여 타겟 사실의 타당성에 영향을 주는 간접적 공격 전략을 도입하여 정교함을 향상시킨다.
- 고성능 영향을 미치는 변형을 최대한으로 타겟 사실의 타당성 저하를 극대화하기 위해 기울기 기반 최적화 프레임워크를 활용한다.
- 변형 선택 과정에서 계산 효율성을 향상시키기 위해 후보 샘플링을 적용한다.
- 링크 예측 메트릭(MRR, H@10)을 사용하여 KGE 모델에 대한 공격 효과를 평가한다.
- 포prehensive 평가를 위해 세 가지 대표적인 KGE 모델(TransE, TransR, RESCAL)을 사용한다.
실험 결과
연구 질문
- RQ1모델 특화 가정 없이도 특정 타겟 사실의 타당성을 효과적으로 떨어뜨릴 수 있는 데이터 풀링 공격이 가능한가?
- RQ2직접적 공격과 간접적 공격 전략은 KGE 모델 출력 조작에서 효과성과 정교함 측면에서 어떻게 비교되는가?
- RQ3공격 예산 크기가 KGE 모델에서 타겟 사실의 성능 저하에 어떤 영향을 미치는가?
- RQ4지식 그래프의 구조적 희소성(FB15K와 WN18의 예시)은 KGE 모델의 데이터 풀링 공격에 대한 내성 강도에 어떤 영향을 미치는가?
- RQ5변형 생성에 있어 제안된 공격 전략의 계산 비용 측면에서의 효율성은 어떠한가?
주요 결과
- 직접 추가 공격은 FB15K 데이터셋에서 MRR을 0.04 감소시키고 H@10을 0.05 감소시켜 링크 예측 성능 저하가 뚜렷하게 나타났다.
- 간접 삭제 공격은 FB15K에서 MRR을 약 0.03 감소시키고 H@10을 0.04 감소시켜, 정교한 공격이 여전히 매우 효과적일 수 있음을 보여주었다.
- 변형 예산이 증가함에 따라 공격 성능이 포화 상태에 도달함을 확인하여, 고성능 사실이 타겟으로 지정된 후에는 수익 감소 현상이 나타남을 시사한다.
- 직접 삭제 공격가 가장 효율적이었으며, 평균적으로 타겟 사실당 0.13초가 소요되었고, 간접 공격은 최대 14.04초가 걸렸다.
- 제안된 공격 전략은 여러 KGE 모델(TransE, TransR, RESCAL)과 여러 데이터셋(FB15K, WN18)에서 효과적이었으며, 광범위한 적용 가능성을 확인하였다.
- WN18 데이터셋은 FB15K보다 더 취약했으며, 그 이유는 희소한 구조로 인해 변형의 영향이 링크 예측 메트릭에 더 크게 확산되기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.