Skip to main content
QUICK REVIEW

[论文解读] Addressing Segmentation Ambiguity in Neural Linguistic Steganography

Jumon Nozaki, Yugo Murawaki|arXiv (Cornell University)|Nov 12, 2022
Handwritten Text Recognition Techniques被引用 6
一句话总结

本文解決了神經語言隱寫術中的分詞歧義問題,該問題因子詞分詞不一致導致解碼失敗。作者提出一種語言無關的方法,透過逐步分詞與基於機率的消歧技巧,確保在包括日語(無詞界)與語 morphologically 豐富的俄語等語言中,解碼準確率達 100%。

ABSTRACT

Previous studies on neural linguistic steganography, except Ueoka et al. (2021), overlook the fact that the sender must detokenize cover texts to avoid arousing the eavesdropper's suspicion. In this paper, we demonstrate that segmentation ambiguity indeed causes occasional decoding failures at the receiver's side. With the near-ubiquity of subwords, this problem now affects any language. We propose simple tricks to overcome this problem, which are even applicable to languages without explicit word boundaries.

研究动机与目标

  • 識別並解決生成式神經語言隱寫術中關鍵的分詞歧義問題,該問題在覆蓋文本被去分詞時會導致解碼失敗。
  • 證明分詞歧義不僅影響無詞界符號連續文本(如日語、中文),也影響如英語等子詞分詞語言,以及如俄語等語 morphologically 豐富的語言。
  • 開發一種實用的、語言無關的解決方案,確保接收端即使在去分詞後仍能正確恢復原始分詞,從而實現可靠的秘密訊息解碼。
  • 評估引入消歧機制後,解碼可靠性與載荷容量之間的權衡,顯示所提方法即使增加魯棒性,仍能維持高載荷效率。
  • 透過強調隱寫系統中被忽視的去分詞問題,並提出一種最小但有效的修復方案,為未來研究奠定基礎。

提出的方法

  • 所提方法在接收端執行逐步分詞,利用上下文感知的重分詞技術,從去分詞文本中重構原始子詞分詞。
  • 應用基於機率的消歧技巧:僅考慮機率超過閾值(p = 0.01)的子詞作為有效候選,以減少分詞恢復中的歧義。
  • 針對日語等語言,於位元層級運作,使用位元級 BPE 以確保與子詞分詞方案的相容性。
  • 發送端僅使用最可能的 $2^n$ 個分詞進行編碼,與 naïve block 編碼對齊,以維持與消歧過程的相容性。
  • 接收端透過迭代選擇與去分詞字串匹配的最可能子詞,重建原始分詞序列,確保與發送端原始分詞一致。
  • 該方法設計為與任何使用子詞分詞的語言模型相容,包括無明確詞界符號的語言。

实验结果

研究问题

  • RQ1在不同語言中,由於分詞歧義導致的解碼失敗頻率如何?
  • RQ2分詞歧義對具有與不具有明確詞界符號的語言(如日語、俄語、英語)的影響程度為何?
  • RQ3能否設計一種簡單且語言無關的方法,以確保即使在去分詞後仍能正確恢復分詞,從而實現 100% 解碼準確率?
  • RQ4引入消歧機制後,解碼可靠性與載荷容量之間的權衡為何?
  • RQ5為何先前的研究忽略了此問題?其對神經語言隱寫術的安全性與實用性有何影響?

主要发现

  • 未考慮歧義的方案在日語中出現 86.6% 的解碼錯誤率,俄語為 85.4%,英語為 88.2%,顯示即使在英語中也存在顯著的失敗率。
  • 所提方法在所有測試語言(包括日語、俄語與英語)中均實現 100% 解碼準確率,證明可完全恢復原始分詞。
  • 任何語言的載荷容量下降不超過 10%,顯示可靠性與效率之間的權衡極小。
  • 所提方法在隱寫分析中顯示出略高的檢測準確率(91.5%),較未考慮歧義的方案(88.2%)為高,顯示其與人類書寫文本存在微小統計差異。
  • GPT-2 隨機基線的檢測準確率為 79.0%,顯示即使隨機生成亦可被檢測,因此所提方法檢測率的微小增加並非重大問題。
  • 本研究確認分詞歧義是神經語言隱寫術中關鍵且長期被忽視的弱點,特別是在基於子詞的模型中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。