返回
Visual pattern-based watermarking for large language model generated text
DOI:10.1016/j.neucom.2026.133429.png)
摘要
En 中文
大语言模型(LLM)水印通过在生成文本中嵌入隐藏信号,以实现对LLM生成内容的可靠识别。传统概率水印在词元级别引入统计偏差,并使用基于阈值的假设检验进行检测。尽管在自动化场景中有效且可解释,但这类方法对人类用户提供的关于水印在文本中存在程度及LLM生成部分的可解释性证据有限。此类视觉和可解释性证据在法证和司法案件中尤为重要,因为简单的“是/否”答案(水印存在或不存在)往往不足。本文提出了一种基于概率模式的可解释水印方法,通过基于密钥的词元采样偏差,将结构化二进制图像模式嵌入LLM生成的文本中。在检测阶段,水印可作为二维视觉模式恢复。这使得除了标准的基于阈值的决策标准外,还能进行水印存在的视觉检查,且不损害自动化检测。在OPT-1.3B、OPT-2.7B和LLaMA-7B上的实验表明,所提出的方法在干净和对抗场景下均实现了与基线概率水印相当的检测性能,同时保持了文本的流畅性和语义保真度。人类评估研究进一步显示,在不同对抗场景下恢复的模式仍具有视觉可识别性,表明了补充性人工可验证证据的潜力。
Keyword:
watermarking
large language models
visual pattern
text generation
forensic analysis
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
暂无机构信息
引用论文
Artificial intelligence (AI), conversational agents, and generative AI: implications for adult education practice and research人工智能(AI)、对话代理和生成式人工智能:对成人教育实践与研究的影响
Asymmetric Watermarking for Large Language Models With Public and Private Verification具有公开和私有验证的大型语言模型的不对称水印技术
IEEE Access
IF3.6
Human vs. Machine: A Comparative Study on the Detection of AI-Generated Content人类与机器:一项关于AI生成内容检测的比较研究。ACM Trans. Asian Low-Resour. Lang. Inf. Process. 24, 1–26

