arrow
返回

Visual pattern-based watermarking for large language model generated text

delete2026-03-23
delete0
PRE
AI
S
Shariq Bashir *
DOI:10.1016/j.neucom.2026.133429delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大语言模型(LLM)水印通过在生成文本中嵌入隐藏信号,以实现对LLM生成内容的可靠识别。传统概率水印在词元级别引入统计偏差,并使用基于阈值的假设检验进行检测。尽管在自动化场景中有效且可解释,但这类方法对人类用户提供的关于水印在文本中存在程度及LLM生成部分的可解释性证据有限。此类视觉和可解释性证据在法证和司法案件中尤为重要,因为简单的“是/否”答案(水印存在或不存在)往往不足。本文提出了一种基于概率模式的可解释水印方法,通过基于密钥的词元采样偏差,将结构化二进制图像模式嵌入LLM生成的文本中。在检测阶段,水印可作为二维视觉模式恢复。这使得除了标准的基于阈值的决策标准外,还能进行水印存在的视觉检查,且不损害自动化检测。在OPT-1.3B、OPT-2.7B和LLaMA-7B上的实验表明,所提出的方法在干净和对抗场景下均实现了与基线概率水印相当的检测性能,同时保持了文本的流畅性和语义保真度。人类评估研究进一步显示,在不同对抗场景下恢复的模式仍具有视觉可识别性,表明了补充性人工可验证证据的潜力。
Keyword:
watermarking
large language models
visual pattern
text generation
forensic analysis

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

暂无机构信息
引用论文

引用论文

Testing of detection tools for AI-generated text测试AI生成文本的检测工具
err2023-12-25
err70
errOAAI
errWeber-Wulff, Debora; Anohina-Naumeca, Alla; Bjelobaba, Sonja; Foltynek, Tomas; Guerrero-Dib, Jean; Popoola, Olumide; Sigut, Petr; Waddington, Lorna
err分享
err收藏
Natural language watermarking via morphosyntactic alterations通过形态句法改变的自然语言水印
err2009-01-01
err68
PREAI
errMeral, Hasan Mesut; Sankur, Bulent; Ozsoy, A. Sumru; Gungor, Tunga; Sevinc, Emre
err分享
err收藏
Publicly-Detectable Watermarking for Language Models
err2025-01-13
err0
errOAAI
errJaiden Fairoze; Sanjam Garg; Somesh Jha; Saeed Mahloujifar; Mohammad Mahmoody; Mingyuan Wang
err分享
err收藏
学者 查看更多内容