大模型◆ AI 生成 · 已溯源

生成模型水印取证的信息论视角

生成模型水印取证的信息论视角
结论前置 / TL;DR

arXiv:2607.13003v1 提出统一信息论框架,量化生成文本水印在检测、归属、载荷提取与局部定位四层取证任务中的样本复杂度代价:归属需 Θ(log N/h) 个 token(N 用户数,h 为每 token 平均互信息下界),而检测仅依赖分布距离而非信息量。

核心结论:水印取证的“法证阶梯”及其信息论代价

该论文建立了一个基于互信息的信息理论模型,将生成模型水印的四种典型取证能力——检测(detection)、归属(attribution)、载荷提取(payload extraction)和局部定位(localization)——组织为一个递进的“法证阶梯”(forensic ladder),并严格刻画每一层级所需的最小输出长度 $n$(即 token 数量)。

  • 检测仅要求水印存在性,其代价由标记分布与未标记分布之间的统计距离(如 KL 散度或 TV 距离)决定,不依赖信息量
  • 归属与载荷提取依赖水印携带的总信息量,即秘密 $S$(用户 ID 或嵌入载荷)与整个序列 $X_{1:n}$ 的互信息 $I(S; X_{1:n})$;
  • 局部定位则进一步依赖信息在序列中的时序分布结构,由信息剖面(information profile)$\nu(t) = I(S; X_t \mid X_{<t})$ 的分散程度决定。

关键建模:信息剖面 $\nu(t)$ 统一解释三类水印范式

论文定义 $\nu(t)$ 为第 $t$ 个 token 在给定前序 token 条件下对秘密 $S$ 的增量信息贡献。该函数的:

  • 总质量 $\sum_t \nu(t) = I(S; X_{1:n})$ 决定归属与提取的可行性;
  • 时间分布形态(如集中于少数位置 vs 均匀散布)决定局部定位鲁棒性;
  • 检测能力则完全脱离 $\nu(t)$,仅取决于标记/未标记分布对的 $f$-散度(如 $\chi^2$ 或 KL)。

由此,文献中两类主流水印设计——‘细粒度隐性水印’(每 token 贡献微量 $\nu(t)$)与‘粗粒度显性水印’(少数 token 承载高 $\nu(t)$)——被证明是 $\nu(t)$ 上界约束的两种不可比(incomparable)实现路径,无绝对优劣。

主要定理:归属任务的熵率标度律

在统计无失真(statistically distortion-free)水印方案下,论文主定理给出:将一段文本归因至 $N$ 个潜在用户之一所需最小 token 长度为 $\Theta(\log N / h)$,其中 $h$ 是每个 token 对秘密 $S$ 的平均条件互信息下界(即 $\mathbb{E}[\nu(t)] \geq h$)。该结果首次在信息论层面确立归属任务的样本复杂度紧界,并揭示其本质是香农熵率与信道容量的联合约束。

来源溯源(合规留痕)
https://arxiv.org/abs/2607.13003
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。