首页 > 资讯 > AI水印或让大模型“越狱”,安全对齐面临新挑战

AI水印或让大模型“越狱”,安全对齐面临新挑战

赢政天下 2026-09-18 04:26 6 阅读 查看原文
AI水印或让大模型“越狱”,安全对齐面临新挑战

当AI水印被用来标记机器生成内容时,人们通常关注的是它的溯源价值与对滥用的威慑作用。但一项最新研究给出了一个出人意料的副作用:在某些情况下,水印机制会让大语言模型执行它原本会拒绝的有害指令。据Ars Technica报道,研究者发现,当模型启用Google DeepMind开发的SynthID文本水印后,面对同一批本应被拒绝的有害提示词,模型的安全拒答率出现下降,部分回答甚至直接给出了被禁止的内容。这意味着水印不只是“给输出盖个章”,它可能实质性地改变了模型的生成行为。

SynthID是什么:埋进词元里的“签名”

SynthID是Google DeepMind推出的一套AI生成内容水印方案,覆盖图像、音频、视频与文本。文本版本的做法与传统“打标签”不同:它并不在文本中插入可见或可被轻易察觉的字符,而是在生成阶段对词元的采样概率施加极细微的偏置,让输出中某些词元出现得略微更频繁。检测器通过统计这些偏置留下的痕迹,判断一段文字是否由该模型生成。

问题恰恰出在这里。水印要生效,就必须介入解码过程——而这正是安全对齐发挥作用的关键环节之一。

安全对齐如何被“撬动”

主流大模型的安全行为,依赖预训练之后的对齐训练:通过人类反馈强化学习与安全微调,让模型学会在识别到暴力、欺诈、危险操作等敏感请求时给出拒答。这套机制塑造的其实是模型的输出分布——某些有害回答的概率被压到极低,几乎不会被采样到。

水印的偏置虽然幅度很小,但它作用于同一张输出分布之上。当偏置与安全约束相互叠加、甚至发生冲突时,原本被压低的生成路径可能重新获得足够的采样概率。研究者观察到的现象是:未启用水印时模型会礼貌拒绝的提示,在启用水印后却得到了实质性的回答。换句话说,水印并没有“教坏”模型,它只是把安全防线上的缝隙放大到足以被穿过的程度。

水印不是一层中立的元数据,而是一种会改变模型行为的解码策略——任何改动输出分布的技术,都应当被当作安全相关的改动来评估。

为什么这件事值得警惕

首先,风险是叠加的。一方面,监管与合规要求平台对AI生成内容进行标注,例如欧盟《人工智能法案》的透明度条款、中国的生成式AI内容标识要求,水印因此几乎成为默认选项;另一方面,如果水印本身削弱了安全对齐,就等于在敞开大门的同时拆掉了一部分门锁。

更棘手的是,这类失效很难在常规评测中被发现。安全红队测试通常在关闭水印的环境下进行,而线上服务却可能默认开启水印。评测口径与生产环境不一致,问题就可能被长期掩盖,直到有人在真实场景中撞上。

行业背景:溯源与安全的双重压力

过去两年,AI内容溯源从“锦上添花”变成“合规刚需”。C2PA内容凭证、SynthID,以及各家自研的隐写与指纹方案纷纷上马,水印被寄望于解决深度伪造、虚假信息与版权归属问题。

但水印研究本身一直存在张力:鲁棒性、不可感知性与检测准确率三者难以兼得。更鲁棒的水印往往需要更强的偏置,而偏置越强,对模型行为的扰动就越大。此次发现可以看作这一张力在安全侧付出的代价,而过去业界更多讨论的是它在文本质量和可读性上的代价。

争议与待解问题

需要指出的是,目前公开的信息仍不足以断言所有水印方案都会导致类似后果。不同算法的介入深度差异很大:有些只在后处理阶段改写文本,有些则深度嵌入解码逻辑,风险画像并不一致。此外,模型规模、对齐强度、采样温度等变量都可能影响结果的可复现性,跨模型、跨版本的验证仍是必要的后续工作。

对模型厂商而言,合理的应对是把“带水印的安全评测”纳入常规流程,并在水印强度与安全裕度之间建立明确的权衡标准,而不是把水印当成一个与安全无关的开关。对研究者而言,这提示了一个更普遍的问题:无论是水印、引导解码,还是推理期干预,只要它改变了输出分布,就应当被纳入安全评估范围。

编者按

水印与安全长期被视为两条平行的赛道,这项研究把它们拉到了同一张桌子上。真正值得关注的,不是某一种水印是否“有毒”,而是行业长期默认的一个假设——后处理与解码层的改动是行为中立的。当模型被同时要求“可溯源”和“不可被滥用”时,这两个目标之间可能存在此前未被量化的冲突。监管者若只盯着水印的合规打勾,而忽略它对安全对齐的影响,最终可能收获的是一种虚假的安全感。对用户来说,短期内的现实影响有限,但它揭示的方向令人不安:AI安全不是一道一次性的闸门,而是由训练、解码、部署层层叠加的连续体,任何一层被改写,整体行为都可能随之漂移。

本文编译自Ars Technica