
编辑
新智元报道
刚刚,ChatGPT写的字里,要开始逐词「埋暗号」了!
这套水印叫textGrain。模型每挑一个词,都会悄悄掺进一把只有OpenAI知道的密钥。
肉眼看不出任何痕迹,读起来和原来没有两样,可检测器一扫,立刻就能认出这段话是不是出自OpenAI的模型。
从此,你让AI代写的作业、简历、周报,只要原样复制粘贴,就可能被当场认出来。
编辑
划重点,这次发布最关键的有四条。
1. 即刻生效:全球API客户今天就能自行开启水印,ChatGPT和Codex也将在未来几周陆续接入。
2. 检出率高:误报率控制在1%时,一段400个token的心理学类回答,九成以上能被检出。OpenAI还放出狠话,效果追平甚至超过谷歌的SynthID。
3. 性能几乎无损:旗舰模型GPT-6 Astra加上水印后,8项核心跑分基本持平,有5项甚至略涨。
4. 检测权受控:检测器暂不对公众开放,只发给审核通过的研究者和专业机构,textGrain本身则会开源。
AI写作的「实名制时代」,正式拉开大幕。
编辑
至此,谷歌、Anthropic、OpenAI三巨头,全部给AI写的字装上了「身份证」
1781年的搬土难题,被搬进了ChatGPT
大模型写字,每次只往外吐一个词。吐之前,它会给所有候选词各打一个概率,再按概率抽一个出来。
比如「The morning was ___」(早上天气很____)后面,「warm」占30%,「cold」占25%,其余几个词分掉剩下的。
水印要做的,就是让这次抽签悄悄听密钥的话。
但有一条铁律不能破,叫「无偏」。把所有可能的密钥平均起来,每个词被抽中的概率必须和原来一模一样。
这样,不知道密钥的人看到的就是完全正常的随机文字,模型想说的话也一点没变。
编辑
当年Scott Aaronson在OpenAI做的第一版水印,满足了无偏,却留下一个毛病——
同一个问题、同一把密钥,模型每一步都会选同一个词,同一个问题问十遍,回答可能一字不差。
而textGrain的解法,则是来自一个有近250年历史的数学问题,最优传输。
它的起点,真的是「搬土」。
编辑
1781年,法国数学家蒙日琢磨过一个很具体的问题。一堆土要填进另一个坑,每一份土运到哪儿,总运费才最低。
到了20世纪40年代,苏联数学家康托洛维奇把问题放宽,一份土可以拆开运往多处,只要两头的总量对得上。搬土问题由此变成了线性规划。
康托洛维奇后来凭最优资源配置理论,和库普曼斯分享了1975年诺贝尔经济学奖。
巧的是,库普曼斯正是耶鲁的经济学家,而这篇技术报告的作者之一、耶鲁经济学家陈晓红,如今坐的就是以他命名的讲席。
再往后,2010年菲尔兹奖得主维拉尼把最优传输和几何、概率、偏微分方程打通。
2013年,Marco Cuturi引入熵正则化和Sinkhorn算法,把原本昂贵的计算大幅提速,最优传输这才成了机器学习里的常用工具。
两个多世纪后,textGrain把这条数学链条搬进了大模型。只不过这一次,被搬来搬去的换成了下一个词的概率。
https://pd.qq.com/g/pd38647786/post/B_82b9c36a693d0300144115
textGrain的核心想法,是给水印设一笔「随机性预算」。
论文证明了一条恒等式。水印让选词和密钥之间多出来的关联,恰好等于模型平均损失掉的随机性,两边是同一个量。
水印获得多少统计关联,就要付出多少随机性,分毫不差。
于是OpenAI可以事先定好一个比例,规定水印最多花掉原本随机性的多少。比如定为0.2,平均下来至少保留八成随机性,留给回答的多样性。
具体过程,分为三步。
第一步,密钥和前文一起,把候选词随机分成几组,每组的概率加在一起。
图里的六个词被分成三组,「warm、calm」占0.40,「cold、sunny」占0.35,「mild、bright」占0.25。分组以后只需要在几个组之间分配概率即可。
第二步,OpenAI相当于准备了4套「偏心」方案,图里的4列就是这4套方案。
密钥给每个「组×方案」的格子生成一个随机分数,再用带熵约束的最优传输,借Sinkhorn算法一遍遍修正行和列,把概率尽量往高分格子上挪,挪到预算用完为止。
每套方案各偏向不同的组,4套平均下来,每组的概率仍然是0.40、0.35、0.25,谁也不偏。
第三步,密钥选中其中一套。图里选中的是第2列,「cold、sunny」这组的概率就从0.35被提到了0.69。
再在组里按原来25比10的比例挑词,写下了「cold」。
不知道密钥的人,看到的是一次正常的抽签;手握密钥的人,知道这一步本该偏向哪一组。
检测时,要回答的其实只有一个问题,这段文字的选词,是不是总「碰巧」踩中密钥指定的偏好。
普通人写的字和密钥毫无关系,每个位置的分数都是纯随机的,总分落在哪个范围,可以用一个现成的概率分布精确算出来。
而带水印的文字,则会踩在高分格子上,因此总分也会高得离谱。
整个检测只需要原文和密钥,既不用请出模型,也不用知道生成时的预算设了多少。













