有一天,
你花了很久写完一篇文章。
不是叫 ChatGPT 写。
不是叫 Claude 改写。
而是:
自己想、
自己写、
自己删、
自己重写。
结果把文章丢进 AI 侦测器,
屏幕跳出来:
100% AI。
你会怎么证明:
「这真的是我写的」?
今年一篇得奖短篇小说,
就真的遇到了类似的事情。
而且事情最后甚至变成:
一个 AI 说它很像 AI,但人类主办方查完创作证据后,却决定相信作者。
一篇得奖小说,突然被判成「100% AI」
故事叫:
The Serpent in the Grove。
作者是来自 Trinidad and Tobago 的 Jamir Nazir。
这篇作品先拿下 2026 Commonwealth Short Story Prize 的加勒比海区域奖。
后来又成为整个比赛的年度总冠军。
但在区域得奖名单公布后,
网络上很快有人开始怀疑:
这篇小说是不是 AI 写的?
有人注意到它的句型、
比喻、
节奏
看起来很像现在大型语言模型常产生的文字。
接着有人把全文丢进 AI 侦测工具 Pangram。
结果:
100% AI-generated。
事情从「读者觉得怪怪的」,
瞬间变成:
「连 AI detector 都说是 100%。」
问题是:100% 到底代表什么?
看到「100% AI」,
人的直觉很容易把它理解成:
这个系统已经查明:
每一个字都是 AI 写的。
但其实不是这样。
Nature 最近专门调查新一代 AI detection 工具时,
访问 Pangram 创办人 Max Spero。
他解释,
Pangram 会先把文章切成不同区段,
再判断每一段比较可能是:
人写的、
AI 写的,
或两者混合。
最后再根据被判定为 AI 的区段比例形成整体结果。
所以:
100% AI 并不等于它知道每一个字的作者是 AI。
更精确的意思是:
它分析的各个区段,
都被模型判断成「比较像 AI」。
这是一个分类结果。
不是现场录像。
也不是数字指纹。
更不是看到 ChatGPT 亲自把文字打出来。
这就像脸部辨识说「很像」,不等于法院已经判决
AI detector 本质上做的是:
找模式。
它可能观察:
句子怎么排列、
哪些字容易一起出现、
段落节奏、
语言结构、
语意模式,
再和大量:
人类文字
与
AI 文字
比较。
最后回答:
「这一篇比较像哪一边?」
这种工具可以非常有用。
甚至可以非常准。
但「非常准」仍然和「永远不会错」是两回事。
假设一个系统的误判率已经非常低。
只要拿去扫描:
几十万篇学生作文、
几百万份求职文档、
大量投稿文章,
低概率事件还是一定会发生在某些真人身上。
而被判错的那一个人,
面对的不是:
「系统平均而言很准。」
他面对的是:
「现在我要怎么证明自己没有作弊?」
Commonwealth Foundation 最后没有直接相信 AI detector
这件事后来真正值得看的地方,
不是 Pangram 到底准不准。
而是比赛主办方最后怎么处理。
Commonwealth Foundation 表示,
他们花了大约一个月调查 AI 使用指控。
而且刻意没有把:
「AI detector 显示什么」
当成最终证据。
主办方和所有区域得奖者详细讨论创作过程。
并查看:
工作草稿、
有时间纪录的文档、
创作笔记,
以及作品如何逐步形成的相关证据。
6 月 22 日,
Commonwealth Foundation 最后公开表示:
在咨询评审并考虑所有可取得数据后,
他们认为 AI 没有被用来撰写这些得奖作品。
之后,
Jamir Nazir 不但保住区域冠军,
6 月 30 日还正式拿下 2026 年整体 Commonwealth Short Story Prize。
这件事形成了一个非常强烈的对比:
AI detector:100% AI。
完整人工调查:接受作者的创作证据。
那到底应该相信谁?
这里其实不能简单变成:
「你看,AI detector 都是垃圾。」
这样也不对。
新一代 AI detector 的确已经进步很多。
Nature 在 8 月 25 日的调查指出,
目前表现较好的工具,
像 Pangram、GPTZero,
在辨识完全由 AI 产生的文字上,
已经比早期工具强很多。
对最基本的 AI 生成文字,
部分测试甚至能抓到接近全部。
所以:
AI detection 不是完全没有价值。
真正的问题是:
我们拿它来做什么?
当「线索」和当「判决」,是完全不同的两件事
如果老师收到一篇作文,
AI detector 显示高度疑似 AI,
合理的下一步可能是:
再看看学生过去的写作。
问他文章怎么形成。
要求提供草稿。
请他解释自己的论点。
确认修改纪录。
这时候 AI detector 是:
一个提醒。
但如果流程变成:
AI detector 显示 95%。
所以直接零分。
那个工具就从:
提供线索,
变成:
替人定罪。
两者风险完全不一样。
因为 AI 写作和人类写作,正在慢慢混在一起
事情还有另一个更麻烦的地方。
以前我们可以想像:
A 类:
全部由人写。
B 类:
全部由 AI 写。
然后 AI detector 只要分辨 A 和 B。
但现在真实世界根本不是这么干净。
有人:
自己写第一稿,
叫 AI 修文法。
有人:
自己做研究,
叫 AI 整理结构。
有人:
用 AI 翻译访谈,
再自己改写。
有人:
先叫 AI brainstorming,
最后全文自己写。
还有人:
AI 写第一稿,
自己大量重写。
所以现在真正的问题可能不是:
「人还是 AI?」
而是:
「AI 到底参与到什么程度?」
这比二选一难得多。
Nature 自己就遇到一个很有意思的案例
Nature 最近测试 Pangram 时,
拿一篇研究出版相关文章去扫描。
结果旧版 Pangram 把它判成:
100% AI。
作者 Elena Vicario 表示,
文章的初稿与内核想法都是由她自己产生,
AI 只是用来协助润饰文字。
后续文章又经过编辑修改。
也就是说,
就算 detector 很成功地感觉到:
「这篇文字里有 AI 的痕迹」,
它仍然很难回答另一个问题:
到底有多少内容是 AI 创作?
Pangram 创办人自己也承认,
处理这种:
人写、
AI 修、
人再编辑
的混合文字,
仍然有很大的改善空间。
甚至改几个地方,分数就可能明显变动
Nature 还提到一个现象:
jitter。
意思是:
对一些人类与 AI 混合编辑的文档,
只做一些小修改,
侦测结果就可能明显改变。
另外,
同一句话单独拿出来分析,
和放在整篇文章里分析,
结果也可能不同。
原因之一是 detector 不是只看:
「这一句长得像不像 AI。」
它还会受到:
前后段落、
区块切法、
整体文章模式
影响。
所以精确到说:
「这一句有 87% 是 AI 写的。」
其实很容易给人一种:
比工具真正能力更精确的错觉。
这件事对学生的影响可能比作家更大
小说家至少还有机会:
公开回应、
接受采访、
拿出创作纪录。
但想像一个大学生。
他申请研究所。
花几个星期写 personal statement。
结果学校用 AI detector 扫描后,
认为他的文档由 AI 产生。
Nature 今年 7 月就报导,
有美国学生看到部分研究所申请页面直接警告:
如果 personal statement 被认为由 AI 撰写,
整份申请可能被忽略。
这时候 AI detector 的错误,
可能不是少一个分数。
而是:
失去一次升学机会。
所以工具准不准,
只是第一个问题。
第二个更重要的问题是:
被它影响的人,有没有申诉机会?
真正公平的做法,应该保留「创作过程」
Jamir Nazir 这个案例最后能被重新查看,
一个重要原因就是:
主办方没有只看最后成品。
而是回头看:
草稿、
时间纪录、
笔记、
创作过程。
这其实也给今天所有使用 AI 的人一个很实际的提醒。
如果你的工作非常重视:
原创性、
学术诚信、
作者身份、
创作过程,
那么未来最好的证明,
可能不是最后拿一个 detector 去互相对打。
而是从一开始就留下:
版本纪录、
草稿、
研究笔记、
来源、
修改历程。
因为这些东西真正回答的是:
「这篇内容是怎么形成的?」
而不是只回答:
「最后这篇文字看起来像谁写的?」
甚至「写得太像 AI」可能开始影响人类写作
这件事情如果继续发展,
还可能产生一个非常奇怪的副作用。
假设大家开始知道:
某些句型、
某些结构、
某些写作习惯
比较容易被 detector 判成 AI。
那人类会开始怎么做?
可能刻意避免那些句子。
刻意写得不规则。
甚至刻意把文章写得:
比较不像 AI。
Nature Human Behaviour 今年就提醒:
如果学校和出版机构过度依赖固定语言特征来判断 AI,
最后可能反过来改变人类写作。
也就是:
我们不是在教 AI 模仿人。
而是人开始为了证明自己不是 AI,
改变自己的写法。
这会是一个非常奇怪的世界。
最危险的不是 AI detector 会犯错,而是我们忘了它在「判断」
AI detector 最容易制造的一种错觉,
就是那个:
很漂亮、
很确定、
很像答案的百分比。
87%。
96%。
100%。
数字看起来非常客观。
但别忘了,
背后仍然是一个模型。
它没有看到:
你昨晚坐在桌前写作。
没有看到:
你删掉哪一句。
不知道:
那个比喻为什么会出现在脑中。
它看到的是:
最后留下来的文字模式。
然后做出分类。
所以真正成熟的用法不是:
完全拒绝 AI detection。
而是知道:
它适合回答什么,
又不能回答什么。
它可以说:
「这里值得再检查。」
但如果事情会影响:
成绩、
录取、
名誉、
奖项、
工作机会,
那最后就不应该只剩一句:
「因为 AI 说你像 AI。」
真正需要的,
仍然是:
更多证据、
完整脉络,
以及人类愿意重新看一次的进程。
因为在 AI 愈来愈会模仿人的世界,
我们可能会遇到一个很讽刺的问题:
有一天,人类最大的麻烦,可能不是被 AI 冒充。
而是:
自己写的东西,却必须证明自己不是 AI。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。