有一天,

你花了很久写完一篇文章。

不是叫 ChatGPT 写。

不是叫 Claude 改写。

而是:

自己想、

自己写、

自己删、

自己重写。

结果把文章丢进 AI 侦测器,

屏幕跳出来:

100% AI。

你会怎么证明:

「这真的是我写的」?

今年一篇得奖短篇小说,

就真的遇到了类似的事情。

而且事情最后甚至变成:

一个 AI 说它很像 AI,但人类主办方查完创作证据后,却决定相信作者。

一篇得奖小说,突然被判成「100% AI」

故事叫:

The Serpent in the Grove。

作者是来自 Trinidad and Tobago 的 Jamir Nazir。

这篇作品先拿下 2026 Commonwealth Short Story Prize 的加勒比海区域奖。

后来又成为整个比赛的年度总冠军。

但在区域得奖名单公布后,

网络上很快有人开始怀疑:

这篇小说是不是 AI 写的?

有人注意到它的句型、

比喻、

节奏

看起来很像现在大型语言模型常产生的文字。

接着有人把全文丢进 AI 侦测工具 Pangram。

结果:

100% AI-generated。

事情从「读者觉得怪怪的」,

瞬间变成:

「连 AI detector 都说是 100%。」

问题是:100% 到底代表什么?

看到「100% AI」,

人的直觉很容易把它理解成:

这个系统已经查明:

每一个字都是 AI 写的。

但其实不是这样。

Nature 最近专门调查新一代 AI detection 工具时,

访问 Pangram 创办人 Max Spero。

他解释,

Pangram 会先把文章切成不同区段,

再判断每一段比较可能是:

人写的、

AI 写的,

或两者混合。

最后再根据被判定为 AI 的区段比例形成整体结果。

所以:

100% AI 并不等于它知道每一个字的作者是 AI。

更精确的意思是:

它分析的各个区段,

都被模型判断成「比较像 AI」。

这是一个分类结果。

不是现场录像。

也不是数字指纹。

更不是看到 ChatGPT 亲自把文字打出来。

这就像脸部辨识说「很像」,不等于法院已经判决

AI detector 本质上做的是:

找模式。

它可能观察:

句子怎么排列、

哪些字容易一起出现、

段落节奏、

语言结构、

语意模式,

再和大量:

人类文字

AI 文字

比较。

最后回答:

「这一篇比较像哪一边?」

这种工具可以非常有用。

甚至可以非常准。

但「非常准」仍然和「永远不会错」是两回事。

假设一个系统的误判率已经非常低。

只要拿去扫描:

几十万篇学生作文、

几百万份求职文档、

大量投稿文章,

低概率事件还是一定会发生在某些真人身上。

而被判错的那一个人,

面对的不是:

「系统平均而言很准。」

他面对的是:

「现在我要怎么证明自己没有作弊?」

Commonwealth Foundation 最后没有直接相信 AI detector

这件事后来真正值得看的地方,

不是 Pangram 到底准不准。

而是比赛主办方最后怎么处理。

Commonwealth Foundation 表示,

他们花了大约一个月调查 AI 使用指控。

而且刻意没有把:

「AI detector 显示什么」

当成最终证据。

主办方和所有区域得奖者详细讨论创作过程。

并查看:

工作草稿、

有时间纪录的文档、

创作笔记,

以及作品如何逐步形成的相关证据。

6 月 22 日,

Commonwealth Foundation 最后公开表示:

在咨询评审并考虑所有可取得数据后,

他们认为 AI 没有被用来撰写这些得奖作品。

之后,

Jamir Nazir 不但保住区域冠军,

6 月 30 日还正式拿下 2026 年整体 Commonwealth Short Story Prize。

这件事形成了一个非常强烈的对比:

AI detector:100% AI。

完整人工调查:接受作者的创作证据。

那到底应该相信谁?

这里其实不能简单变成:

「你看,AI detector 都是垃圾。」

这样也不对。

新一代 AI detector 的确已经进步很多。

Nature 在 8 月 25 日的调查指出,

目前表现较好的工具,

像 Pangram、GPTZero,

在辨识完全由 AI 产生的文字上,

已经比早期工具强很多。

对最基本的 AI 生成文字,

部分测试甚至能抓到接近全部。

所以:

AI detection 不是完全没有价值。

真正的问题是:

我们拿它来做什么?

当「线索」和当「判决」,是完全不同的两件事

如果老师收到一篇作文,

AI detector 显示高度疑似 AI,

合理的下一步可能是:

再看看学生过去的写作。

问他文章怎么形成。

要求提供草稿。

请他解释自己的论点。

确认修改纪录。

这时候 AI detector 是:

一个提醒。

但如果流程变成:

AI detector 显示 95%。

所以直接零分。

那个工具就从:

提供线索,

变成:

替人定罪。

两者风险完全不一样。

因为 AI 写作和人类写作,正在慢慢混在一起

事情还有另一个更麻烦的地方。

以前我们可以想像:

A 类:

全部由人写。

B 类:

全部由 AI 写。

然后 AI detector 只要分辨 A 和 B。

但现在真实世界根本不是这么干净。

有人:

自己写第一稿,

叫 AI 修文法。

有人:

自己做研究,

叫 AI 整理结构。

有人:

用 AI 翻译访谈,

再自己改写。

有人:

先叫 AI brainstorming,

最后全文自己写。

还有人:

AI 写第一稿,

自己大量重写。

所以现在真正的问题可能不是:

「人还是 AI?」

而是:

「AI 到底参与到什么程度?」

这比二选一难得多。

Nature 自己就遇到一个很有意思的案例

Nature 最近测试 Pangram 时,

拿一篇研究出版相关文章去扫描。

结果旧版 Pangram 把它判成:

100% AI。

作者 Elena Vicario 表示,

文章的初稿与内核想法都是由她自己产生,

AI 只是用来协助润饰文字。

后续文章又经过编辑修改。

也就是说,

就算 detector 很成功地感觉到:

「这篇文字里有 AI 的痕迹」,

它仍然很难回答另一个问题:

到底有多少内容是 AI 创作?

Pangram 创办人自己也承认,

处理这种:

人写、

AI 修、

人再编辑

的混合文字,

仍然有很大的改善空间。

甚至改几个地方,分数就可能明显变动

Nature 还提到一个现象:

jitter。

意思是:

对一些人类与 AI 混合编辑的文档,

只做一些小修改,

侦测结果就可能明显改变。

另外,

同一句话单独拿出来分析,

和放在整篇文章里分析,

结果也可能不同。

原因之一是 detector 不是只看:

「这一句长得像不像 AI。」

它还会受到:

前后段落、

区块切法、

整体文章模式

影响。

所以精确到说:

「这一句有 87% 是 AI 写的。」

其实很容易给人一种:

比工具真正能力更精确的错觉。

这件事对学生的影响可能比作家更大

小说家至少还有机会:

公开回应、

接受采访、

拿出创作纪录。

但想像一个大学生。

他申请研究所。

花几个星期写 personal statement。

结果学校用 AI detector 扫描后,

认为他的文档由 AI 产生。

Nature 今年 7 月就报导,

有美国学生看到部分研究所申请页面直接警告:

如果 personal statement 被认为由 AI 撰写,

整份申请可能被忽略。

这时候 AI detector 的错误,

可能不是少一个分数。

而是:

失去一次升学机会。

所以工具准不准,

只是第一个问题。

第二个更重要的问题是:

被它影响的人,有没有申诉机会?

真正公平的做法,应该保留「创作过程」

Jamir Nazir 这个案例最后能被重新查看,

一个重要原因就是:

主办方没有只看最后成品。

而是回头看:

草稿、

时间纪录、

笔记、

创作过程。

这其实也给今天所有使用 AI 的人一个很实际的提醒。

如果你的工作非常重视:

原创性、

学术诚信、

作者身份、

创作过程,

那么未来最好的证明,

可能不是最后拿一个 detector 去互相对打。

而是从一开始就留下:

版本纪录、

草稿、

研究笔记、

来源、

修改历程。

因为这些东西真正回答的是:

「这篇内容是怎么形成的?」

而不是只回答:

「最后这篇文字看起来像谁写的?」

甚至「写得太像 AI」可能开始影响人类写作

这件事情如果继续发展,

还可能产生一个非常奇怪的副作用。

假设大家开始知道:

某些句型、

某些结构、

某些写作习惯

比较容易被 detector 判成 AI。

那人类会开始怎么做?

可能刻意避免那些句子。

刻意写得不规则。

甚至刻意把文章写得:

比较不像 AI。

Nature Human Behaviour 今年就提醒:

如果学校和出版机构过度依赖固定语言特征来判断 AI,

最后可能反过来改变人类写作。

也就是:

我们不是在教 AI 模仿人。

而是人开始为了证明自己不是 AI,

改变自己的写法。

这会是一个非常奇怪的世界。

最危险的不是 AI detector 会犯错,而是我们忘了它在「判断」

AI detector 最容易制造的一种错觉,

就是那个:

很漂亮、

很确定、

很像答案的百分比。

87%。

96%。

100%。

数字看起来非常客观。

但别忘了,

背后仍然是一个模型。

它没有看到:

你昨晚坐在桌前写作。

没有看到:

你删掉哪一句。

不知道:

那个比喻为什么会出现在脑中。

它看到的是:

最后留下来的文字模式。

然后做出分类。

所以真正成熟的用法不是:

完全拒绝 AI detection。

而是知道:

它适合回答什么,

又不能回答什么。

它可以说:

「这里值得再检查。」

但如果事情会影响:

成绩、

录取、

名誉、

奖项、

工作机会,

那最后就不应该只剩一句:

「因为 AI 说你像 AI。」

真正需要的,

仍然是:

更多证据、

完整脉络,

以及人类愿意重新看一次的进程。

因为在 AI 愈来愈会模仿人的世界,

我们可能会遇到一个很讽刺的问题:

有一天,人类最大的麻烦,可能不是被 AI 冒充。

而是:

自己写的东西,却必须证明自己不是 AI。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

履历明明是投给公司看的,为什么现在可能是 AI 先替你打分数,再决定人类要不要看你?

AI 一分钟教学|2026/08/25:用 Meta AI 看社区成效后,先分成「事实、推测、下一个测试」