有一天,

你花了很久寫完一篇文章。

不是叫 ChatGPT 寫。

不是叫 Claude 改寫。

而是:

自己想、

自己寫、

自己刪、

自己重寫。

結果把文章丟進 AI 偵測器,

螢幕跳出來:

100% AI。

你會怎麼證明:

「這真的是我寫的」?

今年一篇得獎短篇小說,

就真的遇到了類似的事情。

而且事情最後甚至變成:

一個 AI 說它很像 AI,但人類主辦方查完創作證據後,卻決定相信作者。

一篇得獎小說,突然被判成「100% AI」

故事叫:

The Serpent in the Grove。

作者是來自 Trinidad and Tobago 的 Jamir Nazir。

這篇作品先拿下 2026 Commonwealth Short Story Prize 的加勒比海區域獎。

後來又成為整個比賽的年度總冠軍。

但在區域得獎名單公布後,

網路上很快有人開始懷疑:

這篇小說是不是 AI 寫的?

有人注意到它的句型、

比喻、

節奏

看起來很像現在大型語言模型常產生的文字。

接著有人把全文丟進 AI 偵測工具 Pangram。

結果:

100% AI-generated。

事情從「讀者覺得怪怪的」,

瞬間變成:

「連 AI detector 都說是 100%。」

問題是:100% 到底代表什麼?

看到「100% AI」,

人的直覺很容易把它理解成:

這個系統已經查明:

每一個字都是 AI 寫的。

但其實不是這樣。

Nature 最近專門調查新一代 AI detection 工具時,

訪問 Pangram 創辦人 Max Spero。

他解釋,

Pangram 會先把文章切成不同區段,

再判斷每一段比較可能是:

人寫的、

AI 寫的,

或兩者混合。

最後再根據被判定為 AI 的區段比例形成整體結果。

所以:

100% AI 並不等於它知道每一個字的作者是 AI。

更精確的意思是:

它分析的各個區段,

都被模型判斷成「比較像 AI」。

這是一個分類結果。

不是現場錄影。

也不是數位指紋。

更不是看到 ChatGPT 親自把文字打出來。

這就像臉部辨識說「很像」,不等於法院已經判決

AI detector 本質上做的是:

找模式。

它可能觀察:

句子怎麼排列、

哪些字容易一起出現、

段落節奏、

語言結構、

語意模式,

再和大量:

人類文字

AI 文字

比較。

最後回答:

「這一篇比較像哪一邊?」

這種工具可以非常有用。

甚至可以非常準。

但「非常準」仍然和「永遠不會錯」是兩回事。

假設一個系統的誤判率已經非常低。

只要拿去掃描:

幾十萬篇學生作文、

幾百萬份求職文件、

大量投稿文章,

低機率事件還是一定會發生在某些真人身上。

而被判錯的那一個人,

面對的不是:

「系統平均而言很準。」

他面對的是:

「現在我要怎麼證明自己沒有作弊?」

Commonwealth Foundation 最後沒有直接相信 AI detector

這件事後來真正值得看的地方,

不是 Pangram 到底準不準。

而是比賽主辦方最後怎麼處理。

Commonwealth Foundation 表示,

他們花了大約一個月調查 AI 使用指控。

而且刻意沒有把:

「AI detector 顯示什麼」

當成最終證據。

主辦方和所有區域得獎者詳細討論創作過程。

並查看:

工作草稿、

有時間紀錄的文件、

創作筆記,

以及作品如何逐步形成的相關證據。

6 月 22 日,

Commonwealth Foundation 最後公開表示:

在諮詢評審並考慮所有可取得資料後,

他們認為 AI 沒有被用來撰寫這些得獎作品。

之後,

Jamir Nazir 不但保住區域冠軍,

6 月 30 日還正式拿下 2026 年整體 Commonwealth Short Story Prize。

這件事形成了一個非常強烈的對比:

AI detector:100% AI。

完整人工調查:接受作者的創作證據。

那到底應該相信誰?

這裡其實不能簡單變成:

「你看,AI detector 都是垃圾。」

這樣也不對。

新一代 AI detector 的確已經進步很多。

Nature 在 8 月 25 日的調查指出,

目前表現較好的工具,

像 Pangram、GPTZero,

在辨識完全由 AI 產生的文字上,

已經比早期工具強很多。

對最基本的 AI 生成文字,

部分測試甚至能抓到接近全部。

所以:

AI detection 不是完全沒有價值。

真正的問題是:

我們拿它來做什麼?

當「線索」和當「判決」,是完全不同的兩件事

如果老師收到一篇作文,

AI detector 顯示高度疑似 AI,

合理的下一步可能是:

再看看學生過去的寫作。

問他文章怎麼形成。

要求提供草稿。

請他解釋自己的論點。

確認修改紀錄。

這時候 AI detector 是:

一個提醒。

但如果流程變成:

AI detector 顯示 95%。

所以直接零分。

那個工具就從:

提供線索,

變成:

替人定罪。

兩者風險完全不一樣。

因為 AI 寫作和人類寫作,正在慢慢混在一起

事情還有另一個更麻煩的地方。

以前我們可以想像:

A 類:

全部由人寫。

B 類:

全部由 AI 寫。

然後 AI detector 只要分辨 A 和 B。

但現在真實世界根本不是這麼乾淨。

有人:

自己寫第一稿,

叫 AI 修文法。

有人:

自己做研究,

叫 AI 整理結構。

有人:

用 AI 翻譯訪談,

再自己改寫。

有人:

先叫 AI brainstorming,

最後全文自己寫。

還有人:

AI 寫第一稿,

自己大量重寫。

所以現在真正的問題可能不是:

「人還是 AI?」

而是:

「AI 到底參與到什麼程度?」

這比二選一難得多。

Nature 自己就遇到一個很有意思的案例

Nature 最近測試 Pangram 時,

拿一篇研究出版相關文章去掃描。

結果舊版 Pangram 把它判成:

100% AI。

作者 Elena Vicario 表示,

文章的初稿與核心想法都是由她自己產生,

AI 只是用來協助潤飾文字。

後續文章又經過編輯修改。

也就是說,

就算 detector 很成功地感覺到:

「這篇文字裡有 AI 的痕跡」,

它仍然很難回答另一個問題:

到底有多少內容是 AI 創作?

Pangram 創辦人自己也承認,

處理這種:

人寫、

AI 修、

人再編輯

的混合文字,

仍然有很大的改善空間。

甚至改幾個地方,分數就可能明顯變動

Nature 還提到一個現象:

jitter。

意思是:

對一些人類與 AI 混合編輯的文件,

只做一些小修改,

偵測結果就可能明顯改變。

另外,

同一句話單獨拿出來分析,

和放在整篇文章裡分析,

結果也可能不同。

原因之一是 detector 不是只看:

「這一句長得像不像 AI。」

它還會受到:

前後段落、

區塊切法、

整體文章模式

影響。

所以精確到說:

「這一句有 87% 是 AI 寫的。」

其實很容易給人一種:

比工具真正能力更精確的錯覺。

這件事對學生的影響可能比作家更大

小說家至少還有機會:

公開回應、

接受採訪、

拿出創作紀錄。

但想像一個大學生。

他申請研究所。

花幾個星期寫 personal statement。

結果學校用 AI detector 掃描後,

認為他的文件由 AI 產生。

Nature 今年 7 月就報導,

有美國學生看到部分研究所申請頁面直接警告:

如果 personal statement 被認為由 AI 撰寫,

整份申請可能被忽略。

這時候 AI detector 的錯誤,

可能不是少一個分數。

而是:

失去一次升學機會。

所以工具準不準,

只是第一個問題。

第二個更重要的問題是:

被它影響的人,有沒有申訴機會?

真正公平的做法,應該保留「創作過程」

Jamir Nazir 這個案例最後能被重新檢視,

一個重要原因就是:

主辦方沒有只看最後成品。

而是回頭看:

草稿、

時間紀錄、

筆記、

創作過程。

這其實也給今天所有使用 AI 的人一個很實際的提醒。

如果你的工作非常重視:

原創性、

學術誠信、

作者身份、

創作過程,

那麼未來最好的證明,

可能不是最後拿一個 detector 去互相對打。

而是從一開始就留下:

版本紀錄、

草稿、

研究筆記、

來源、

修改歷程。

因為這些東西真正回答的是:

「這篇內容是怎麼形成的?」

而不是只回答:

「最後這篇文字看起來像誰寫的?」

甚至「寫得太像 AI」可能開始影響人類寫作

這件事情如果繼續發展,

還可能產生一個非常奇怪的副作用。

假設大家開始知道:

某些句型、

某些結構、

某些寫作習慣

比較容易被 detector 判成 AI。

那人類會開始怎麼做?

可能刻意避免那些句子。

刻意寫得不規則。

甚至刻意把文章寫得:

比較不像 AI。

Nature Human Behaviour 今年就提醒:

如果學校和出版機構過度依賴固定語言特徵來判斷 AI,

最後可能反過來改變人類寫作。

也就是:

我們不是在教 AI 模仿人。

而是人開始為了證明自己不是 AI,

改變自己的寫法。

這會是一個非常奇怪的世界。

最危險的不是 AI detector 會犯錯,而是我們忘了它在「判斷」

AI detector 最容易製造的一種錯覺,

就是那個:

很漂亮、

很確定、

很像答案的百分比。

87%。

96%。

100%。

數字看起來非常客觀。

但別忘了,

背後仍然是一個模型。

它沒有看到:

你昨晚坐在桌前寫作。

沒有看到:

你刪掉哪一句。

不知道:

那個比喻為什麼會出現在腦中。

它看到的是:

最後留下來的文字模式。

然後做出分類。

所以真正成熟的用法不是:

完全拒絕 AI detection。

而是知道:

它適合回答什麼,

又不能回答什麼。

它可以說:

「這裡值得再檢查。」

但如果事情會影響:

成績、

錄取、

名譽、

獎項、

工作機會,

那最後就不應該只剩一句:

「因為 AI 說你像 AI。」

真正需要的,

仍然是:

更多證據、

完整脈絡,

以及人類願意重新看一次的程序。

因為在 AI 愈來愈會模仿人的世界,

我們可能會遇到一個很諷刺的問題:

有一天,人類最大的麻煩,可能不是被 AI 冒充。

而是:

自己寫的東西,卻必須證明自己不是 AI。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

履歷明明是投給公司看的,為什麼現在可能是 AI 先替你打分數,再決定人類要不要看你?

AI 一分鐘教學|2026/08/25:用 Meta AI 看社群成效後,先分成「事實、推測、下一個測試」