有一天,
你花了很久寫完一篇文章。
不是叫 ChatGPT 寫。
不是叫 Claude 改寫。
而是:
自己想、
自己寫、
自己刪、
自己重寫。
結果把文章丟進 AI 偵測器,
螢幕跳出來:
100% AI。
你會怎麼證明:
「這真的是我寫的」?
今年一篇得獎短篇小說,
就真的遇到了類似的事情。
而且事情最後甚至變成:
一個 AI 說它很像 AI,但人類主辦方查完創作證據後,卻決定相信作者。
一篇得獎小說,突然被判成「100% AI」
故事叫:
The Serpent in the Grove。
作者是來自 Trinidad and Tobago 的 Jamir Nazir。
這篇作品先拿下 2026 Commonwealth Short Story Prize 的加勒比海區域獎。
後來又成為整個比賽的年度總冠軍。
但在區域得獎名單公布後,
網路上很快有人開始懷疑:
這篇小說是不是 AI 寫的?
有人注意到它的句型、
比喻、
節奏
看起來很像現在大型語言模型常產生的文字。
接著有人把全文丟進 AI 偵測工具 Pangram。
結果:
100% AI-generated。
事情從「讀者覺得怪怪的」,
瞬間變成:
「連 AI detector 都說是 100%。」
問題是:100% 到底代表什麼?
看到「100% AI」,
人的直覺很容易把它理解成:
這個系統已經查明:
每一個字都是 AI 寫的。
但其實不是這樣。
Nature 最近專門調查新一代 AI detection 工具時,
訪問 Pangram 創辦人 Max Spero。
他解釋,
Pangram 會先把文章切成不同區段,
再判斷每一段比較可能是:
人寫的、
AI 寫的,
或兩者混合。
最後再根據被判定為 AI 的區段比例形成整體結果。
所以:
100% AI 並不等於它知道每一個字的作者是 AI。
更精確的意思是:
它分析的各個區段,
都被模型判斷成「比較像 AI」。
這是一個分類結果。
不是現場錄影。
也不是數位指紋。
更不是看到 ChatGPT 親自把文字打出來。
這就像臉部辨識說「很像」,不等於法院已經判決
AI detector 本質上做的是:
找模式。
它可能觀察:
句子怎麼排列、
哪些字容易一起出現、
段落節奏、
語言結構、
語意模式,
再和大量:
人類文字
與
AI 文字
比較。
最後回答:
「這一篇比較像哪一邊?」
這種工具可以非常有用。
甚至可以非常準。
但「非常準」仍然和「永遠不會錯」是兩回事。
假設一個系統的誤判率已經非常低。
只要拿去掃描:
幾十萬篇學生作文、
幾百萬份求職文件、
大量投稿文章,
低機率事件還是一定會發生在某些真人身上。
而被判錯的那一個人,
面對的不是:
「系統平均而言很準。」
他面對的是:
「現在我要怎麼證明自己沒有作弊?」
Commonwealth Foundation 最後沒有直接相信 AI detector
這件事後來真正值得看的地方,
不是 Pangram 到底準不準。
而是比賽主辦方最後怎麼處理。
Commonwealth Foundation 表示,
他們花了大約一個月調查 AI 使用指控。
而且刻意沒有把:
「AI detector 顯示什麼」
當成最終證據。
主辦方和所有區域得獎者詳細討論創作過程。
並查看:
工作草稿、
有時間紀錄的文件、
創作筆記,
以及作品如何逐步形成的相關證據。
6 月 22 日,
Commonwealth Foundation 最後公開表示:
在諮詢評審並考慮所有可取得資料後,
他們認為 AI 沒有被用來撰寫這些得獎作品。
之後,
Jamir Nazir 不但保住區域冠軍,
6 月 30 日還正式拿下 2026 年整體 Commonwealth Short Story Prize。
這件事形成了一個非常強烈的對比:
AI detector:100% AI。
完整人工調查:接受作者的創作證據。
那到底應該相信誰?
這裡其實不能簡單變成:
「你看,AI detector 都是垃圾。」
這樣也不對。
新一代 AI detector 的確已經進步很多。
Nature 在 8 月 25 日的調查指出,
目前表現較好的工具,
像 Pangram、GPTZero,
在辨識完全由 AI 產生的文字上,
已經比早期工具強很多。
對最基本的 AI 生成文字,
部分測試甚至能抓到接近全部。
所以:
AI detection 不是完全沒有價值。
真正的問題是:
我們拿它來做什麼?
當「線索」和當「判決」,是完全不同的兩件事
如果老師收到一篇作文,
AI detector 顯示高度疑似 AI,
合理的下一步可能是:
再看看學生過去的寫作。
問他文章怎麼形成。
要求提供草稿。
請他解釋自己的論點。
確認修改紀錄。
這時候 AI detector 是:
一個提醒。
但如果流程變成:
AI detector 顯示 95%。
所以直接零分。
那個工具就從:
提供線索,
變成:
替人定罪。
兩者風險完全不一樣。
因為 AI 寫作和人類寫作,正在慢慢混在一起
事情還有另一個更麻煩的地方。
以前我們可以想像:
A 類:
全部由人寫。
B 類:
全部由 AI 寫。
然後 AI detector 只要分辨 A 和 B。
但現在真實世界根本不是這麼乾淨。
有人:
自己寫第一稿,
叫 AI 修文法。
有人:
自己做研究,
叫 AI 整理結構。
有人:
用 AI 翻譯訪談,
再自己改寫。
有人:
先叫 AI brainstorming,
最後全文自己寫。
還有人:
AI 寫第一稿,
自己大量重寫。
所以現在真正的問題可能不是:
「人還是 AI?」
而是:
「AI 到底參與到什麼程度?」
這比二選一難得多。
Nature 自己就遇到一個很有意思的案例
Nature 最近測試 Pangram 時,
拿一篇研究出版相關文章去掃描。
結果舊版 Pangram 把它判成:
100% AI。
作者 Elena Vicario 表示,
文章的初稿與核心想法都是由她自己產生,
AI 只是用來協助潤飾文字。
後續文章又經過編輯修改。
也就是說,
就算 detector 很成功地感覺到:
「這篇文字裡有 AI 的痕跡」,
它仍然很難回答另一個問題:
到底有多少內容是 AI 創作?
Pangram 創辦人自己也承認,
處理這種:
人寫、
AI 修、
人再編輯
的混合文字,
仍然有很大的改善空間。
甚至改幾個地方,分數就可能明顯變動
Nature 還提到一個現象:
jitter。
意思是:
對一些人類與 AI 混合編輯的文件,
只做一些小修改,
偵測結果就可能明顯改變。
另外,
同一句話單獨拿出來分析,
和放在整篇文章裡分析,
結果也可能不同。
原因之一是 detector 不是只看:
「這一句長得像不像 AI。」
它還會受到:
前後段落、
區塊切法、
整體文章模式
影響。
所以精確到說:
「這一句有 87% 是 AI 寫的。」
其實很容易給人一種:
比工具真正能力更精確的錯覺。
這件事對學生的影響可能比作家更大
小說家至少還有機會:
公開回應、
接受採訪、
拿出創作紀錄。
但想像一個大學生。
他申請研究所。
花幾個星期寫 personal statement。
結果學校用 AI detector 掃描後,
認為他的文件由 AI 產生。
Nature 今年 7 月就報導,
有美國學生看到部分研究所申請頁面直接警告:
如果 personal statement 被認為由 AI 撰寫,
整份申請可能被忽略。
這時候 AI detector 的錯誤,
可能不是少一個分數。
而是:
失去一次升學機會。
所以工具準不準,
只是第一個問題。
第二個更重要的問題是:
被它影響的人,有沒有申訴機會?
真正公平的做法,應該保留「創作過程」
Jamir Nazir 這個案例最後能被重新檢視,
一個重要原因就是:
主辦方沒有只看最後成品。
而是回頭看:
草稿、
時間紀錄、
筆記、
創作過程。
這其實也給今天所有使用 AI 的人一個很實際的提醒。
如果你的工作非常重視:
原創性、
學術誠信、
作者身份、
創作過程,
那麼未來最好的證明,
可能不是最後拿一個 detector 去互相對打。
而是從一開始就留下:
版本紀錄、
草稿、
研究筆記、
來源、
修改歷程。
因為這些東西真正回答的是:
「這篇內容是怎麼形成的?」
而不是只回答:
「最後這篇文字看起來像誰寫的?」
甚至「寫得太像 AI」可能開始影響人類寫作
這件事情如果繼續發展,
還可能產生一個非常奇怪的副作用。
假設大家開始知道:
某些句型、
某些結構、
某些寫作習慣
比較容易被 detector 判成 AI。
那人類會開始怎麼做?
可能刻意避免那些句子。
刻意寫得不規則。
甚至刻意把文章寫得:
比較不像 AI。
Nature Human Behaviour 今年就提醒:
如果學校和出版機構過度依賴固定語言特徵來判斷 AI,
最後可能反過來改變人類寫作。
也就是:
我們不是在教 AI 模仿人。
而是人開始為了證明自己不是 AI,
改變自己的寫法。
這會是一個非常奇怪的世界。
最危險的不是 AI detector 會犯錯,而是我們忘了它在「判斷」
AI detector 最容易製造的一種錯覺,
就是那個:
很漂亮、
很確定、
很像答案的百分比。
87%。
96%。
100%。
數字看起來非常客觀。
但別忘了,
背後仍然是一個模型。
它沒有看到:
你昨晚坐在桌前寫作。
沒有看到:
你刪掉哪一句。
不知道:
那個比喻為什麼會出現在腦中。
它看到的是:
最後留下來的文字模式。
然後做出分類。
所以真正成熟的用法不是:
完全拒絕 AI detection。
而是知道:
它適合回答什麼,
又不能回答什麼。
它可以說:
「這裡值得再檢查。」
但如果事情會影響:
成績、
錄取、
名譽、
獎項、
工作機會,
那最後就不應該只剩一句:
「因為 AI 說你像 AI。」
真正需要的,
仍然是:
更多證據、
完整脈絡,
以及人類願意重新看一次的程序。
因為在 AI 愈來愈會模仿人的世界,
我們可能會遇到一個很諷刺的問題:
有一天,人類最大的麻煩,可能不是被 AI 冒充。
而是:
自己寫的東西,卻必須證明自己不是 AI。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。