如果你開一間二手書店,

有一天突然有人一次買走:

一本老舊農業工具書,

一本 1950 年代賽車手傳記,

一本外文小說,

一本幾十年前的軍艦雜誌,

你大概會想:

這個人到底在研究什麼?

但最近英國與愛爾蘭不少二手書店,

真的開始遇到這種奇怪的客人。

而且不是買十本、二十本。

是幾百本,

甚至幾千本。

Guardian 採訪的英國書商表示,最近幾個月開始收到大量主題毫無關聯的訂單。有人從美國、加拿大、歐洲與英國下單;其中一名匿名書商更表示,今年以來已收到類似買家約 6,000 本書的訂單,而且這些買家願意付高價,大量購買時也不太要求折扣。

這就讓書商開始懷疑:

這些書真的有人要「看」嗎?

還是有人想要的,

其實不是書,

而是裡面的文字?

先說清楚:現在還沒證實是 AI 公司

這一點非常重要。

Guardian 報導的是:

多家二手書店觀察到異常的大量採購,

而一些書商因此懷疑,這些書可能最後會被掃描,拿去做 AI 訓練資料。

但目前沒有證據證明,

這一波神秘訂單背後就是某一家 AI 公司。

甚至連部分書商自己都提出疑問:

有些被買走的書明明早就能免費在網路上找到,

如果真的是拿去訓練 AI,

為什麼還要買實體書?

所以這個故事最有意思的地方,

不是「AI 公司又被抓到了」。

而是:

為什麼在 AI 時代,幾十年前的舊書突然變得值得大量搜尋?

因為最先進的 AI,還是需要吃資料

ChatGPT、Claude 或其他大型語言模型,

不是一出生就懂語言。

它們需要從大量文字裡學習:

一句話通常怎麼接,

不同概念怎麼關聯,

人類怎麼寫故事,

怎麼說明知識,

怎麼表達不同時代與文化的想法。

網路當然是非常大的資料來源。

但問題也慢慢出現了。

現在的網路,

已經和五年前的網路不一樣。

因為今天你看到的一篇文章,

可能是人寫的,

也可能是 AI 寫的,

甚至可能是:

AI 先寫,

人再修改,

另一個 AI 再整理一次。

於是下一個問題就來了:

如果 AI 未來繼續拿網路資料訓練,怎麼知道自己吃到的不是上一代 AI 寫出來的東西?

AI 愈普及,「AI 出現以前的文字」反而可能愈珍貴

這就是老書突然變得有意思的地方。

2026 年的一篇網路文章,

你不一定知道有多少內容曾經經過 AI。

但一本 1983 年印出來的雜誌,

不用猜。

那時候根本沒有今天的生成式 AI。

一本 1970 年出版的地方史,

一本 1950 年的汽車傳記,

甚至一本從來沒有被 Google 完整數位化的冷門書,

都有一個今天突然變得很特別的特徵:

它幾乎可以確定來自人類。

Guardian 報導提到,一個書籍資料庫先前甚至曾用「書架上的書就是 AI 訓練資料」作為市場測試方向,並特別把 2022 年以前出版的內容視為有吸引力,理由正是這些文字比較不容易混入聊天機器人生成內容。該頁面後來已被撤下,業者表示那只是測試市場興趣。

這不是第一次有人為了 AI 大量買實體書

書商之所以會產生這種聯想,

也不是完全沒有前例。

Anthropic 過去就曾大量購買實體書籍,

再把書脊切除,

將書頁掃描成數位內容。

Anthropic 對 Guardian 表示,Claude 的訓練資料來自公開網路資料、商業取得的資料集,以及公司自行產生的資料;公司也表示,取得書籍是大型語言模型產業會使用的一種資料來源。

所以現在二手書商看到:

買家身分模糊,

選書完全沒有主題,

一次大量採購,

又願意支付高價,

自然就會想到:

這會不會又是一波資料收集?

但再次強調,

這次這些訂單的真正用途,目前仍沒有被證實。

為什麼不能只把 AI 寫的內容再餵給 AI?

想像一個學生。

第一年,

老師讓他讀一百本真正的人類作品。

他學完以後,

開始自己寫文章。

第二年,

新的學生進來。

但老師沒有再拿原本那一百本書,

反而拿:

第一個學生寫的文章,

第一個學生的摘要,

第一個學生改寫過的版本,

讓第二個學生繼續學。

到了第三代,

又再讀第二代寫的內容。

久了以後會發生什麼?

原本資料裡的細節、

少數觀點、

特殊寫法,

都有可能慢慢被磨平。

這不代表 AI 生成資料完全不能用。

研究人員確實會使用合成資料訓練與改善模型。

真正的問題是:

你必須知道資料從哪裡來、品質如何,以及裡面到底有多少是人類原始資料。

所以真正有價值的,

不只是「更多文字」。

而是:

來源清楚、品質夠好,而且你知道它是什麼的文字。

這就像種子庫

全世界已經有很多地方建立種子庫。

不是因為現在沒有植物。

而是因為當農業大量使用少數品種之後,

那些比較古老、少見、沒有被取代的種子,

反而可能成為未來重新培育的重要資源。

文字也可能出現類似現象。

網路上的內容只會愈來愈多。

但其中真正能確定:

由人類寫成,

來自特定年代,

有清楚來源,

沒有經過生成式 AI 介入,

這種資料反而可能變得更難找。

於是一本以前只值幾英鎊、

放在角落很多年都沒人翻的書,

突然多出另一種可能的價值:

它保存了一小塊還沒有被生成式 AI 影響過的人類語言。

而且老書裡有網路找不到的東西

還有另一個容易被忽略的問題。

我們常以為:

Google 找不到的東西,

大概就不存在。

其實不是。

世界上還有大量:

地方史,

專業手冊,

舊期刊,

冷門語言作品,

絕版書,

區域性出版品,

私人研究資料,

根本沒有完整數位化。

所以一本非常冷門的舊書,

對普通讀者來說可能完全沒興趣,

對想增加模型資料多樣性的人來說,

卻可能代表網路上根本沒有的內容。

這也是為什麼這些「亂七八糟」的採購,

反而特別引起書商注意。

如果有人是收藏某個主題,

通常會買一整批鐵路書、

汽車書、

軍事書,

或者某個作家的作品。

但現在出現的訂單,

恰恰沒有這種邏輯。

真正稀缺的東西,可能正在改變

AI 熱潮剛開始時,

大家說最缺的是:

GPU。

後來大家發現還缺:

資料中心,

電力,

網路,

變壓器,

甚至土地。

但當模型愈來愈多,

網路也開始出現愈來愈多 AI 生成內容之後,

另一種稀缺資源可能開始浮現:

高品質、來源清楚的人類原始資料。

而它可能藏在非常意想不到的地方。

不是新的資料中心。

不是最先進的晶片工廠。

而是一間幾十年歷史的二手書店裡。

AI 愈進步,人類留下的原始痕跡可能愈重要

這大概是今天這個故事最有趣的反差。

我們一直以為 AI 的方向是:

把所有書數位化,

把所有知識放到網路,

最後實體資料就不重要了。

結果 AI 發展到某個階段後,

可能反過來開始尋找:

那些還沒有被數位世界反覆複製、整理與生成過的內容。

所以今天真正值得思考的,

不是那些神秘買家究竟是不是 AI 公司。

而是:

當 AI 產生的內容愈來愈多,

我們會不會開始重新發現,

「這確定是一個人真正寫下來的」

本身就是一種價值?

幾十年前沒有人想到,

一本老書最珍貴的地方,

有一天可能不是它有多熱門。

而是:

它保存了一段 AI 還沒有出現以前,人類真正寫下來的文字。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

AI 幫你整理好新聞,但如果沒有人再點進原網站,未來誰來採訪真相?

AI 今日早報|2026/07/26:Meta AI 開始自動執行定期任務、印度法院支持 AI 訓練使用新聞、馬來西亞資料中心面臨水電壓力